torchtitan — распределённое обучение LLM на PyTorch

★ 7.7 · devops

torchtitan — это скилл для Claude Code, который обеспечивает PyTorch-нативное распределённое предварительное обучение LLM с 4D параллелизмом: FSDP2, tensor parallel, pipeline parallel и context parallel. Скилл охватывает полный цикл: загрузку токенайзера через `download_hf_assets.py`, настройку TOML-конфигов, запуск через `torchrun` или `run_train.sh`, а также мониторинг через TensorBoard и распределённые чекпоинты. Поддерживаются модели Llama 3.1 (8B, 70B, 405B), DeepSeek V3 и кастомные архитектуры — от одной ноды на 8 GPU до кластеров на 512+ GPU с SLURM. Float8 через torchao даёт 30–50% ускорение на H100, а torch.compile дополнительно оптимизирует граф вычислений. Подходит ML-инженерам и исследователям, которым нужно претренировать большие языковые модели с нуля без сторонних фреймворков.