torchtitan — распределённое обучение LLM на PyTorch
★ 7.7 · devops
torchtitan — это скилл для Claude Code, который обеспечивает PyTorch-нативное распределённое предварительное обучение LLM с 4D параллелизмом: FSDP2, tensor parallel, pipeline parallel и context parallel. Скилл охватывает полный цикл: загрузку токенайзера через `download_hf_assets.py`, настройку TOML-конфигов, запуск через `torchrun` или `run_train.sh`, а также мониторинг через TensorBoard и распределённые чекпоинты. Поддерживаются модели Llama 3.1 (8B, 70B, 405B), DeepSeek V3 и кастомные архитектуры — от одной ноды на 8 GPU до кластеров на 512+ GPU с SLURM. Float8 через torchao даёт 30–50% ускорение на H100, а torch.compile дополнительно оптимизирует граф вычислений. Подходит ML-инженерам и исследователям, которым нужно претренировать большие языковые модели с нуля без сторонних фреймворков.
- #distributed-training
- #torchtitan
- #fsdp2
- #tensor-parallelism
- #pipeline-parallelism
- #llm-pretraining
- #multi-gpu-scaling