PyTorch FSDP2 — распределённое обучение больших моделей
★ 7.7 · engineering
pytorch-fsdp2 — это скилл для Claude Code, который добавляет PyTorch FSDP2 (`fully_shard`) к скриптам обучения с корректной инициализацией, шардированием, настройкой смешанной точности, разгрузкой на CPU и распределённым сохранением контрольных точек. Применяется, когда модель не помещается в память одной GPU или когда нужно DTensor-based шардирование с DeviceMesh для последующей композиции с Tensor Parallel. Скилл обязывает агента запускать обучение через `torchrun`, применять `fully_shard()` снизу вверх — сначала к субмодулям (например, блокам Transformer), затем к корневому модулю, — и создавать оптимизатор уже после шардирования, чтобы он работал с DTensor-параметрами. Контрольные точки сохраняются через Distributed Checkpoint (DCP), а не через наивный `torch.save`. Подходит ML-инженерам, масштабирующим обучение больших моделей на несколько GPU.
- #pytorch
- #fsdp2
- #distributed-training
- #memory-optimization
- #dtensor