DeepSpeed — распределённое обучение больших моделей
★ 7.7 · engineering
deepspeed — это скилл для Claude Code, который предоставляет экспертное руководство по распределённому обучению с DeepSpeed: оптимизация ZeRO всех стадий, конвейерный параллелизм, смешанная точность FP16/BF16/FP8, алгоритм 1-bit Adam и разреженное внимание для масштабирования больших моделей на множестве GPU. Скилл охватывает работу с DeepNVMe — высокопроизводительным I/O через NVMe SSD с поддержкой Linux Async I/O и NVIDIA GPUDirect Storage, включая блокирующую, неблокирующую и параллельную запись тензоров. Зависимости включают deepspeed, torch, transformers и accelerate. Подходит разработчикам и исследователям, которые обучают крупные языковые и мультимодальные модели и хотят снизить потребление памяти GPU, ускорить обучение или отладить конфигурацию DeepSpeed.
- #deepspeed
- #distributed-training
- #optimization
- #gpu-acceleration
- #large-scale-models