DeepSpeed — распределённое обучение больших моделей

★ 7.7 · engineering

deepspeed — это скилл для Claude Code, который предоставляет экспертное руководство по распределённому обучению с DeepSpeed: оптимизация ZeRO всех стадий, конвейерный параллелизм, смешанная точность FP16/BF16/FP8, алгоритм 1-bit Adam и разреженное внимание для масштабирования больших моделей на множестве GPU. Скилл охватывает работу с DeepNVMe — высокопроизводительным I/O через NVMe SSD с поддержкой Linux Async I/O и NVIDIA GPUDirect Storage, включая блокирующую, неблокирующую и параллельную запись тензоров. Зависимости включают deepspeed, torch, transformers и accelerate. Подходит разработчикам и исследователям, которые обучают крупные языковые и мультимодальные модели и хотят снизить потребление памяти GPU, ускорить обучение или отладить конфигурацию DeepSpeed.