Ray Train — распределённое обучение моделей на кластере

★ 7.7 · orchestration

ray-train — это скилл для Claude Code, который оркестрирует распределённое обучение моделей через Ray Train, масштабируя PyTorch, TensorFlow и HuggingFace с одного GPU до тысяч узлов с минимальными изменениями кода. Скилл покрывает четыре ключевых сценария: перенос существующего PyTorch-кода на мульти-GPU и мульти-нодовые кластеры, интеграцию с HuggingFace Transformers через TransformersTrainer, подбор гиперпараметров с Ray Tune (до 20 trials с ранней остановкой по ASHA), а также чекпоинтинг и отказоустойчивое возобновление обучения. Зависимости — ray[train], torch и transformers. Подойдёт ML-инженерам, которым нужно обучать большие модели на кластере или запускать распределённые гиперпараметрические sweeps без переписывания учебного цикла.