Enterprise RL-обучение крупных MoE-моделей
★ 7.7 · ai-tooling
miles — это скилл для Claude Code, который предоставляет руководство по enterprise-уровню RL-обучения крупных MoE-моделей с использованием фреймворка miles — production-ready форка slime от Orchestra Research. Скилл охватывает обучение моделей размером 1 ТБ+ (DeepSeek V3, Qwen3-MoE) с FP8/INT4 квантизацией, битово-идентичным выравниванием обучения и инференса через механизм Rollout Routing Replay (R3), а также спекулятивный RL на базе EAGLE-декодинга через SGLang с ускорением роллаутов на 25–40%. Внутри — два ключевых воркфлоу: настройка распределённого обучения с Megatron-LM (tensor/expert parallelism) и запуск спекулятивного RL с опциональным online MTP-обучением черновой модели. Зависимости: sglang-router ≥ 0.2.3, ray, torch ≥ 2.0.0, transformers ≥ 4.40.0. Подходит командам, которым нужна производственная стабильность при дообучении LLM с подкреплением на кластерах H100/H200.
- #reinforcement-learning
- #moe-training
- #quantization
- #llm-training
- #sglang
- #megatron-lm