slime — RL-дообучение LLM с Megatron-LM и SGLang
★ 7.7 · ai-tooling
slime — это скилл для Claude Code, который предоставляет руководство по RL post-training LLM с использованием фреймворка slime, созданного командой THUDM (Tsinghua). Фреймворк соединяет Megatron-LM для обучения с SGLang для высокопроизводительной генерации rollout и лежит в основе моделей GLM-4.5, GLM-4.6 и GLM-4.7. Поддерживается полный спектр параллелизма (TP, PP, DP, SP), алгоритм GRPO, асинхронный режим обучения с буферизацией rollout, а также многоходовое агентное обучение с инструментами. Из коробки доступны конфигурационные скрипты для GLM-4.x, Qwen3, DeepSeek V3/R1, Llama 3; данные принимаются в формате JSONL. Скилл ориентирован на исследователей и инженеров, которым нужно масштабируемое RL-обучение с нативной интеграцией Megatron-LM.
- #reinforcement-learning
- #post-training
- #grpo
- #megatron-lm
- #sglang
- #glm-models