slime — RL-дообучение LLM с Megatron-LM и SGLang

★ 7.7 · ai-tooling

slime — это скилл для Claude Code, который предоставляет руководство по RL post-training LLM с использованием фреймворка slime, созданного командой THUDM (Tsinghua). Фреймворк соединяет Megatron-LM для обучения с SGLang для высокопроизводительной генерации rollout и лежит в основе моделей GLM-4.5, GLM-4.6 и GLM-4.7. Поддерживается полный спектр параллелизма (TP, PP, DP, SP), алгоритм GRPO, асинхронный режим обучения с буферизацией rollout, а также многоходовое агентное обучение с инструментами. Из коробки доступны конфигурационные скрипты для GLM-4.x, Qwen3, DeepSeek V3/R1, Llama 3; данные принимаются в формате JSONL. Скилл ориентирован на исследователей и инженеров, которым нужно масштабируемое RL-обучение с нативной интеграцией Megatron-LM.