verl — обучение LLM методами RL

★ 7.7 · ai-tooling

verl — это скилл для Claude Code, который помогает обучать большие языковые модели методами reinforcement learning с помощью библиотеки verl (Volcano Engine RL) от команды ByteDance Seed. Скилл охватывает алгоритмы PPO, GRPO, DAPO, RLOO, REINFORCE++ и SPIN, поддерживает бэкенды FSDP, FSDP2 и Megatron-LM для обучения, а также vLLM и SGLang для генерации rollout-ов. Архитектура HybridFlow (EuroSys 2025) разделяет управляющий процесс на базе Ray и вычислительные воркеры — ActorRolloutRef, Critic и RewardManager. Библиотека протестирована на моделях от 0.5B до 671B параметров (Qwen-3, Llama-3.1, DeepSeek, Gemma-2) и поддерживает многооборотные rollout-ы с вызовом инструментов, LoRA RL и обучение vision-language моделей. Подходит командам, которым нужен production-ready post-training LLM с гибкой заменой инфраструктурных бэкендов.