GRPO — обучение языковых моделей с подкреплением

★ 7.7 · ai-tooling

grpo-rl-training — это скилл для Claude Code, который предоставляет экспертное руководство по реализации Group Relative Policy Optimization (GRPO) с библиотекой TRL для fine-tuning языковых моделей с пользовательскими функциями вознаграждения. Скилл охватывает подготовку датасетов в chat-формате, проектирование reward-функций (correctness, format, length, style с весами от 0.1 до 2.0), пошаговые рабочие процессы обучения и готовые паттерны для продакшена. Зависимости включают transformers ≥ 4.47.0, trl ≥ 0.14.0, datasets ≥ 3.2.0, peft ≥ 0.14.0 и torch. Подходит для задач, где нужно принудительно задать структурированный вывод (XML, JSON), обучить модель верифицируемым задачам с объективными метриками (математика, код, fact-checking) или улучшить цепочки рассуждений без размеченных preference-пар — там, где DPO и PPO избыточны.