TRL — дообучение LLM с RLHF и DPO

★ 7.7 · ai-tooling

trl-fine-tuning — это скилл для Claude Code, который реализует полный конвейер дообучения больших языковых моделей с помощью библиотеки TRL от HuggingFace. Скилл охватывает четыре метода: SFT (supervised fine-tuning для instruction tuning), DPO (выравнивание по предпочтениям без модели наград), PPO и GRPO (оптимизация политики через подкрепление), а также обучение отдельной reward model. Полный RLHF-пайплайн строится последовательно: SFT → обучение модели наград → PPO-шаг — и позволяет привести модель в соответствие с предпочтениями людей. Зависимости: trl, transformers, datasets, peft, accelerate, torch; в качестве примера базовой модели используется Qwen2.5-0.5B. Подходит ML-инженерам и исследователям, которым нужно выровнять языковую модель по человеческой обратной связи или обучить её следовать инструкциям.