SimPO — выравнивание LLM без эталонной модели
★ 7.7 · ai-tooling
simpo — это скилл для Claude Code, который реализует Simple Preference Optimization: метод выравнивания LLM без эталонной модели, превосходящий DPO на 6.4 пункта по AlpacaEval 2.0. Скилл охватывает полный цикл обучения: конфигурации для Mistral 7B, Llama 3 8B и DeepSeek Math, запуск через Accelerate с DeepSpeed ZeRO-3, настройку гиперпараметров beta и gamma_beta_ratio, а также опциональную SFT-регуляризацию для сохранения исходных способностей модели. Зависимости — torch, transformers, trl, accelerate, Flash Attention 2; рекомендуется оборудование от A100 40GB. Подходит ML-инженерам, которым нужно обучение на предпочтениях (chosen/rejected пары) быстрее и проще, чем DPO или PPO, при ограниченных вычислительных ресурсах и достаточности одноузловой конфигурации. Метод опубликован на NeurIPS 2024.
- #preference-optimization
- #llm-alignment
- #post-training
- #dpo-alternative
- #efficient-training