OpenRLHF — RLHF-обучение больших языковых моделей

★ 7.7 · ai-tooling

openrlhf — это скилл для Claude Code, который позволяет запускать высокопроизводительное RLHF-обучение больших языковых моделей (7B–70B+) с использованием Ray, vLLM и ZeRO-3. Скилл покрывает полный пайплайн пост-обучения: обучение reward-модели, а затем fine-tuning через PPO, GRPO, RLOO или DPO — причём GRPO работает без critic-модели и экономит память. Распределённая архитектура с GPU resource sharing обеспечивает скорость в 2 раза выше, чем DeepSpeedChat. Подходит командам и исследователям, которым нужно выстроить alignment-обучение на мульти-GPU или мульти-нодовом кластере с единым фреймворком вместо разрозненных инструментов.