Дообучение LLM через LoRA и PEFT

ai-tooling

Fine tuning expert — это скилл для Claude Code, который помогает тонко настраивать большие языковые модели с помощью LoRA, QLoRA адаптеров и PEFT-методов Hugging Face, а также проводить instruction tuning, RLHF, DPO и квантизацию. Берут, когда нужно адаптировать базовую модель под узкую задачу (чат-бот с корпоративным тоном, классификатор документов), когда GPU памяти не хватает для полного обучения и нужен 4-битный QLoRA, или когда хочется настроить модель через OpenAI fine-tuning API без разворачивания собственной инфраструктуры. Внутри — пошаговый воркфлоу: валидация и форматирование JSONL-датасетов, подбор метода PEFT в зависимости от доступной памяти, конфигурация гиперпараметров (learning rate, batch size, cosine scheduler, warmup), мониторинг loss-кривых, бенчмаркинг по perplexity, BLEU/ROUGE и слияние адаптера с базовой моделью для деплоя. Стек — Python, transformers, peft, trl, bitsandbytes; готовые примеры кода для LoRA и QLoRA. Направление — обучение и адаптация модели, а не её запуск в продакшне (для оркестрации инференса смотри смежный скилл devops-engineer). Подойдёт для моделей от небольших до >7B параметров; не подходит, когда данных меньше нескольких сотен примеров без регуляризации — скилл явно предупреждает о риске переобучения.