Оценка LLM на академических бенчмарках

★ 7.7 · testing

lm-evaluation-harness — это скилл для Claude Code, который оценивает языковые модели на 60+ академических бенчмарках, включая MMLU (57 предметов), HumanEval (164 задачи по Python), GSM8K, TruthfulQA и HellaSwag. Поддерживает модели через HuggingFace, vLLM и API, позволяя запускать стандартные и квантизированные чекпоинты с автоматическим подбором batch size. Индустриальный стандарт, используемый EleutherAI, HuggingFace и крупными исследовательскими лабораториями: результаты сохраняются в JSON с точностью и стандартной ошибкой по каждому заданию. Подходит для сравнения моделей, отслеживания прогресса обучения по чекпоинтам и публикации воспроизводимых результатов в научных работах. Зависимости: lm-eval, transformers, vllm.