Оценка LLM на академических бенчмарках
★ 7.7 · testing
lm-evaluation-harness — это скилл для Claude Code, который оценивает языковые модели на 60+ академических бенчмарках, включая MMLU (57 предметов), HumanEval (164 задачи по Python), GSM8K, TruthfulQA и HellaSwag. Поддерживает модели через HuggingFace, vLLM и API, позволяя запускать стандартные и квантизированные чекпоинты с автоматическим подбором batch size. Индустриальный стандарт, используемый EleutherAI, HuggingFace и крупными исследовательскими лабораториями: результаты сохраняются в JSON с точностью и стандартной ошибкой по каждому заданию. Подходит для сравнения моделей, отслеживания прогресса обучения по чекпоинтам и публикации воспроизводимых результатов в научных работах. Зависимости: lm-eval, transformers, vllm.
- #llm-evaluation
- #benchmarking
- #mmlu
- #humaneval
- #model-comparison