BigCode Evaluation Harness — бенчмаркинг моделей кодогенерации

★ 7.7 · testing

bigcode-evaluation-harness — это скилл для Claude Code, который оценивает модели генерации кода по 15+ бенчмаркам, включая HumanEval (164 задачи), HumanEval+, MBPP, MBPP+ и MultiPL-E на 18 языках программирования, с метриками pass@k. Скилл основан на BigCode Evaluation Harness от BigCode Project и используется в leaderboard HuggingFace как отраслевой стандарт сравнения кодогенерирующих моделей. Поддерживаются квантизованные модели (4-bit), instruction-tuned модели с настройкой токенов, безопасное выполнение кода через Docker для MultiPL-E, а также сохранение генераций и результатов в JSON с показателями pass@1, pass@10, pass@100. Подходит командам ML-инженеров, которые сравнивают качество Code LLM, тестируют многоязычную поддержку или готовят модель к публикации на открытых leaderboard.