Тестирование и сравнение LLM через omniroute CLI

★ 7.9 · testing

cli-eval — это скилл для Claude Code, который позволяет создавать и запускать наборы тестирования LLM-моделей, отслеживать прогресс бенчмарков в реальном времени и сравнивать их результаты прямо из командной строки через CLI-инструмент omniroute. Скилл охватывает полный цикл работы с eval-суитами: создание наборов с рубриками `exact-match`, `contains`, `llm-judge` или `regex`, запуск против конкретной модели (например, `omniroute eval suites run <suiteId> --model gpt-4o --watch`), просмотр scorecards с пополнительными результатами по каждому сэмплу. Для сравнения производительности нескольких моделей — Claude, GPT-4o, Gemini — один и тот же суит запускается в цикле, а полученные оценки сопоставляются. Интеграция с CI-пайплайнами реализована через проверку порогового значения score: если результат опускается ниже заданного уровня, сборка завершается с ошибкой. Подходит командам, которым нужно автоматизировать регрессионное тестирование языковых моделей и контролировать качество ответов при обновлениях.