Автоматизация отчётов по оценке моделей
documentation
eval-report-workflow — это скилл для Claude Code, который автоматизирует создание отчёта об оценке (evaluation report) для README: выбор моделей, оценка вычислительных затрат, запуск эвалюаций и форматирование итоговых таблиц. Рабочий процесс управляет скриптом `tools/evaluation_report.py`, который читает `report_config.yaml` и генерирует воспроизводимый `report.md` — с таблицей результатов, сравнением с референсом, разбивкой по категориям, суммарным числом токенов и приблизительной стоимостью в USD — а также JSON-копии заголовков логов в папке `results/`. Скилл проводит предварительный тест с лимитом 5 примеров для оценки токенов, отбирает до трёх подходящих моделей (не менее двух разных провайдеров) и рекомендует объём выборки, не превышающей $5 вычислений на модель. Подходит командам, которым нужно документировать и воспроизводить результаты бенчмарков inspect_evals с фиксацией дат, версий библиотек и команд воспроизведения.
- #evaluation-report
- #results-formatting
- #reproducibility
- #documentation
- #metrics