Аудит и рефакторинг оценок по чеклисту
engineering
eval-quality-workflow — это скилл для Claude Code, который проверяет или исправляет одну оценку (evaluation) в директории `src/inspect_evals/` согласно всем стандартам `EVALUATION_CHECKLIST.md`. Скилл работает в двух режимах: **fix** — рефакторинг оценки до соответствия стандартам с пошаговым обходом каждого пункта чеклиста и фиксацией результата, и **review** — аудит без внесения изменений с документированием найденных несоответствий. В процессе работы создаются артефакты в `agent_artefacts/<eval_name>/`: файлы `NOTES.md`, `UNCERTAINTIES.md` и итоговый `SUMMARY.md`. Скилл запускает тестовые прогоны оценки командой `uv run inspect eval`, но намеренно не генерирует evaluation report — для этого предусмотрен отдельный скилл `eval-report-workflow`. Подходит командам, которым нужна автоматизированная проверка качества ML-оценок перед сабмитом.
- #evaluation-quality
- #compliance-check
- #refactoring
- #checklist
- #standards