Аудит оценок в Inspect AI
testing
eval-validity-review — это скилл для Claude Code, который проверяет валидность оценок в фреймворке Inspect AI по четырём измерениям: согласованность утверждений, точность названия, возможность успеха и неудачи на образцах, корректность скорера. Скилл читает исходный код задачи, датасет, реализацию скорера, README и eval.yaml, затем создаёт отчёт с находками и рекомендациями в директории agent_artefacts/<artefact_name>/validity/ — без изменения кода оценки. Подходит для аудита существующих eval-ов или как часть рабочего процесса Master Checklist; не предназначен для проверки качества кода или покрытия тестами. Особое внимание уделяется качеству данных: заглушкам, неподтверждённым утверждениям и несоответствию полей в образцах.
- #evaluation-framework
- #quality-assurance
- #testing
- #inspect-ai
- #validation