Аудит оценок в Inspect AI

testing

eval-validity-review — это скилл для Claude Code, который проверяет валидность оценок в фреймворке Inspect AI по четырём измерениям: согласованность утверждений, точность названия, возможность успеха и неудачи на образцах, корректность скорера. Скилл читает исходный код задачи, датасет, реализацию скорера, README и eval.yaml, затем создаёт отчёт с находками и рекомендациями в директории agent_artefacts/<artefact_name>/validity/ — без изменения кода оценки. Подходит для аудита существующих eval-ов или как часть рабочего процесса Master Checklist; не предназначен для проверки качества кода или покрытия тестами. Особое внимание уделяется качеству данных: заглушкам, неподтверждённым утверждениям и несоответствию полей в образцах.