Оценка AI-сессий по методологии EDD

★ 7.9 · testing

eval-harness — это скилл для Claude Code, который реализует формальный фреймворк оценки AI-сессий на основе принципов eval-driven development (EDD). Скилл разделяет оценки на два типа: capability evals (проверяют новые возможности агента) и regression evals (защищают от деградации существующего поведения). Для измерения надёжности используются метрики pass@k («хотя бы один успех из k попыток») и pass^k («все k попыток успешны»); типовой целевой показатель — pass@3 > 90%. Поддерживаются три вида грейдеров: code-based (детерминированные bash-проверки), model-based (оценка открытых выводов самим Claude) и human (флаг для ручного ревью). Артефакты хранятся в `.claude/evals/` и версионируются вместе с кодом — подход рассчитан на команды, которым нужно системно контролировать качество AI-агентов при каждом изменении промптов или моделей.