Аудит целостности ML-экспериментов
★ 7.1 · testing
experiment-audit — это скилл для Claude Code, который проверяет целостность экспериментов перед публикацией результатов, используя кросс-модельную проверку через внешний reviewer backend. Скилл разделяет роли: Claude-исполнитель собирает только пути к файлам (eval-скрипты, файлы результатов, ground truth, трекер экспериментов, черновики статей, конфиги), а независимый рецензент — Codex MCP или Manual Review MCP — самостоятельно читает код и выносит вердикт. Проверяется четыре класса нарушений: поддельный ground truth, нормализация метрик на максимум модели, фантомные числа из несуществующих файлов и недостаточный охват выборки. Подходит исследователям и ML-инженерам, которым нужно убедиться в честности оценки модели перед написанием выводов.
- #experiment-integrity
- #result-validation
- #cross-model-review
- #fraud-detection
- #quality-assurance