Регрессионное тестирование MCP-инструментов

★ 7.4 · testing

Оценка пользовательских историй — это скилл для Claude Code, который сравнивает поведение MCP-инструментов между целевой и базовой версиями, используя встроенные и пользовательские сценарии с diff-анализом для выявления регрессий. Берут, когда нужно убедиться, что новая версия MCP-сервера не сломала то, что работало раньше; когда после правки конкретного модуля хочется быстро понять, какие тесты вообще стоит запускать; когда нет времени прогонять всё подряд и нужен умный триаж по изменённым файлам. Внутри — трёхшаговый протокол: сначала вычисляется git diff между тегами или ветками, классифицируются затронутые файлы (инструменты, ядро, утилиты) и автоматически отбираются нужные истории из каталога YAML-сценариев; затем придумывается хотя бы одна кастомная история под конкретную гипотезу регрессии; после этого истории прогоняются сначала на baseline, потом на целевой версии — каждый раз с верификацией через ha_query.py и записью результатов в JSONL. Работает через Bash, Read, Write, Glob, Grep, Task; запускается командой `/bat-story-eval --baseline v6.6.1` с опциональными флагами `--agents`, `--stories`, `--all-stories`, `--model`. Направление — регрессионное тестирование MCP между версиями, а не юнит-тестирование отдельных функций и не нагрузочное тестирование.