Skills для Claude Code и тестирование
Skills для Claude Code и тесты описывают, как в проекте принято тестировать: что считается достаточным покрытием, какие сценарии обязательны, как именуются кейсы и где проходит граница между юнит-тестом и интеграционным. Без этих правил модель пишет формально корректные тесты, которые проверяют не то, что ломается.
Типичная проблема сгенерированных тестов — они закрепляют реализацию вместо поведения. Тест проверяет, что функция вызвала другую функцию, и падает при любом рефакторинге, ничего не сообщая о работоспособности. Правило «проверяем наблюдаемый результат, а не внутренние вызовы» — ровно то, что фиксируется в скилле.
Вторая частая задача — разбор упавшего прогона. В каскаде из сорока красных тестов настоящая причина обычно одна. Скилл описывает порядок разбора: найти первый упавший, отделить следствия, воспроизвести минимальным примером — и только потом чинить.
В подборке — скиллы для юнит-тестов, E2E-сценариев, работы с покрытием и разбора падений.
Скиллы в подборке
- Тестирование UI в браузере через Chrome DevTools — browser-testing-with-devtools — это скилл для Claude Code, который организует тестирование в реальных браузерах через Chrome DevTools MCP. Агент получает прямой доступ к живому DOM, консольным логам, сетевым запросам, вычисленным стилям, дереву доступности и данным о производительности (Core Web Vitals, paint timing, layout shifts) — вместо статического анализа кода видно то, что происходит в браузере в момент выполнения. Скилл подключается через `chrome-devtools-mcp` и поддерживает изолированный профиль (`--isolated`) или автоподключение к запущенному Chrome (`--autoConnect`). Подходит разработчикам, которые отлаживают UI, диагностируют ошибки рендеринга или верифицируют API-ответы на живом окружении. Требует настроенного MCP-сервера `chrome-devtools` в `.mcp.json` или настройках Claude Code.
- Критическая проверка решений через adversarial review — doubt-driven-development — это скилл для Claude Code, который подвергает каждое нетривиальное решение критическому разбору в свежем контексте перед фиксацией, используя adversarial review с установкой опровергнуть, а не одобрить. Процесс состоит из пяти шагов: CLAIM (формулировка решения), EXTRACT (минимальный артефакт + контракт без авторского reasoning), DOUBT (вызов свежего reviewer с adversarial-промптом), RECONCILE (классификация всех находок) и STOP (условие завершения — тривиальные находки, три цикла или явный override пользователя). Скилл предназначен для orchestrator-сессии: в frontmatter persona его добавлять нельзя, так как это порождало бы вложенный вызов субагента — антипаттерн из orchestration-patterns. Применяется при архитектурных решениях в незнакомом коде, перед коммитом логики с ветвлением, пересечением границ модулей, нарушением инвариантов или необратимыми операциями в production и безопасности — везде, где дешевле проверить сейчас, чем отлаживать потом.
- Многоосевое ревью кода перед слиянием — code-review-and-quality — это скилл для Claude Code, который проводит многоосевое ревью кода перед слиянием изменений. Проверка охватывает пять измерений: корректность (соответствие требованиям, граничные случаи, состояния ошибок), читаемость и простота, архитектура, безопасность и производительность. Скилл применяется к коду любого происхождения — написанному вручную, другим агентом или языковой моделью. По каждой оси он не просто фиксирует проблему, но предлагает конкретное структурное решение: заменить цепочку условий типизированной моделью, вынести логику в нужный модуль, удалить лишний слой абстракции. Стандарт одобрения — изменение улучшает общее качество кодовой базы, даже если не идеально: цель — непрерывное улучшение, а не блокировка ради перфекционизма.
- Разработка через тесты (TDD) — test-driven-development — это скилл для Claude Code, который реализует разработку через тесты: тест пишется до кода, а баг воспроизводится тестом до его исправления. Скилл охватывает полный цикл RED → GREEN → REFACTOR, паттерн Prove-It для фиксов и тестовую пирамиду с распределением ~80% юнит-тестов, ~15% интеграционных и ~5% E2E. Перед первым тестом он обнаруживает стек проекта — читает package.json, pyproject.toml, go.mod, Cargo.toml и CI-конфиги, чтобы использовать правильные команды запуска (./gradlew, make test и подобные), а не глобальные утилиты. Для браузерных изменений скилл рекомендует комбинировать TDD с верификацией через Chrome DevTools MCP. Подходит для любого языка и фреймворка тестирования — при реализации новой логики, рефакторинге или разборе баг-репортов.
- Систематическая отладка и восстановление после ошибок — debugging-and-error-recovery — это скилл для Claude Code, который направляет систематический процесс отладки и восстановления при ошибках: сбоях тестов, проблемах сборки, неожиданном поведении и production-инцидентах. Скилл строится вокруг правила «stop the line»: при любом сбое сначала зафиксировать доказательства, затем пройти шесть шагов — воспроизвести ошибку, локализовать слой (UI, API, БД, build-инструменты, внешние сервисы), сократить до минимального воспроизводящего случая, исправить корневую причину, написать регрессионный тест и верифицировать результат. Включает конкретные паттерны для недетерминированных, зависящих от окружения и state-dependent ошибок, а также инструкции по git bisect для поиска коммита, сломавшего сборку. Подходит разработчикам, которым нужен структурированный подход вместо догадок при отладке регрессий, тестов или runtime-багов.
- Визуальная проверка UI по эталонным скриншотам — visual-verdict — это скилл для Claude Code, который сравнивает сгенерированные скриншоты UI с эталонными изображениями и возвращает строгий JSON-вердикт для управления следующей итерацией правок. Скилл принимает один или несколько reference_images, generated_screenshot и опциональный category_hint (например, dashboard или sns-feed), после чего выдаёт объект с полями score (0–100), verdict (pass / revise / fail), category_match, списками differences и suggestions, а также кратким reasoning. Порог прохождения — 90 баллов: пока score ниже, скилл требует продолжать редактирование и повторный запуск перед любой визуальной проверкой. При сложной диагностике расхождений pixel-diff-инструменты используются как вспомогательный слой, а найденные горячие точки конвертируются в конкретные пункты differences и suggestions. Подходит командам, которым нужна детерминированная автоматизированная проверка визуального соответствия макетам — вёрстка, дизайн-ревью, регрессионное тестирование UI.
- Тестирование Temporal workflows на Python — temporal-python-testing — это скилл для Claude Code, который помогает тестировать Temporal workflows на Python с использованием pytest, time-skipping и стратегий мокирования. Скилл охватывает три уровня тестирования: unit-тесты с WorkflowEnvironment и time-skipping (многомесячные workflows выполняются за секунды), интеграционные тесты с мокированием activities для изоляции логики, и replay-тесты для валидации детерминизма перед деплоем. Ресурсы организованы по файлам — `resources/unit-testing.md`, `resources/integration-testing.md`, `resources/replay-testing.md`, `resources/local-setup.md` — и загружаются по мере необходимости. Подойдёт разработчикам, которым нужно наладить CI/CD-пайплайн для Temporal-приложений, достичь покрытия кода ≥80% или отладить сбои в тестах.
- Автономный контроль качества кода — ultraqa — это скилл для Claude Code, который реализует автономный цикл контроля качества: запускает проверки, диагностирует сбои и применяет исправления до тех пор, пока заданная цель не будет достигнута. Поддерживаются режимы --tests, --build, --lint, --typecheck и --custom с произвольным паттерном успеха; флаг --interactive подключает субагента qa-tester для проверки CLI-сервисов. Каждый цикл из пяти максимально допустимых включает три шага: запуск команды, диагностику через субагента architect (модель Opus) и автоматическое исправление через executor (Sonnet). Если одна и та же ошибка повторяется трижды, скилл завершается досрочно с описанием корневой причины; состояние сессии хранится в .omc/ultraqa-state.json и удаляется при завершении. Подходит командам, которым нужно автоматически довести тесты, сборку или линтинг до зелёного статуса без ручного вмешательства в каждой итерации.
- Аудит доступности по стандарту WCAG 2.2 — wcag-audit-patterns — это скилл для Claude Code, который проводит аудиты доступности по стандарту WCAG 2.2 с автоматизированным тестированием, ручной проверкой и рекомендациями по устранению нарушений. Скилл охватывает принципы POUR (Perceivable, Operable, Understandable, Robust) и три уровня соответствия: A, AA и AAA. Внутри — классификация нарушений по критичности: от отсутствия alt-текста и недоступности элементов с клавиатуры до неверной иерархии заголовков и отсутствия атрибута языка. Подходит командам, которые готовятся к проверкам на соответствие ADA, Section 508 или VPAT, а также разработчикам, внедряющим доступные компоненты с нуля. Детальные шаблоны и разобранные примеры хранятся в файле `references/details.md`.
- Верификация кода перед релизом — verify — это скилл для Claude Code, который превращает расплывчатые утверждения «должно работать» в конкретные доказательства, выполняя проверки до объявления задачи завершённой. Рабочий процесс включает четыре уровня верификации: сначала запуск существующих тестов, затем проверка типов и сборки, потом точечные командные проверки, и в последнюю очередь — ручная валидация с фиксацией наблюдаемых результатов. Скилл сообщает только то, что реально проверено: что прошло, что упало, а что осталось непроверенным — без приукрашивания. Подходит для валидации фич, исправлений и рефакторинга всем, кто хочет уверенности в качестве кода перед релизом или код-ревью.
- Многомерное ревью кода по нескольким критериям — multi-reviewer-patterns — это скилл для Claude Code, который координирует параллельные проверки кода по нескольким измерениям качества: безопасности, производительности, архитектуре, тестированию и доступности. Скилл определяет, какие измерения назначить под конкретный сценарий (например, для изменений API — Security, Performance, Architecture), дедуплицирует находки по правилу «один файл:строка — одна проблема», при конфликтующих оценках выбирает наибольшую severity, а при конфликтующих рекомендациях сохраняет обе с атрибуцией рецензента. На выходе формируется консолидированный отчёт с разбивкой по уровням Critical / High / Medium / Low и сводной таблицей по измерениям. Подходит командам, которым нужно унифицировать многомерное code review и получить структурированный список приоритетных исправлений.
- Параллельная отладка методом конкурирующих гипотез — parallel-debugging — это скилл для Claude Code, который помогает отлаживать сложные проблемы методом анализа конкурирующих гипотез (ACH) с параллельным исследованием, сбором доказательств и арбитражем корневых причин. Скилл генерирует гипотезы по шести категориям отказов: логические ошибки, проблемы с данными, состоянием, интеграцией, ресурсами и окружением. Каждая гипотеза оценивается по доказательной базе с тремя уровнями уверенности и обязательными ссылками на файл и строку кода. Подходит для ситуаций, когда начальные попытки отладки не дали результата, баг затрагивает несколько модулей или нужно избежать confirmation bias при анализе первопричины. Протокол арбитража классифицирует результаты как подтверждённые, правдоподобные, опровергнутые или неопределённые, после чего определяет корневую причину и валидирует исправление по чеклисту.
- Тестирование с экранными читалками NVDA, JAWS и VoiceOver — screen-reader-testing — это скилл для Claude Code, который помогает тестировать веб-приложения с экранными читалками VoiceOver, NVDA и JAWS для проверки совместимости со вспомогательными технологиями. Скилл охватывает пять основных ридеров: NVDA (31% пользователей), JAWS (40%), VoiceOver для macOS/iOS (15%), TalkBack для Android (10%) и Narrator (4%) — с указанием рекомендуемых связок браузер/ОС и приоритетов тестового покрытия. Внутри собраны готовые чеклисты для проверки заголовков, форм, динамического контента, таблиц и ARIA-атрибутов, а также полные таблицы горячих клавиш для каждого ридера и типовые сценарии отладки с примерами исправления HTML. Подойдёт разработчикам и QA-инженерам, которым нужно обеспечить соответствие WCAG и реальную доступность интерфейса для незрячих пользователей.
- Тестирование смарт-контрактов на Solidity — web3-testing — это скилл для Claude Code, который обеспечивает комплексное тестирование смарт-контрактов на Solidity с использованием Hardhat и Foundry. Скилл покрывает юнит-тесты, интеграционные тесты, фаззинг для поиска граничных случаев, газ-оптимизацию и форкинг мейннета для реалистичных сценариев. В Hardhat-части используются hardhat-gas-reporter, solidity-coverage и @nomicfoundation/hardhat-toolbox, а Foundry-часть включает cheatcodes (vm.prank, vm.deal, vm.expectRevert) и fuzz-тесты с произвольными входными данными. Скилл также позволяет автоматизировать отчёты о покрытии кода и верифицировать контракты на Etherscan. Подходит разработчикам DeFi-протоколов и Web3-приложений, которым нужно выстроить надёжный тестовый стенд для блокчейн-кода.
- TDD-цикл с контрольными точками и Git — workflow-patterns — это скилл для Claude Code, который реализует TDD-рабочий процесс Conductor с управлением контрольными точками фаз, коммитами Git и протоколом верификации качества. Скилл охватывает полный цикл red-green-refactor: написание падающих тестов, выполнение задач из plan.md трека, прохождение gates качества и фиксацию прогресса. Ключевые операции включают управление git-коммитами с содержательными notes, последовательное прохождение фаз, обновление plan.md сразу после завершения задачи и ожидание подтверждения на checkpoint-верификации. Детальная документация паттернов и разобранные примеры хранятся в `references/details.md`. Подходит командам, которым важны строгие quality assurance gates, контроль покрытия и воспроизводимый процесс разработки через автоматизированный workflow.
- Валидация уязвимостей перед сабмитом в bug bounty — triage-validation — это скилл для Claude Code, который валидирует найденные уязвимости до написания отчёта, чтобы исключить N/A submissions и повысить acceptance rate в bug bounty программах. Внутри — 7-вопросный gate (8 с проверкой идентичности сессии), 4 последовательных pre-submission gate, список всегда-отклоняемых классов уязвимостей, таблица conditionally-valid находок с возможными цепочками, quick reference по CVSS 3.1 и 60-секундный чеклист перед сабмитом. Один неверный ответ на любой из вопросов означает немедленную остановку: скилл требует реального HTTP-запроса, подтверждённого impact и кросс-идентичного воспроизведения (проверка IDOR, privesc и auth bypass через несколько сессий из audit.jsonl). Подходит исследователям безопасности, которые хотят отсеивать слабые и out-of-scope findings на этапе триажа, а не после написания полного отчёта.
- Пентест мобильных приложений Android и iOS — mobile-pentest — это скилл для Claude Code, который ведёт пентест мобильных приложений (Android APK и iOS IPA) по принципу runtime-first: сначала установка приложения, проксирование через Burp Suite или mitmproxy и ручной прогон бизнес-сценариев — и только при SSL-пиннинге или зашифрованном трафике скилл переходит к декомпиляции через apktool/jadx и инструментации через Frida/objection. Статический анализ охватывает поиск захардкоженных секретов и скрытых API-эндпоинтов, которые не видны при веб-разведке, — через grep по smali/XML и утилиту apkleaks. Дополнительно поддерживаются инъекция intent в exported-activity и deeplink, злоупотребление WebView JavascriptInterface, восстановление цепочки подписи запросов через OkHttp-перехватчик и трансплантация network_security_config. Подходит для bug bounty-охотников, которым нужна свежая атакующая поверхность, когда веб-разведка исчерпана или трафик приложения запинен.
- Vellum — сквозное тестирование ассистента из терминала — cli-testing — это скилл для Claude Code, который позволяет тестировать Vellum assistant end-to-end прямо из терминала, без десктопного приложения или веб-интерфейса. Скилл охватывает полный жизненный цикл: запуск инстанса через `vellum hatch --remote docker --source .`, отправку сообщений командой `vellum message`, потоковое чтение ответов через `vellum events` и удаление инстанса командой `vellum retire`. Подходит для проверки поведения ассистента, воспроизведения багов и smoke-тестирования изменений без запуска macOS- или веб-клиентов. Поддерживает ключи нескольких LLM-провайдеров: Anthropic, OpenAI, Gemini, Fireworks, OpenRouter, MiniMax — CLI читает их прямо из переменных окружения.
- Пентест мобильных приложений Android и iOS — mobile-pentest — это скилл для Claude Code, который реализует runtime-first методологию пентеста мобильных приложений (Android APK и iOS IPA) в рамках bug bounty. Рабочий процесс строится по строгому порядку: установить приложение, направить трафик через Burp или mitmproxy, вручную пройти бизнес-потоки, и только при наличии SSL-пиннинга, шифрования или отсутствия трафика — переходить к декомпиляции через apktool/jadx и инструментации через Frida/objection. Скилл охватывает статический поиск хардкодных секретов и скрытых API-эндпоинтов, байпас SSL-пиннинга (objection patchapk, Frida CertificatePinner и checkServerTrusted-хуки), восстановление подписи запросов через OkHttp interceptor chain, инъекцию Intent в exported activity и deeplink, злоупотребление мостом WebView addJavascriptInterface, а также триаж нативных JNI-библиотек. Подходит охотникам за уязвимостями, которым нужна дополнительная поверхность атаки, когда веб-разведка исчерпана.
- Unlighthouse — полный SEO-аудит всех страниц сайта — seo-unlighthouse — это скилл для Claude Code, который запускает Lighthouse против каждого URL сайта через MIT-лицензированный CLI Unlighthouse и агрегирует результаты без расходования API-квоты. Подходит тем, кому не хватает лимита PageSpeed Insights (25 000 запросов в сутки) или нужен офлайн-аудит в CI или закрытых средах. Команда `/seo unlighthouse <url>` проверяет до 200 маршрутов в мобильном режиме и сохраняет JSON- и HTML-отчёт; флаги `--device desktop`, `--max-routes` и `--output-dir` позволяют гибко настраивать запуск. Скилл возвращает разобранный `ci-result.json` с медианными оценками производительности, доступности, best practices и SEO по всем проверенным маршрутам, а также постраничную разбивку. Требует Node 18+ и предварительного запуска `extensions/unlighthouse/install.sh`.
- Библиотека пейлоадов для тестирования безопасности — security-arsenal — это скилл для Claude Code, который предоставляет готовую библиотеку пейлоадов, таблиц обхода и правил сабмита для тестирования безопасности веб-приложений. Внутри — пейлоады для XSS (базовые зонды, кража куки, обход CSP, DOM-источники и синки), SSRF (метаданные AWS/GCP/Azure, фингерпринт внутренних сервисов, IP-bypass через decimal/octal/hex/IPv6), SQL-инъекций (детекция, union-based, blind time-based, обход WAF), XXE, NoSQLi, command injection, SSTI, IDOR, path-traversal, HTTP smuggling, WebSocket и обхода MFA. Скилл также содержит список находок, которые всегда отклоняются на bug bounty, и таблицу условно-валидных уязвимостей с цепочками эксплуатации — чтобы понять, стоит ли репортить конкретный баг. Подходит пентестерам и участникам bug bounty программ, которым нужно быстро подобрать нужный пейлоад или проверить, является ли находка сабмитабельной.
- Валидация уязвимостей перед отправкой в bug bounty — triage-validation — это скилл для Claude Code, который валидирует найденные уязвимости до написания отчёта по bug bounty, чтобы исключить N/A и информационные дубли. Внутри: 7-Question Gate (вопросы задаются строго по порядку, один неверный ответ — находка закрывается), 4 последовательных pre-submission gate (Reality Check, Impact Validation, Deduplication Check и Identity Check), список always-rejected классов уязвимостей, таблица условно-валидных находок с требуемыми цепочками, quick reference по CVSS 3.1, severity decision guide и 60-секундный чеклист перед отправкой. Отдельный блок Q8 фиксирует, под какой сессией воспроизводится баг: без ответа на вопросы идентификации auth-related находка считается недоказанной. Скилл предназначен для исследователей безопасности и пентестеров, которым важно держать validity ratio высоким и не тратить время программы на заведомо отклоняемые репорты.
- TDD-разработка с покрытием кода — tdd-workflow — это скилл для Claude Code, который обеспечивает разработку по методологии TDD с покрытием кода не менее 80%, включая unit, integration и E2E тесты. Скилл применяется при написании новых функций, исправлении багов, рефакторинге, добавлении API-эндпоинтов и создании компонентов. Внутри — семишаговый процесс: от пользовательских сценариев и генерации тест-кейсов до реализации кода, рефакторинга и проверки покрытия; поддерживаются Jest, Vitest и нативный раннер Bun (`bun:test`), а E2E-тесты строятся на Playwright. Отдельный шаг (Step 0) автоматически определяет пакетный менеджер и тест-раннер проекта, разграничивая их, — это предотвращает типичные ошибки при запуске тестов в ESM-окружениях.
- Тестирование и сравнение LLM через omniroute CLI — cli-eval — это скилл для Claude Code, который позволяет создавать и запускать наборы тестирования LLM-моделей, отслеживать прогресс бенчмарков в реальном времени и сравнивать их результаты прямо из командной строки через CLI-инструмент omniroute. Скилл охватывает полный цикл работы с eval-суитами: создание наборов с рубриками `exact-match`, `contains`, `llm-judge` или `regex`, запуск против конкретной модели (например, `omniroute eval suites run <suiteId> --model gpt-4o --watch`), просмотр scorecards с пополнительными результатами по каждому сэмплу. Для сравнения производительности нескольких моделей — Claude, GPT-4o, Gemini — один и тот же суит запускается в цикле, а полученные оценки сопоставляются. Интеграция с CI-пайплайнами реализована через проверку порогового значения score: если результат опускается ниже заданного уровня, сборка завершается с ошибкой. Подходит командам, которым нужно автоматизировать регрессионное тестирование языковых моделей и контролировать качество ответов при обновлениях.
FAQ
Стоит ли доверять Claude написание тестов?
Тесты, написанные моделью, полезны как черновик и как страховка от пропущенных краевых случаев, но требуют проверки. Главный риск — тест, который проходит всегда: он создаёт ложное ощущение покрытия. Практичный приём — сначала убедиться, что тест падает на сломанном коде, и только потом принимать его.
Как заставить Claude писать тесты в стиле проекта?
Указать в скилле фреймворк, структуру файла, правила именования кейсов и два-три образцовых теста из репозитория. Образцы работают лучше описаний: модель воспроизводит показанный шаблон точнее, чем следует его словесному пересказу.
Все Skills для Claude Code