Chaos engineering для распределённых систем

testing

Chaos engineer — это скилл для Claude Code, который проектирует эксперименты по chaos engineering, создаёт фреймворки инъекции отказов и сопровождает game day упражнения для распределённых систем, выдавая готовые runbook-ы, манифесты экспериментов, процедуры отката и шаблоны post-mortem. Берут, когда нужно проверить, как сервис переживёт падение пода или узла Kubernetes; когда хочется выяснить, не ляжет ли всё из-за сетевых задержек к базе; когда готовят game day и нужен сценарий с чётким контролем blast radius; когда хаос-тесты планируют встроить в CI/CD pipeline. Внутри — пошаговый рабочий процесс: анализ архитектуры и путей отказа, формулировка гипотезы и steady state, запуск контролируемого эксперимента с мониторингом, документирование выводов, автоматизация. Скилл работает с Litmus Chaos (ChaosEngine-манифесты), Chaos Monkey, toxiproxy, Gremlin, Pumba и умеет встраивать тесты в CI/CD. Обязательные ограждения: сначала baseline, blast radius минимален с расширением после валидации, автоматический откат не дольше 30 секунд. Применять только на авторизованных окружениях с ведома команды. Направление — инъекция отказов в работающие системы для повышения отказоустойчивости, а не нагрузочное тестирование производительности (для этого — отдельные load-testing инструменты).