Constitutional AI — безопасное выравнивание модели
★ 7.7 · security
constitutional-ai — это скилл для Claude Code, который реализует метод Constitutional AI от Anthropic для обучения моделей безопасному поведению через самокритику и RLAIF (RL from AI Feedback) без использования человеческих меток на вредоносные ответы. Скилл охватывает два последовательных этапа: supervised learning с самокритикой и ревизией ответов на основе «конституции» (набора принципов), а затем reinforcement learning через обратную связь от самой модели. Рабочие процессы включают генерацию и ревизию ответов с помощью transformers, обучение reward-модели через trl RewardTrainer и RL-оптимизацию через PPOTrainer, а также chain-of-thought критику для прозрачности рассуждений. Подходит исследователям и ML-инженерам, которым нужно выровнять модель по принципам безопасности без дорогостоящей разметки, снизить токсичность и уйти от уклончивых отказов — именно этот метод лежит в основе системы безопасности Claude.
- #safety-alignment
- #constitutional-ai
- #rlaif
- #self-critique
- #anthropic
- #harmlessness
- #ai-safety