LlamaGuard — фильтрация небезопасного контента

★ 7.7 · security

llamaguard — это скилл для Claude Code, который подключает специализированную модель Meta LlamaGuard (7–8B параметров) для фильтрации входящих запросов и исходящих ответов LLM-приложений. Модель классифицирует небезопасный контент по шести категориям: насилие и ненависть, сексуальный контент, оружие, запрещённые вещества, суицид и самоповреждение, планирование преступлений — с точностью 94–95%. Скилл охватывает пять готовых сценариев: проверку пользовательских промптов до отправки в LLM, модерацию ответов перед показом пользователю, высокопроизводительное развёртывание через vLLM (до 100 запросов/с на одном A100), обёртку в REST API на FastAPI и интеграцию с NVIDIA NeMo Guardrails. Подходит командам, которым нужен надёжный content safety layer поверх любого языкового моделя без ручной разметки правил.