LlamaGuard — фильтрация небезопасного контента
★ 7.7 · security
llamaguard — это скилл для Claude Code, который подключает специализированную модель Meta LlamaGuard (7–8B параметров) для фильтрации входящих запросов и исходящих ответов LLM-приложений. Модель классифицирует небезопасный контент по шести категориям: насилие и ненависть, сексуальный контент, оружие, запрещённые вещества, суицид и самоповреждение, планирование преступлений — с точностью 94–95%. Скилл охватывает пять готовых сценариев: проверку пользовательских промптов до отправки в LLM, модерацию ответов перед показом пользователю, высокопроизводительное развёртывание через vLLM (до 100 запросов/с на одном A100), обёртку в REST API на FastAPI и интеграцию с NVIDIA NeMo Guardrails. Подходит командам, которым нужен надёжный content safety layer поверх любого языкового моделя без ручной разметки правил.
- #content-moderation
- #llamaguard
- #safety
- #meta
- #input-filtering
- #output-filtering
- #vllm