Защита LLM от инъекций и джейлбрейков

★ 7.7 · security

prompt-guard — это скилл для Claude Code, который интегрирует классификатор Meta Prompt-Guard-86M для обнаружения prompt injection и jailbreak-попыток в LLM-приложениях. Модель размечает входной текст по трём классам — BENIGN, INJECTION и JAILBREAK — и достигает точности 99%+ TPR при менее 1% FPR, работая менее чем за 2 мс на GPU. Скилл покрывает три ключевых сценария: фильтрацию пользовательского ввода перед отправкой в LLM, проверку данных от сторонних API и веб-скрапинга, а также пакетную обработку документов в RAG-системах с настраиваемым порогом срабатывания. Реализован через transformers и torch, поддерживает 8 языков и batch-режим с указанием размера батча. Подходит командам, которым нужна лёгкая и быстрая защита входных данных без тяжёлых инфраструктурных зависимостей.