SentencePiece — языконезависимая токенизация текста

★ 7.7 · ai-tooling

sentencepiece — это скилл для Claude Code, который обеспечивает языконезависимую токенизацию сырого Unicode-текста с поддержкой алгоритмов BPE и Unigram. Скилл работает без предварительной токенизации и языковых правил, что делает его пригодным для мультиязычных задач и языков CJK (китайский, японский, корейский); скорость обработки достигает 50 000 предложений в секунду при потреблении около 6 МБ памяти. Внутри — Python API и CLI-утилиты для обучения собственных моделей на корпусе от 100 МБ за 1–2 минуты, кодирования и декодирования с детерминированным словарём, а также субслово́вой регуляризации для аугментации данных. Используется в T5, ALBERT, XLNet (алгоритм Unigram) и mBART (BPE). Подходит разработчикам, которым нужна воспроизводимая токенизация для NLP-моделей без привязки к конкретному языку.