LiteParse — локальный парсинг документов без облака

★ 12.2K

LiteParse — это открытый инструмент для парсинга документов, который извлекает текст с сохранением координат блоков (bounding boxes) и работает целиком локально, без облака и без вызовов языковых моделей. Берут, когда нужно быстро разобрать пачку PDF для RAG-пайплайна или поиска, но отправлять документы наружу нельзя — договоры, отчёты, внутренние бумаги остаются на вашем сервере; или когда важно заранее оценить сложность документа и не тратить ресурсы на тяжёлый разбор. Ядро написано на Rust и использует PDFium для извлечения текста; поддерживает PDF, DOCX, XLSX, PPTX и изображения. Встроенный OCR через Tesseract не требует настройки; можно подключить внешний OCR-сервер (EasyOCR, PaddleOCR, свой). Есть Worker Pool для параллельного разбора с таймаутами, генерация скриншотов страниц и вывод в Markdown, JSON или текст. Подключается из Python (PyPI), Node.js/TypeScript (npm), браузера (WASM) или запускается как CLI. Работает на Linux, macOS (Intel/ARM) и Windows. Направление — извлечение текста из документов, а не генерация или анализ содержимого. На сложных сканах, плотных таблицах, многоколоночной вёрстке и рукописном тексте авторы честно рекомендуют облачный LlamaParse — LiteParse