Извлечение текста и данных из документов (self-hosted)
★ 3.2K
text-extract-api — это самостоятельно размещаемый API, который конвертирует любые изображения, PDF и офисные документы в Markdown-текст или структурированный JSON с высокой точностью, включая таблицы, числа и математические формулы. Берут, когда нужно превращать документы в текст/данные на своём сервере, не отправляя их наружу: распознать сканы и PDF, вытащить табличные данные, привести договоры и накладные к структуре для дальнейшей обработки, а заодно убрать персональные данные (PII). Построен на FastAPI с очередью задач Celery и кэшем Redis; распознавание идёт разными OCR-стратегиями (EasyOCR, llama3.2-vision, minicpm-v, marker-pdf), а локальная Ollama-модель дочищает результат и делает JSON — всё локально, без облака. Есть переключаемые стратегии хранения (локально, Google Drive). Направление — приватный конвейер «документ → Markdown/JSON» через API, а не готовое приложение с интерфейсом и не облачный OCR-сервис: это бэкенд-компонент для встраивания в свои пайплайны.
- #Document AI