Анализ структуры и вёрстки PDF-документов

★ 1.3K

PDF Document Layout Analysis — это Docker-микросервис от HURIDOCS для интеллектуального разбора вёрстки PDF: OCR, сегментация и классификация частей страницы. Берут, когда PDF нужно не просто «вытащить текст», а понять его структуру: выделить заголовки, абзацы, картинки, таблицы и формулы, определить правильный порядок чтения и конвертировать документ в Markdown или HTML (с автоматическим переводом через Ollama). Особенно полезен на сложных многоколоночных и сканированных документах, где важен порядок и типы блоков для последующего RAG или архивации. Построен по принципам Clean Architecture, предлагает и удобный веб-интерфейс на Gradio, и REST API для интеграции. Направление — анализ структуры и разметки страниц PDF с определением порядка чтения, а не просто плоский OCR (для «документ → текст/JSON» есть OCRmyPDF, PaddleOCR, text-extract-api): это компонент понимания макета, который ставят перед извлечением содержимого.