Excalibur — извлечение таблиц из PDF через веб-интерфейс
★ 1.8K
Excalibur — это веб-интерфейс для извлечения табличных данных из PDF, построенный на библиотеке Camelot (Python 3). Берут, когда нужно вытащить таблицы из PDF в структурированный вид (CSV/Excel) через удобный интерфейс, а не программно: загрузить документ, выделить страницы и таблицы, получить данные для дальнейшей обработки. ВАЖНО: работает только с текстовыми PDF, где текст можно выделить мышью, а не со сканами (для сканов нужен OCR). Требует установленного ghostscript, ставится через pip и инициализирует свою базу метаданных. Направление — извлечение именно таблиц из текстовых PDF через веб-UI, а не полноценный OCR сканов (для этого OCRmyPDF/PaddleOCR) и не анализ вёрстки всего документа (huridocs): узкая задача «таблицы из PDF → данные». Полезно аналитикам и всем, кому регулярно приходят отчёты с таблицами в PDF.
- #Documents