OCRmyPDF — распознавание текста в сканах PDF
★ 34.5K
OCRmyPDF — это инструмент, который добавляет текстовый слой распознавания (OCR) в отсканированные PDF, делая их доступными для поиска и копирования. Берут, когда есть сканы или снятые в PDF бумажные документы, по которым нельзя искать: OCRmyPDF прогоняет их через распознавание и возвращает такой же PDF, но с невидимым текстовым слоем поверх изображения — визуально ничего не меняется, а искать, выделять и копировать текст теперь можно. Работает из командной строки, легко ставится в пайплайны, использует движок Tesseract, умеет чистить и выпрямлять сканы. Направление — превращение «картиночных» PDF в искомые с сохранением вида, а не извлечение таблиц (excalibur) и не анализ вёрстки/чанкинг для RAG (docling/chunkr): узкая надёжная задача «скан → искомый PDF». Часто ставится в связке с системами вроде paperless-ngx для автоматической обработки входящих документов.
- #Documents