Chandra — распознавание текста и структуры документов
★ 12.1K
Chandra — это открытая модель распознавания текста, которая превращает изображения и PDF в структурированный текст с сохранением разметки страницы. Её берут, когда из скана или картинки нужно вытащить не просто буквы, а структуру: заголовки, таблицы, порядок колонок, — чтобы результат сразу годился для дальнейшей обработки, а не требовал ручной пересборки. Отдаёт результат в Markdown, HTML или JSON. Поддерживает более 90 языков и уверенно работает со сложной вёрсткой, где обычное распознавание теряет таблицы и путает колонки. Полезна для оцифровки договоров, отчётов, форм, научных статей и подготовки документов для баз знаний и поиска. Это модель для встраивания в конвейер обработки; для разовой ручной чистки одного скана берут инструменты попроще.
- #Documents