Unstract — извлечение данных из документов через LLM
★ 7.1K
Unstract — это платформа, которая превращает неструктурированные документы в структурированные данные с помощью LLM: вы описываете обычными словами, что нужно извлечь, и получаете на выходе структурированный JSON из PDF, изображений и сканов. Берут, когда нужно массово вытаскивать поля из документов и подавать их дальше как данные: разобрать счета, договоры, формы, анкеты — определить нужные поля промптами и развернуть это как API или ETL-конвейер для потока документов. Работает через LLM, разворачивается self-hosted, есть корпоративная версия. Направление — извлечение структурированных данных из документов по промптам с развёртыванием как API/ETL, а не просто парсер в Markdown (docling) и не OCR (OCRmyPDF): ценность — превратить «бумажный хаос» в предсказуемый JSON под ваши поля и встроить это в процессы. По задаче близок к chunkr и TaxHacker; выбирайте по формату вывода (готовые поля vs чанки для RAG) и способу развёртывания.
- #Documents