Chunkr — нарезка документов для RAG и LLM
★ 4.1K
Chunkr — это открытый API document intelligence: он превращает PDF, презентации, Word-документы и изображения в готовые для RAG/LLM фрагменты (chunks) через анализ вёрстки, OCR и семантическую нарезку. Берут, когда для RAG нужно из документов получить не просто текст, а качественно нарезанные, структурированные куски: анализ макета, OCR с координатами (bounding boxes), выдача структурированного HTML и Markdown, обработка визуально-языковыми моделями — на выходе фрагменты, готовые к индексации. Разворачивается как сервис (production-ready). ВАЖНО: открытая AGPL-версия отличается от полностью управляемого облачного API — open source использует общедоступные модели, а Cloud API работает на собственных моделях для большей точности и скорости. Направление — сервис превращения документов в RAG-ready чанки через API, а не библиотека-парсер (docling) и не веб-приложение с интерфейсом: ценность — готовый конвейер разбора и нарезки документов для поиска и LLM.
- #Documents