API документного интеллекта: PDF, изображения и таблицы превращаются в LLM-готовые данные
Парсит PDF, изображения (PNG/JPEG/TIFF), документы Word, таблицы (CSV/XLSX), PowerPoint и сканы, поддерживая около 100 языков; выполняет OCR, определяет раскладку и порядок чтения, отдаёт bounding box и ссылки на источник (citations); извлекает данные по заданной схеме; справляется с рукописным текстом, формами, математическими формулами, таблицами, графиками и техническими схемами. Работа построена вокруг простого task-based API с вебхуками; есть Python- и TypeScript-библиотеки и веб-интерфейс для тестовых запусков.
| Installs into | python-sdk, typescript-sdk, rest-api, web |
| Type | API |
| Section | Data & analytics |
| Pricing | has a free tier |
| Systems | api, web, on-premise |
| Hosting | hybrid |
| Installs into | python-sdk, typescript-sdk, rest-api, web |
| Who for | Разработчики и AI-команды, строящие RAG-конвейеры и обработку сложных документов |
| Site language | en |
| Vendor | Chunkr (Lumina AI) |
| GitHub | lumina-ai-inc/chunkr |