Вышел релиз Kreuzberg v4.6 — мощного open-source фреймворка для извлечения данных из документов. Он написан на Rust, но имеет нативные биндинги для Python, Node.js, Go, Java и других популярных языков.
Главная фишка обновления в том, что разработчики взяли отличную модель понимания структуры документов от проекта Docling (RT-DETR v2) и перенесли её на свой быстрый движок.
Что из этого вышло:
— Kreuzberg теперь понимает не просто текст, но и сложную структуру: таблицы, параграфы, заголовки.
— Работает в 2,8 раза быстрее Docling в среднем (около 1 секунды на документ против 3 секунд).
— Потребляет меньше памяти и не тащит за собой тяжёлые питонячьи зависимости.
— Для таблиц используется Table Transformer, который восстанавливает точную сетку строк и ячеек, а затем превращает их в чистый Markdown.
— Фреймворк напрямую вытаскивает текст и шрифты из слоёв PDF через pdfium. Если слоев нет — автоматически включает OCR (Tesseract или многоязычный PaddleOCR v2).
Использование таких библиотек сильно дешевле и часто надёжнее, чем отдавать картинки документов на распознавание VLM-моделям (вроде Claude Sonnet), которые периодически галлюцинируют на длинных таблицах и цифрах.
Если вы делаете RAG или просто парсите много сложной документации, Kreuzberg сейчас выглядит как один из самых быстрых и точных инструментов на рынке.
@prog_tools (теперь и в Max)
Post #2750
2.44K
- ❤ 4
- 👍 2