Наткнулся на open-source PDF-парсер, который конвертирует PDF в Markdown со скоростью до 100 страниц в секунду.
На CPU.
Без GPU, облака и API-ключей.
Что умеет:
• Таблицы
• Сложные макеты документов
• Вложенные структуры
• OCR для 80+ языков
• Интеграция с LangChain
Называется OpenDataLoader.
По бенчмаркам авторов сейчас занимает первое место среди PDF → Markdown решений.
Для контекста:
• Docling показывает хорошие результаты, но работает примерно в 15 раз медленнее
• Marker требует GPU и значительно медленнее
• PyMuPDF4LLM быстрый, но заметно хуже справляется с таблицами
Отдельно удивило, что проект делали вместе с PDF Association и командой veraPDF.
То есть не просто очередной AI-стартап с громкими заявлениями, а люди, которые много лет работают с самим PDF-форматом.
Если собираете RAG, индексируете документацию или регулярно разбираете PDF-файлы, выглядит как проект, на который стоит посмотреть.
https://github.com/opendataloader-project/opendataloader-pdf
👉 @PythonPortal
Post #5845
6.32K