Стара біда: закинув скан у чат-бота, а той повернув кашу з переплутаними колонками, побитими таблицями й формулами, від яких лишилися самі дужки. MinerU від OpenDataLab робить цей етап окремо й у себе на машині: PDF, DOCX, PPTX, XLSX, картинки та вебсторінки на вході — чистий markdown або JSON на виході.
Що саме воно витягує:
→ формули йдуть у LaTeX, таблиці в HTML, зі злиттям таблиці, розірваної між сторінками;
→ тримає людський порядок читання в багатоколонковій верстці й сам викидає колонтитули;
→ жує скани й рукописний текст, OCR на 109 мов;
→ три режими: pipeline на процесорі без галюцинацій, VLM на відеокарті заради точності, гібрид.
Червневий реліз 3.4 підняв OCR-точність приблизно на 11% і вдвічі прискорив обробку. А в 3.3 зʼявився параметр сили розбору: на macOS середній рівень дає до 220% швидкості на текстових PDF, втрачаючи 0,13 пункту точності. Розмін, на який погодиться майже кожен.
Є MCP-сервер, тож Claude Desktop, Cursor чи Windsurf ходять у нього напряму. Плюс інтеграції з LangChain, Dify, RAGFlow і онлайн-версія mineru.net.
Ставиться одним рядком:
uv pip install -U "mineru[all]". 76 тисяч зірок.Два «але». Ліцензія не чистий опенсорс: з AGPLv3 автори перейшли на власну, на базі Apache 2.0 з додатковими умовами — перед комерційним впровадженням читати. І моделі важкі, на слабкому ноуті радості мало. Але для власного RAG це найкраще, що є задарма.
https://github.com/opendatalab/MinerU
📎 Читайте також:
→ Mistral OCR 3 — документи в markdown зі структурою
→ Context.dev — один API замість зоопарку парсерів
→ Таблиці з фото прямо в редагований Excel