🔖 Нашли OCR, заточенный под LLM
Сегодня почти все строят RAG поверх PDF-документов. Но если OCR плохо распознал текст — модель начинает галлюцинировать ещё до первого запроса.
olmOCR решает эту проблему: он превращает PDF, сканы и изображения в чистый Markdown, сохраняя структуру документа, таблицы, формулы и порядок чтения.
⛓️ Ссылка на GitHub
tags: #полезное
➡ Data Scientist | Чат
Post #980
897

- ❤ 5
- 👍 2
- 🔥 2