Baidu Unlimited-OCR: страница — это просто картинка
Думал, OCR так и работает? Сканируй, ищи куски с буквами, распознавай, выдавай текст. Tesseract всю жизнь так и корячится. А вот свежий baidu/Unlimited-OCR решил выпендриться: буквы он не ищет вообще. Вместо этого берет страницу целиком, ужимает в пачку визуальных токенов и скормит это языковой модели, а та уже разворачивает их в нормальный структурированный текст. Со стороны звучит как извращение, но работает ведь, гад.
По сути это прямой потомок идеи DeepSeek-OCR. В посте быстро разберем, что это за зверь, как устроен, на что способен и как поднять у себя. Зайдет всем, кому надо распознавать многостраничники за один прогон или встраивать такую штуку в код.
Читать далее
👉 Data Science | Machinelearning [ru]
Post #5854
2.16K

- ❤ 4