jina-ocr-v1 - 3B модель для разбора документов на английском и китайском языках, рассчитанная под локальный запуск на недорогих системах.
Модель принимает скан, фотографию или PDF и на выходе выдаёт Markdown с поддержкой LaTeX.
Кроме полной транскрипции она распознаёт отдельные таблицы и формулы, подписывает изображения, отвечает на вопросы по документу и извлекает ключевые поля.
🟡Архитектура
DeepSeek-OCR с визуальным энкодером DeepEncoder на 380 млн параметров, который сжимает страницу до 256 визуальных токенов и при необходимости добавляет до девяти фрагментов по 100 токенов. Декодер - смесь экспертов на 3 млрд общих и 570 млн активных параметров.
Вклад Jina - спекулятивное декодирование FastMTP, где один общий блок предлагает три токена вперёд, а декодер принимает самую длинную часть, совпадающую с его собственным выбором.
🟡Тесты
На olmOCR-Bench модель набрала 83,4 балла - на 7,4 больше DeepSeek-OCR и выше olmOCR-2 с 8B параметров (82,4), но ниже chandra-ocr-2 (85,8) и dots.mocr (83,9).
На OmniDocBench v1.6 результат 91,14 против 90,25 у DeepSeek-OCR-2, но хуже более компактных PaddleOCR-VL-1.6 (96,34) и HunyuanOCR-1.5 (94,74).
По пропускной способности модель первая среди 14 систем - 2,57 страницы в секунду на одной A100 при 32 параллельных запросах.
На L4 FastMTP ускоряет генерацию в 1,95 раза в обычном режиме, но с CUDA-графами прирост падает до 1,17 раза.
⚠️ FastMTP работает только в vLLM 0.21 и новее
Без установки модель доступна через Jina Reader и онлайн-песочницу по ключу API Jina.
📌Лицензирование: CC BY-NC 4.0
🟡Блогпост
🟡Веса
🟡Arxiv
🟡Демо
@ai_machinelearning_big_data
#AI #ML #OCR #Deepsek #JinaOCRv1 #JinaAI


