TGViewer
Python/ django Python/ django @pythonl · 58.8K subscribers
Post #5560 4.33K
Baidu выпустила Unlimited OCR - модель для распознавания длинных документов за один проход.

У модели 3B параметров, но активируются только 500M. При этом она показывает новые SOTA-результаты на OmniDocBench v1.5 и v1.6.

Главная фишка - Reference Sliding Window Attention.

Модель держит в фокусе:

• исходный документ

• недавний контекст

• следующие слова

А всё лишнее постепенно «забывает», чтобы не раздувать вычисления.

За счёт постоянного размера KV Cache и более дешёвого attention Unlimited OCR может распознавать 40+ страниц за один forward pass, не теряя контекст и не замедляясь.

GitHub: https://github.com/baidu/Unlimited-OCR

Hugging Face: https://huggingface.co/baidu/Unlimited-OCR
  • ❤ 8
  • 👍 5
  • 🔥 5
More from @pythonl
  1. Sep 25, 2026🖥 Заголовки безопасности для FastAPI - одной строкой 🛡️ fastapi-security-headers добавля…
  2. Sep 24, 2026Линтер для инструкций ИИ-агентов LintLang проверяет AGENTS.md, CLAUDE.md, SKILL.md, описан…
  3. Sep 24, 2026‼️Ваши данные уже слиты. Вопрос лишь в том, кто и как ими воспользуется. Только в 2025 год…
  4. Sep 24, 2026⚡️ OmniVoice - открытая модель озвучки с поддержкой более 600 языков. Она умеет клонироват…
  5. Sep 23, 2026⚡ Qwen представила Audio 3.1 - единый стек для ASR, TTS и realtime-аудио. Главное: * ASR л…
  6. Sep 20, 2026🐍 Ruff доволен, mypy молчит, тесты зелёные. А в коде четыре одинаковых функции Автор стат…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →