TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 279K subscribers
Post #10719 23.7K
🌟 Cohere Labs выложила компактную зрительно-языковую модель North Micro Vision

Модель на 2,4 млрд параметров стала самой маленькой в линейке VLM компании. От большинства таких моделей она отличается тем, что работает с изображением в исходном разрешении.

Обычно картинку перед подачей в модель сжимают, и мелкий текст, разметка таблицы и подписи на графике при этом теряются. Здесь пропорции сохраняются, а верхняя планка соответствует странице A4, отсканированной при 200 dpi.


Отсюда и заявленная область применения - документы, таблицы, графики, скриншоты, формы.

Компактный размер удобен для дообучения под свою предметную область, а квантованные сборки, по словам Cohere, пойдут не только на сервере, но и на ноутбуке или устройстве мобильного класса.

🟡Архитектура

Зрительный энкодер на 400 млн параметров вырос из SigLIP 2 и держит исходное разрешение за счёт двумерного RoPE вместе с обученными одномерными позиционными эмбеддингами.

Языковая часть - собственная North Micro LLM на 2 млрд параметров, повторяющая архитектуру Command A+: три слоя внимания со скользящим окном и RoPE чередуются с одним глобальным слоем, который работает вообще без позиционных эмбеддингов.

Получается разделение труда - окна с RoPE держат локальный контекст, глобальный слой смотрит на всё сразу и в разметке позиций не нуждается.


Между ними проектор, и здесь изюминка. Вместо того чтобы отдать языковой модели один готовый набор признаков, Cohere подмешивает эмбеддинги патчей с нескольких уровней зрительного энкодера в соответствующие ранние слои языковой модели. Так модель видит картинку сразу на разных степенях обобщения. Принцип взят из DeepStack.

🟡Тесты

Замеры проводили через VLMEvalKit, сравнивая с восемью моделями размером от 1,6 до 5,1 млрд параметров.

Сильнее всего North Micro Vision выглядит там, куда её и целили.

На DocVQA 0,921, на ChartQA 0,808, на AI2D 0,775, на RefCOCO 0,732 (втрое выше, чем у Ministral и Qwen3-VL).


Общий язык и рассуждение даются слабее.

На MMMU 0,329, худший результат в таблице; на MMLU и MMLU-Pro модель тоже уступает большинству соседей.



📌Лицензирование: Apache 2.0 License.


🟡Статья
🟡Модель
🟡Демо


@ai_machinelearning_big_data

#AI #ML #VLM #NorthMicroVision #Cohere
  • 🔥 67
  • 👍 30
  • ❤ 15
  • 🤔 7
  • 👏 3
More from @ai_machinelearning_big_data
  1. Sep 27, 2026✔️ Claude Code не будет обрывать сессии при достижении 5-часового лимита При достижении 5-…
  2. Sep 27, 2026✔️ Создатель Ruby on Rails полностью отказался от ручного программирования На конференции…
  3. Sep 26, 2026✔️ Апелляционный суд США оставил Anthropic в чёрном списке Пентагона Суд округа Колумбия п…
  4. Sep 26, 2026📌Fable 5.1 рассчитала амплитуду рассеяния в девяти петлях Модель в среде Claude Science р…
  5. Sep 25, 2026✔️ Google добавила в Gemini 3.8 Live говорящий видеоаватар Gemini 3.8 Live with Live Avata…
  6. Sep 25, 2026Появилось открытое сообщество для решения NetHack Исследователи из AIRI зовут объединяться…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →