TGViewer
Synaptic Garden Synaptic Garden @synaptic_garden · 558 subscribers
Post #1172 216
Cohere выпустила North Micro Vision — компактную открытую мультимодальную модель на 2,4 млрд параметров, ориентированную прежде всего на работу с документами, таблицами, графиками и мелкими деталями изображений. Веса North-Micro-Vision-Instruct опубликованы под Apache 2.0, а сама Cohere называет её своей самой маленькой мультимодальной моделью на сегодняшний день.

Главная особенность North Micro Vision — обработка изображений в исходном разрешении и с сохранением пропорций. Многие небольшие VLM сначала уменьшают картинку до фиксированного квадрата, из-за чего мелкий текст и структура документа теряются. Здесь модель обучали постепенно повышать разрешение вплоть до 1654×2339 пикселей — примерно страницы A4 при 200 dpi. Поэтому основной упор сделан на OCR, извлечение структурированных данных, чтение документов, диаграмм и таблиц, а также visual grounding — поиск конкретных объектов и областей на изображении.

Архитектура состоит из собственного языкового модуля North Micro LLM на 2 млрд параметров и зрительного кодировщика на 400 млн параметров, дообученного на основе SigLIP 2. В обучении Cohere особенно много внимания уделила OCR и документам: только этап мультимодального дообучения на инструкциях включал 50 млн примеров, после чего модель дополнительно настроили на 500 тысячах пар предпочтений.

Сильнее всего это проявляется в тестах на документах и пространственном понимании. North Micro Vision получает 0,921 на DocVQA и 0,732 на RefCOCO, в последнем случае заметно опережая многие сравнимые компактные модели. При этом универсальным конкурентом большим VLM она не является: например, на MMMU результат составляет всего 0,329, а сама Cohere прямо предупреждает, что модель не предназначена для сложных рассуждений, слаба в математике и программировании и не поддерживает вызов инструментов или агентные сценарии.

У языковой части заявлено контекстное окно 128 тысяч токенов, но мультимодальное обучение проводилось лишь до 8 тысяч, поэтому более длинные запросы с изображениями пока фактически работают за пределами проверенного режима. Уже есть поддержка Transformers, MLX-VLM и рецепты дообучения через NVIDIA AutoModel и Axolotl; Cohere также готовит публичную поддержку vLLM.

В итоге North Micro Vision выглядит не как попытка сделать ещё одного маленького универсального ассистента, а скорее как специализированную основу для локальных систем обработки документов и изображений. При 2,4 млрд параметров, открытых весах и возможности работать с изображениями без агрессивного уменьшения разрешения это может быть особенно интересно для OCR, автоматизации документооборота и собственных узкоспециализированных мультимодальных моделей.
More from @synaptic_garden
  1. Oct 8, 2026Компания JetBrains представила открытую модель Mellum2.1 под лицензией Apache 2.0, ориенти…
  2. Oct 8, 2026video post
  3. Oct 8, 2026Vidu представила новую модель генерации видео Vidu Q4 Preview, которая сразу залетела в то…
  4. Oct 8, 2026StepFun объявила неделю бесплатного доступа к модели Step 5 Preview через разных провайдер…
  5. Oct 8, 2026Anthropic начал выдавать кредиты на api пользователям платных планов
  6. Oct 7, 2026В OpenCode появилась новая стелс-модель Exo. 1M контекст, до 131к токенов на выходе, поним…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →