Cohere выпустила North Micro Vision — компактную открытую мультимодальную модель на 2,4 млрд параметров, ориентированную прежде всего на работу с документами, таблицами, графиками и мелкими деталями изображений. Веса North-Micro-Vision-Instruct опубликованы под Apache 2.0, а сама Cohere называет её своей самой маленькой мультимодальной моделью на сегодняшний день.
Главная особенность North Micro Vision — обработка изображений в исходном разрешении и с сохранением пропорций. Многие небольшие VLM сначала уменьшают картинку до фиксированного квадрата, из-за чего мелкий текст и структура документа теряются. Здесь модель обучали постепенно повышать разрешение вплоть до 1654×2339 пикселей — примерно страницы A4 при 200 dpi. Поэтому основной упор сделан на OCR, извлечение структурированных данных, чтение документов, диаграмм и таблиц, а также visual grounding — поиск конкретных объектов и областей на изображении.
Архитектура состоит из собственного языкового модуля North Micro LLM на 2 млрд параметров и зрительного кодировщика на 400 млн параметров, дообученного на основе SigLIP 2. В обучении Cohere особенно много внимания уделила OCR и документам: только этап мультимодального дообучения на инструкциях включал 50 млн примеров, после чего модель дополнительно настроили на 500 тысячах пар предпочтений.
Сильнее всего это проявляется в тестах на документах и пространственном понимании. North Micro Vision получает 0,921 на DocVQA и 0,732 на RefCOCO, в последнем случае заметно опережая многие сравнимые компактные модели. При этом универсальным конкурентом большим VLM она не является: например, на MMMU результат составляет всего 0,329, а сама Cohere прямо предупреждает, что модель не предназначена для сложных рассуждений, слаба в математике и программировании и не поддерживает вызов инструментов или агентные сценарии.
У языковой части заявлено контекстное окно 128 тысяч токенов, но мультимодальное обучение проводилось лишь до 8 тысяч, поэтому более длинные запросы с изображениями пока фактически работают за пределами проверенного режима. Уже есть поддержка Transformers, MLX-VLM и рецепты дообучения через NVIDIA AutoModel и Axolotl; Cohere также готовит публичную поддержку vLLM.
В итоге North Micro Vision выглядит не как попытка сделать ещё одного маленького универсального ассистента, а скорее как специализированную основу для локальных систем обработки документов и изображений. При 2,4 млрд параметров, открытых весах и возможности работать с изображениями без агрессивного уменьшения разрешения это может быть особенно интересно для OCR, автоматизации документооборота и собственных узкоспециализированных мультимодальных моделей.
Post #1172
216
