Не знаю, что они туда засунули, но рисовая моделька обходит флагмана Anthropic почти по всем бенчам на 10-20 пунктов 🫣
Фич очень много:
• Понимает картинки, видео и текст одновременно — модель из коробки работает с изображениями, видео и текстом, не нуждаясь в отдельных этапах обработки для каждого типа данных
• Визуальный энкодер CogViT — специальные «глаза» модели, который напрямую считывает содержимое изображений, макетов и видео без промежуточного перевода в текст
• Архитектура MTP — ускоренная генерация: модель предсказывает сразу несколько токенов за шаг, что делает её быстрее при работе с большими задачами
• 200к токенов контекста — модель запоминает целые репозитории кода, длинные документы или долгие видео
• Вывод до 128к токенов — может генерировать очень длинные ответы, например полный код целого проекта за один запрос
• Обучение с подкреплением на 30+ типах задач — модель тренировалась решать одновременно более 30 видов задач, что делает её универсальной.
• STEM-рассуждения — умеет в логическое и математическое мышление, что помогает писать корректный и правильный код
• Visual Grounding — по текстовому описанию находит нужный объект на картинке и показывает его точное местоположение рамкой
• Анализ видео — понимает, что происходит на видео во времени: смену кадров, анимации, действия пользователя
• Работа с инструментами и API — умеет вызывать внешние программы и сервисы для выполнения задач
• Design-to-Code — отправляете макет или скриншот, а модель генерирует готовый, запускаемый фронтенд-код с учётом цветов, компонентов и расположения элементов
• Визуальное исследование сайтов — может сама ходить по веб-сайту, собирать скриншоты, карту переходов и ассеты, а потом написать код на основе увиденного
• Image Captioning — анализирует фото и генерирует понятное текстовое описание: объекты, их связи, атмосфера, действия
• Генерация промптов по картинке/видео — по загруженному изображению или видео сама составляет качественный, структурированный промпт для дальнейшей работы
• Агентные данные и верификация — для обучения была создана специальная система проверяемых данных, чтобы модель умела действовать как автономный агент
• Интеграция с агентами Claude Code и OpenClaw
• GUI-агент — умеет взаимодействовать с графическими интерфейсами (кнопки, поля, меню) как реальный пользователь, в браузере и на мобильных устройствах
Китайцы снова на коне 😳
Пет-проект

