⚡️Сегодня выпустили обновление нашей мультимодальной модели OmniFusion 1.1
Модель умеет понимать изображения, описывать сцены и отвечать на вопросы по картинкам. В основе open-source модели лежит языковая модель Mistral-7B.
В остальном было проделано большое число экспериментов,в числе которых:
- сравнили различные визуальные энкодеры
- научились смешивать несколько энкодеров для усиления визуального контекста
- проверили влияние механики нарезки картинки на фрагменты с последующим их энкодингом
В итоге побили 7B аналогичные решения на ряде бенчмарков, побили также 13B модели на некоторых бенчах. Исследования продолжаются, чтобы выбить однозначную SoTA на всех задачах и приблизиться к GPT4-Vision.
Сегодня выпустили technical report на arXiv, который попал в Daily Papers на Hugging Face и уже занимает там сейчас первое место🏆
📍Project page
📍Статья на Хабре
📍GitHub
Буду крайне признателен, если поддержите лайками, звёздами и upvote по ссылкам выше - всей команде будет супер приятно🙏
@complete_ai
Post #365
6.2K


- 🔥 55
- 👍 20
- 🏆 9
- ❤🔥 7
- ❤ 1