Институт искусственного интеллекта AIRI представил открытую версию модели OmniFusion, OmniFusion 1.1. Мультимодальная языковая модель способна поддерживать визуальный диалог, отвечать на вопросы пользователей по изображениям и поддерживает русский язык. Исходный код опубликован в репозитории GitHub.
OmniFusion — это мультимодальная модель искусственного интеллекта, предназначенная для расширения возможностей традиционных систем обработки языка за счет интеграции дополнительных модальностей данных, например, изображений, а в перспективе – аудио, 3D- и видеоконтента.
Модель распознает и описывает изображения, может объяснить, что изображено на фото, узнать рецепт для приготовления блюда по фотографии ингредиентов, проанализировать карту помещения или узнать, как собрать устройство по фотографиям отдельных его частей. Модель также умеет распознавать текст и решать задачи. Например, с её помощью можно решить логические задачи, написанный на доске математический пример или распознать формулу, а также получить их представления в формате LaTeX.
Качество модели в разных вариантах её архитектуры оценили при помощи восьми известных бенчмарков, были проведены тесты на TextVQA — бенчмарке для оценки качества ответов на вопросы по изображениям, содержащим какой-либо текст, POPE — бенчмарке для оценки галлюцинаций (когда модель начинает придумывать несуществующие данные в ответах), а также ScienceQA — бенчмарке с вопросами, основанными на лекциях и вопросах на различные научные темы. Эксперименты по оценке качества показали, что OmniFusion достигает высоких результатов в большинстве бенчмарков, не уступая зарубежным моделям.
Обучением OmniFusion занимается научная группа FusionBrain института AIRI при участии учёных из Sber AI и SberDevices.
📚Тематические ссылки:
https://www.cnews.ru/news/line/2024-04-10_airi_predstavil_otkrytuyu_versiyu
Post #46
480
