👀 ИИ научится воспринимать мир как человек?
Сначала каждая ИИ-модель работала с одним типом данных, например текстами или изображениями. Потом их объединили в VLM — к языковой модели подключили визуальную через программный адаптер. А пару лет назад появился тренд на омни-модели, которые понимают разные типы данных без адаптеров. Алексей Григорьев, руководитель команды алайнмента VLM, считает, что это может привести к скачку в развитии ИИ.
Омни-модель (от лат. omnis — «всё») — это нейросеть, которую с самого начала учат работать и с текстами, и с изображениями. Создавать такие нейросети сложно, но «растить» одну модель вместо нескольких гораздо эффективнее. Сервисы на базе омни-моделей работают лучше, так как «под капотом» не нужно переключаться между нейросетями.
Самое интересное в омни-моделях — синергия: улучшение одной из модальностей улучшает и другую. Именно так случилось во время обучения омни-модели Alice AI на текстовых данных: она стала лучше обрабатывать и картинки тоже. Омни-модели улавливают связи между изображениями и текстом (например, пишут стихи по фотографии) и за счёт этого оказываются ближе к целостному восприятию мира, свойственному людям.
У омни-моделей даже могут появиться эмерджентные свойства — способности, которые не закладывали при разработке. Например, они могут научиться понимать физику реального мира.
Сейчас инженеры работают над тем, чтобы сбалансировать качество текстовой и визуальной выдачи внутри одной омни-модели. А в будущем разные модальности окончательно сольются в единую эффективную систему.
Подписывайтесь 👉 @techno_yandex
Post #5733
6.44K

- ❤ 25
- 👍 10
- 🔥 3
- 🤔 3
- 🥱 3
- 🤯 1
- 😐 1