🧿 Омнимодель для Алисы AI: как мы подружили VLM и LLM
Всем привет, меня зовут Алексей Григорьев, я представляю большую команду разработки омнимодели Яндекса. Ещё недавно ответы Алисы на текстовые запросы и вопросы по изображениям заметно различались по стилю. Под капотом и правда жили две отдельные генеративные модели: текстовая LLM и визуальная VLM, а между ними — стена из непрозрачного роутинга, отличающихся форматов ответов и вёрстки.
🧠 Почти год мы сводили их в одно целое — омнимодель, которая бесшовно воспринимает и текст, и изображения. Мотивация была простой: омни позволяет упростить продуктовую логику до одного чата вместо зоопарка сервисов, масштабироваться по данным, компьюту и размеру модели, а также добиться синергии качества за счёт раннего провязывания модальностей. Кроме того, у совместно обученной модели появляются эмерджентные свойства — навыки, которых не было ни у текстовой, ни у визуальной модели по отдельности.
Путь к омнимодели был непростым, но поучительным: нужно было целиком переосмыслить претрейн, завести визуальную модальность во все стадии обучения, по отдельности свести каждый шаг алайнмента...
🔛 Но игра стоила свеч: визуальная половина Алисы переняла у текстовой проактивность, манеру и стиль общения, а текстовая перестала отнекиваться, что «не умеет работать с картинками». Теперь на руках мы имеем сильно упрощённую инфраструктуру, выровненный характер модели и следующий уверенный шаг к мультимодальности.
🔳 А на Хабре вместе с моим коллегой Данилой Кашиным мы рассказали про остальные технические грабли и вызовы, с которыми команда столкнулась в процессе. В статье мы разобрали:
⚪️ Почему за два года до этого та же затея разваливалась и что тут изменила MoE-архитектура
⚪️ Как научить разные команды воспроизводить одно и то же обучение
⚪️ Почему один вид RL переезжает на большую модель легко, а другой рассыпается прямо на глазах
Подписывайтесь:
💬 @Yandex4ML
📹 @YandexML
Post #1561
2.28K

- ❤ 19
- 👍 6
- 😁 3
- 👏 2