TGViewer
ТЕХНО: Яндекс про технологии ТЕХНО: Яндекс про технологии @techno_yandex · 224K subscribers
Post #4246 22.3K
Как устроено зрение нейросетей

В Live-режиме, доступном с опцией Про, Алиса может отвечать не только на текстовые и голосовые запросы, но и на визуальные. Это стало возможным благодаря VLM (Visual Language Model) — визуально-текстовой модели, которая решает задачи, связанные с изображениями. Теперь Live-режим и ещё одна функция на базе VLM Яндекса появились в смартфонах HUAWEI Pura 80 Pro и 80 Ultra, где Алиса стала помощником по умолчанию, поэтому мы решили рассказать, как работает эта технология.

Как работает VLM?

VLM-модели называют мультимодальными. Это значит, что они умеют работать с разными типами данных одновременно — с текстом и изображениями. Например, пользователь может загрузить картинку и задать вопрос («Как часто поливать этот цветок?»), а модель распознает изображение и сгенерирует ответ.

VLM-модели состоят из трёх компонентов:

🔸 Языковая модель, которая умеет работать с текстами (в Алисе это YandexGPT 5 Pro)

🔸 Визуальный энкодер, который умеет работать с изображениями

🔸 Адаптер — нейросеть, которая объединяет визуальную и текстовую составляющую

Энкодер разбивает изображение на небольшие фрагменты и переводит их в векторы, понятные адаптеру, а адаптер конвертирует эти фрагменты в величины, понятные языковой модели. Чтобы VLM научилась сопоставлять визуальные и текстовые векторы, её обучают на миллионах примеров (запрос с картинкой + готовый ответ).

Какие возможности это даёт Алисе?

Благодаря VLM Алиса может видеть пользовательский запрос прямо через камеру смартфона (её надо включить в приложении). Например, если сфотографировать продукты в холодильнике и спросить, что из них приготовить, VLM распознает объекты в кадре, и Алиса предложит несколько рецептов. А если навести камеру на какую-то достопримечательность, Алиса сможет рассказать о ней.

В новые HUAWEI Pura 80 Pro и 80 Ultra также впервые встроен Поиск Яндекса по картинкам, который тоже работает на VLM Яндекса. Он позволяет нажать двумя пальцами на экран, а VLM распознаёт объекты на нём и помогает найти информацию о них в интернете.

Подписывайтесь 👉 @techno_yandex
  • 👍 84
  • ❤ 26
  • 🔥 13
More from @techno_yandex
  1. Oct 2, 2026Post #5754
  2. Oct 2, 2026Сомневаетесь, стоит ли связываться с ИИ-агентами? Собрали простой чек-лист, по которому ле…
  3. Oct 2, 2026Шрифты против ИИ С начала 2010-х дизайнеры экспериментируют со шрифтами, которые пытаются…
  4. Oct 1, 2026Если модель говорит по-русски, это ещё не значит, что вы с ней на одной волне Каждую нейро…
  5. Oct 1, 2026Яндекс создал ИИ-разработчика. А мы позвали в ТЕХНО того, кто его создал — руководителя пл…
  6. Oct 1, 2026В клавиатуре смартфона до сих пор живут решения инженеров XIX века. Рассказываем, как QWER…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →