TGViewer
NGI | Влад Корнышев про AI и создание AI-продуктов NGI | Влад Корнышев про AI и создание AI-продуктов @ngi_ru · 4K subscribers
Post #122 288
Мультимодальность: даем ИИ зрение, слух и голос

Когда погружаешься в тему ИИ, то и дело слышишь про некую "мультимодальность". Недавно я уже рассказывал про креативность ИИ, а сегодня хочу подробнее остановиться на мультимодальности, и в будущем я планирую продолжить цикл статей, разъясняющих терминологию, связанную с ИИ.

Так что же это за зверь такой - мультимодальность, и почему о ней сейчас так часто говорят?
Если совсем просто, мультимодальность — это способность ИИ воспринимать и обрабатывать информацию из разных источников: текст, изображения, аудио, видео. Представьте, что обычная большая языковая модель (LLM) — это невероятно умный человек, но... слепой и глухой. Он виртуозно владеет словом, может генерировать тексты, писать код, но реальный мир для него ограничен лишь строчками текста, которые он получает на вход.

Мультимодальность же дает ИИ "органы чувств". Это как если бы наш слепой и глухой гений вдруг прозрел и обрел слух! Теперь он может не только прочитать описание картины, но и увидеть ее, не только получить текст песни, но и услышать ее мелодию, уловить интонации.

Именно мультимодальность делает ИИ по-настоящему применимым в реальном мире. Ведь мы с вами живем не в мире текста. Нас окружают звуки, образы, видео – целый вихрь информации, которую мы, сами того не замечая, обрабатываем ежесекундно. Чтобы ИИ стал не просто умной игрушкой, а полноценным помощником, способным решать реальные задачи, ему необходимо научиться воспринимать мир во всем его многообразии.

Помните Джарвиса из "Железного человека"? Этот остроумный ИИ-ассистент Тони Старка — яркий пример мультимодальности в действии. Джарвис анализирует визуальные данные с камер, распознает речь, генерирует голографические интерфейсы, да и вообще, ведет себя как полноценный собеседник. Конечно, до такого уровня нам еще далеко, но именно к этому стремятся все крупные игроки ИИ-рынка.

Google, OpenAI, Anthropic – все они активно прокачивают мультимодальные возможности своих моделей. Добавляют голосовой ввод, распознавание изображений, генерацию видео. И это не просто погоня за хайпом. Компании понимают, что за мультимодальностью – будущее.

Мы сейчас находимся на том самом этапе, когда эта технология активно развивается. И результаты уже впечатляют! Взгляните, например, на Android XR – операционную систему для устройств дополненной реальности. Совместно с умными очками и продвинутым ИИ-ассистентом Gemini, она обещает совершенно новый уровень взаимодействия с цифровым миром. Прикрепляю небольшое видео с демонстрацией к этому посту.

Думаю, что в ближайшие годы мы увидим еще более впечатляющие примеры применения мультимодальности. И, возможно, Джарвис уже не будет казаться нам такой уж фантастикой. 😉

#обучающиематериалы
  • 🔥 5
More from @ngi_ru
  1. Sep 16, 2026Делаем вторую версию конференции ROИИ Многие из вас помнят нашу первую конференцию в февра…
  2. Sep 14, 2026Post #668
  3. Sep 11, 2026Post #667
  4. Sep 9, 2026Post #666
  5. Sep 8, 2026Post #665
  6. Sep 3, 2026Kickstarter как лучший тренажер для продуктового питча Поймал себя на том, что в последнее…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →