TGViewer
Start Career in DS Start Career in DS @start_ds · 11.5K subscribers
Post #471 8.1K
🚀 (1/2) Transformer в задачах НЕ текстовой модальности

В прошлом посте мы разбирали архитектуру Transformer в рамках работы с текстом. Сегодня поговорим про то, как Transformer может работать с другими модальностями.

📝О терминологии: мультимодальность - способность модели работать с несколькими модальностями одновременно: текст, аудио, видео, изображение.

🎨Изображение:
Трансформер изначально создавался для работы с текстом. Однако, в статье Vision Transformer (ViT) данная архитектура была успешно адаптирована к работе с изображениями.
Особенности: изображение разбивается на маленькие куски (патчи), которые затем обрабатываются как последовательность. Ключевой слой Self-Attention помогает модели учитывать отношения между различными патчами изображения.

Затем появились мультимодальные модели LLaVA и CLIP, способные принимать на вход изображение и текстовый промпт. Такой подход позволил моделям решать задачу image captioning (описание изображения) и классифицировать изображения без дообучения. Более подробно про это тут.

🎶Аудио:
Ключевой моделью на базе Transformer в работе с аудио является Whisper от OpenAI.
Особенности: аудиосигнал преобразуется в спектрограмму или векторные представления, которые затем обрабатываются трансформером. Self-Attention позволяет модели выделять важные фрагменты звука.

Модель решает задачи распознавания речи (ASR), анализа звуковых сигналов и преобразование аудио в текст (Speech to Text).

🎥Видео:
В работе с видео трансформеры строятся на архитектурах ViViT и TimeSFormer.
Особенности: видео разбивается на последовательности кадров, которые обрабатываются как патчи изображений с учетом времени. Self-Attention учитывает как пространственные, так и временные связи между кадрами.

Модели подобных архитектур могут решать задачи анализа и классификации видео и генерации описаний к ним.

📚Дополнительное чтиво:
- Статья на Хабре про первую настоящую мультимодальную модель gpt-4o
- Про ViT для новичков читайте тут
- Подробные обзоры про ViT-like архитектуры для более продвинутых
- Распознавание речи, генерация субтитров и изучение языков при помощи Whisper на Хабре для практиков
- Подробный разбор, про ViViT и TimeSFormer, чтобы въехать
- Gitbook про трансформеры для более продвинутых (много дополнительного материала и кода)

Ставьте лайки❤️ и огоньки🔥 для следующих крутых постов!
Пишите свои комментарии! До встречи👋🏻
  • ❤ 16
  • 🔥 11
  • ❤‍🔥 2
  • 👍 1
More from @start_ds
  1. Sep 1, 2026🔥 Соревнование от Группы «Интер РАО»: получи подготовленные данные и разработай ИИ-ассист…
  2. Aug 8, 2026Мы как-то просили вас пройти опрос про роли и зарплаты профессий вокруг ML и аналитики дан…
  3. Aug 8, 2026От стажёра до Head of DS: что я узнал, изучив почти 700 карьер в Data Science 🧬 Наконец-т…
  4. Jul 28, 2026Пора тряхнуть стариной и в этом канале, давненько тут ничего не было 🙂 Я в личном канале…
  5. Jul 28, 2026🏆 Преподавание ML студентам очно в Москве Знаю, что этот канал читают многие мои выпускни…
  6. May 12, 2026🏆 ML-соревнование на стыке ML, роботов и науки Ребята из CayleyPy делают крутую штуку на…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →