🚀 (1/2) Transformer в задачах НЕ текстовой модальности
В прошлом посте мы разбирали архитектуру Transformer в рамках работы с текстом. Сегодня поговорим про то, как Transformer может работать с другими модальностями.
📝О терминологии: мультимодальность - способность модели работать с несколькими модальностями одновременно: текст, аудио, видео, изображение.
🎨Изображение:
Трансформер изначально создавался для работы с текстом. Однако, в статье Vision Transformer (ViT) данная архитектура была успешно адаптирована к работе с изображениями.
Особенности: изображение разбивается на маленькие куски (патчи), которые затем обрабатываются как последовательность. Ключевой слой Self-Attention помогает модели учитывать отношения между различными патчами изображения.
Затем появились мультимодальные модели LLaVA и CLIP, способные принимать на вход изображение и текстовый промпт. Такой подход позволил моделям решать задачу image captioning (описание изображения) и классифицировать изображения без дообучения. Более подробно про это тут.
🎶Аудио:
Ключевой моделью на базе Transformer в работе с аудио является Whisper от OpenAI.
Особенности: аудиосигнал преобразуется в спектрограмму или векторные представления, которые затем обрабатываются трансформером. Self-Attention позволяет модели выделять важные фрагменты звука.
Модель решает задачи распознавания речи (ASR), анализа звуковых сигналов и преобразование аудио в текст (Speech to Text).
🎥Видео:
В работе с видео трансформеры строятся на архитектурах ViViT и TimeSFormer.
Особенности: видео разбивается на последовательности кадров, которые обрабатываются как патчи изображений с учетом времени. Self-Attention учитывает как пространственные, так и временные связи между кадрами.
Модели подобных архитектур могут решать задачи анализа и классификации видео и генерации описаний к ним.
📚Дополнительное чтиво:
- Статья на Хабре про первую настоящую мультимодальную модель gpt-4o
- Про ViT для новичков читайте тут
- Подробные обзоры про ViT-like архитектуры для более продвинутых
- Распознавание речи, генерация субтитров и изучение языков при помощи Whisper на Хабре для практиков
- Подробный разбор, про ViViT и TimeSFormer, чтобы въехать
- Gitbook про трансформеры для более продвинутых (много дополнительного материала и кода)
Ставьте лайки❤️ и огоньки🔥 для следующих крутых постов!
Пишите свои комментарии! До встречи👋🏻
Post #471
8.1K
- ❤ 16
- 🔥 11
- ❤🔥 2
- 👍 1