TGViewer
Speech Info Speech Info @speechinfo · 1.37K subscribers
Post #145 693
Продолжаем делиться статьями с ICLR 2026

Сегодня у нас на очереди две работы: о новом методе выравнивании речи и текста и общем эмбеддинг-пространстве для мультимодальных LLM. В одном разборе даже удалось получить комментарий от автора.

Closing the Gap Between Text and Speech Understanding in LLMs

Одна из самых интересных работ по аудио, да ещё и с приятным автором. Важная проблема ALM (Audio Language Model) — разрыв между модальностями. Если задать один и тот же вопрос голосом и текстом, зачастую можно получить разные ответы.

Авторы анализируют причины этого разрыва (в виде различий в распределениях текстовых и аудоданных) и предлагают SALAD — метод, который выравнивает речевую модель с текстовой LLM через кросс-модальную дистилляцию и умный отбор синтетических речевых данных.

Главное преимущество подхода — он требует значительно меньше речевых данных, но заметно сокращает разрыв между текстовым и речевым пониманием.

WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM

В работе предлагают использовать мультимодальную LLM как основу для единого эмбеддинг-пространства, где можно сопоставлять текстовые, аудио-, видео- и аудиовизуальные данные. Модель обучается так, чтобы представление зависело не только от входной модальности, но и от текстовой инструкции к задаче.

Авторы извлекают репрезентации из нескольких верхних слоёв модели, потому что разные уровни могут кодировать разную информацию. Затем эти представления объединяются через небольшой fusion-модуль, который формирует итоговый эмбеддинг для retrieval/QA-задач.

Такие унифицированные представления полезны, например, когда важно одновременно учитывать, что происходит в кадре и что слышно в аудио. Показывают хорошие результаты на retrieval и multimodal QA.

Спросил у автора, может ли такой эмбеддер стать унифицированным энкодером для больших мультимодальных LLM. По его интуиции, подход особенно хорош именно для задач, где действительно нужна joint representation. Но для больших мультимодальных моделей в целом независимые энкодеры под конкретные цели всё ещё могут быть более практичным и чистым решением.


#YaICLR26

Ярослав Ведерников ❣ Специально для Speech Info
  • 🔥 14
  • ❤ 9
  • 👍 8
More from @speechinfo
  1. Sep 23, 2026Compress the Cache, Not the Speech Embedding: KV Compression for Efficient Speech LLMs Инф…
  2. Sep 17, 2026Voice Memory for Agentic Speech Recognition Сегодня разбираем работу от NVIDIA о том, как…
  3. Sep 10, 2026OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models Сег…
  4. Sep 2, 2026MOSS-TTS Technical Report Разбираем техрепорт MOSS-TTS. В нём генерацию речи пытаются свес…
  5. Aug 26, 2026Как научить машину слышать «естественно»: GSRM и UniSRM [2/2] В SpeechJudge, которую мы уж…
  6. Aug 19, 2026Как научить машину слышать «естественно»: SpeechJudge [1/2] Сегодня начинаем разбирать три…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →