TGViewer
Speech Info Speech Info @speechinfo · 1.38K subscribers
Post #141 927
В Рио — жара! Освежаемся статьями с ICLR

Как и полагается на старте, в первый день конференции не все постеры оказались на законных местах и не все спикеры — у своих стендов. Но кое-что интересное нам удалось раздобыть.

TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling

Речевые токенизаторы обычно работают в дискретизации намного выше текстовой — это 12.5Hz и выше против ~3Hz у текста. При попытке делать текстово-речевые модели (Spoken Language Models) приходится придумывать способы выравнивания последовательностей, как в Moshi, например.

Авторы предлагают выучить токенизатор, который выдаёт по одному речевому токену на каждый текстовый, чтобы синхронизировать эти последовательности. Делают это через фичи Whisper Encoder, которые используют как key и value для кросс-аттеншна, а query — оригинальный текст входного аудио. Это позволяет сократить frame-rate аудиотокенов до ~3Hz, прямо как у текста. На таком токенизаторе авторам удаётся обучать text-speech SLM с более высоким качеством по сравнению с другими подходами.

Can Speech LLMs Think while Listening?

Работа о добавлении Chain-of-Thought в Speech LLM и снижении latency, которую CoT обычно добавляет в голосовых агентах. В режиме “thinking while listening” модель начинает текстовое CoT-рассуждение ещё до того, как пользователь закончил говорить. Для этого с каждым новым словом оценивается, насколько текущий префикс вопроса уже достаточен, чтобы получить те же размышления и ответ, что и по полному вопросу. Когда вопрос становится достаточно «полным», модель может начать ризонинг раньше.

Сначала модель дообучают на таких early-CoT-примерах, а затем применяют DPO — генерируют несколько вариантов рассуждения с ранним стартом и выбирают более правильные и/или короткие цепочки рассуждений.

Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning

И ещё о ризонинге. Обычные аудиоязыковые модели (ALM) кодируют звук один раз вначале — и дальнейший процесс рассуждения происходит только текстом. Echo предлагает использовать аудио прямо внутри рассуждений и дать модели возможность вставлять его определённый отрезок внутрь текстового ризонинга. Это позволяет модели лучше обуславливаться на аудио, особенно в длинных генерациях, а также хорошо растит результаты на бенчмарках.

На последнем фото — мудрость от организаторов: статьи на тему голосовых технологий лучше не читать, а слушать.

Интересным поделились ❣ Владимир Гогорян, Варвара Фурик и Ярослав Ведерников

#YaICLR26

Speech Info
  • ❤ 18
  • 🔥 12
  • 👍 10
  • ❤‍🔥 2
More from @speechinfo
  1. Oct 1, 2026Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs Сегодня р…
  2. Sep 23, 2026Compress the Cache, Not the Speech Embedding: KV Compression for Efficient Speech LLMs Инф…
  3. Sep 17, 2026Voice Memory for Agentic Speech Recognition Сегодня разбираем работу от NVIDIA о том, как…
  4. Sep 10, 2026OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models Сег…
  5. Sep 2, 2026MOSS-TTS Technical Report Разбираем техрепорт MOSS-TTS. В нём генерацию речи пытаются свес…
  6. Aug 26, 2026Как научить машину слышать «естественно»: GSRM и UniSRM [2/2] В SpeechJudge, которую мы уж…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →