TGViewer
Speech Info Speech Info @speechinfo · 1.37K subscribers
Post #175 1.45K
Interaction Models: A Scalable Approach to Human-AI Collaboration

Каскад из VAD, ASR, LLM и TTS всё ещё остаётся одним из самых понятных способов собрать голосового агента. Компоненты можно независимо улучшать и менять распознавание, языковую модель, поиск, инструменты, и, конечно же, синтез. Но за модульность приходится платить — задержки компонентов складываются, а взаимодействие обычно остаётся пошаговым: сначала говорит пользователь, затем отвечает модель. Согласитесь, это не то, как общаются люди.

Перебивания, паузы, короткие подтверждения и невербальные сигналы приходится обрабатывать через dialog manager, VAD и набор эвристик. Стриминговые же ASR и TTS могут уменьшить задержку, но фундаментально эту схему не меняют.

Альтернатива — полнодуплексные (full-duplex) speech-to-speech-модели. Например, Moshi от Kyutai одновременно слушает пользователя и генерирует собственный аудиопоток. Это позволяет естественнее обрабатывать перебивания и наложение реплик. Авторы заявляют потоковую задержку около 200 мс. Но такие full-duplex-модели в первую очередь оптимизировались под естественность разговора, а не под сложное рассуждение и instruction following. Поэтому они могут хорошо поддерживать беседу, но уступают крупным LLM в содержательных и агентных задачах.

Thinking Machines Lab в своем блогпосте предлагают подход под названием Interaction Models, который должен объединить интерактивность и возможности больших языковых моделей. Interaction Model не ждёт завершения пользовательской реплики, чтобы сгенерировать ответ. Вместо этого входной и выходной потоки делятся на фрагменты длиной около 200 мс:

input₀ → output₀ → input₁ → output₁ → input₂ → output₂ → ...


Каждый input содержит очередной фрагмент текста, аудио или видео (или всего вместе), а output — соответствующую часть ответа. Выходом может быть речь, текст или тишина, если модели «нечего сказать». Таким образом, паузы, перебивания и одновременная речь становятся частью моделируемой последовательности, а не отдельными событиями внешнего dialog manager.

Модель объединяет модальности на раннем этапе без тяжёлых специализированных энкодеров. Аудио представляется через dMel-представление, изображения разбиваются на патчи и обрабатываются небольшим hMLP, а за генерацию аудио отвечает Flow-голова. Все компоненты обучаются совместно с самим трансформером с нуля, end-to-end.

Во время инференса такая схема создаёт необычную нагрузку на inference server. Обычные LLM-серверы оптимизированы под крупный prefill и последующий длинный decode. Здесь же каждые 200 мс появляется новый небольшой фрагмент входа, поэтому приходится постоянно чередовать короткие prefill'ы и decode'ы.

Чтобы этого добиться, команда реализовала механизм streaming sessions. Клиент отправляет новые фрагменты отдельными запросами, но сервер сохраняет последовательность в GPU-памяти и продолжает её дописывать. Версию этого механизма авторы добавили и в SGLang. Для собственного же инференс-стека заявляют переход на MoE-ядра со стратегией gather + GEMV вместо grouped GEMM. По словам разработчиков, такой подход лучше подходит для небольших тензоров, возникающих при низколатентном bidirectional serving.

Но одних микротернов недостаточно, чтобы модель одновременно быстро реагировала и была достаточно умной. Поэтому к лёгкой отзывчивой модели добавляют тяжелую интеллектуальную. Получается эдакое разделение ролей. Interaction Model постоянно участвует в разговоре: слушает пользователя, отвечает на простые вопросы и обрабатывает паузы и перебивания. А Background Model асинхронно выполняет более сложные задачи: рассуждает, использует поиск и инструменты, а затем возвращает результаты Interaction Model, которая их озвучивает. По сути, авторы разделяют conversation latency и reasoning latency. При этом быстрая модель не такая уж маленькая. TML-Interaction-Small — это MoE-модель с 276 млрд параметров, из которых для каждого токена активны около 12 млрд.

На FD-bench v1.5, проверяющем перебивания, backchanneling и реакцию на фоновую речь, Thinking Machines сообщает результат 77,8 против примерно 39–54 у сравниваемых систем (Gemini Flash Live, ChatGPT Realtime). Средняя задержка между ходами на FD-bench v1 составила 0,4 секунды. К этим результатам стоит относиться осторожно. Часть тестов разработана или адаптирована самой командой, некоторые оценки проводятся с background agent, а независимого воспроизведения пока нет.

В целом Interaction Models выглядят как промежуточный вариант между классическим голосовым каскадом и полностью монолитной speech-to-speech-моделью. Главная идея здесь не только в микрочанках, но и в разделении двух задач: быстрая модель поддерживает естественный ритм разговора, а фоновая LLM отвечает за сложное рассуждение и работу с инструментами. Пока это только research preview. Насколько подход масштабируется на длинные разговоры, высокую нагрузку и реальные продукты, ещё предстоит проверить.

Иван Матвиенко ❣ Специально для Speech Info
  • 🔥 19
  • ❤ 9
  • 👌 4
  • 👍 2
  • 🤩 1
More from @speechinfo
  1. Sep 23, 2026Compress the Cache, Not the Speech Embedding: KV Compression for Efficient Speech LLMs Инф…
  2. Sep 17, 2026Voice Memory for Agentic Speech Recognition Сегодня разбираем работу от NVIDIA о том, как…
  3. Sep 10, 2026OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models Сег…
  4. Sep 2, 2026MOSS-TTS Technical Report Разбираем техрепорт MOSS-TTS. В нём генерацию речи пытаются свес…
  5. Aug 26, 2026Как научить машину слышать «естественно»: GSRM и UniSRM [2/2] В SpeechJudge, которую мы уж…
  6. Aug 19, 2026Как научить машину слышать «естественно»: SpeechJudge [1/2] Сегодня начинаем разбирать три…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →