Мира Мурати ушла из OpenAI в сентябре 2024-го, привлекла $2 млрд инвестиций в свой стартап Thinking Machines при оценке $9 млрд — и 18 месяцев молчала об успехах. Не было ни продуктов, ни технических заявлений, ни релизов.
11 мая Thinking Machines опубликовала первый публичный релиз и сразу заявила, что все крупные ИИ-лаборатории построили голосовой ИИ неправильно.
Основные факты
Современный голосовой ИИ — это набор компонентов, навешанных поверх языковой модели: VAD определяет конец фразы, TTS синтезирует речь, диалоговый менеджер следит за очерёдностью. Пока пользователь говорит — модель немая. Пока модель отвечает — слепая. Thinking Machines называют это harness-подходом и утверждают, что он архитектурно ограничен: вспомогательные компоненты значительно менее умны, чем основная модель.
Альтернатива — TML-Interaction-Small: MoE-модель на 276 млрд параметров (12 млрд активных), которая обрабатывает аудио, видео и текст параллельными потоками в чанках по 200 мс без отдельного энкодера преобразования. Это называется Encoder-Free Early Fusion — сырой звук и видео поступают напрямую в трансформерные слои.
Для сложных задач, типа поиска в вебе, вызова инструментов, работает асинхронная фоновая thinking-модель. Она обрабатывает запрос, пока интерактивная модель продолжает диалог, и докидывает результат в живой разговор без паузы.
В итоге у модели Thinking Machines задержка 0,40 секунды против 1,18 с у GPT-Realtime-2 и 0,57 у Gemini 3.1 Flash. На FD-bench v1.5: TML-Interaction-Small — 77,8 балла, GPT-Realtime-2 и Gemini Live — 46–54. На тесте Cued Response Timing GPT-Realtime-2 minimal набирает 2,9%, на Temporal Action Localisation — 0%.
Высокотехнологичные черты
Архитектура позволяет три сценария, недоступных раньше:
➡️ перебить пользователя в момент ошибки, не дожидаясь конца фразы;
➡️ вести живой перевод, говоря одновременно с пользователем;
реагировать на визуальный триггер — поднятый палец,
➡️ нарушение протокола на производственной линии, повторение в тренировочном видео — без явного вопроса.
ProactiveVideoQA и RepCount-A — бенчмарки именно для таких задач, которые harness-системы решить не могут.
Основная критика
Бенчмарки FD-bench и Cued Response Timing разработала сама Thinking Machines — они пока не валидированы независимыми исследователями. Компания сама признаёт это ограничение и приглашает сообщество строить альтернативные фреймворки оценки.
TML-Interaction-Small значительно меньше frontier-моделей OpenAI и Google. Более мощные варианты пока слишком медленны для real-time — то есть сравнение по качеству рассуждений с теми же GPT-5.5 или Gemini сейчас не в пользу Thinking Machines.
Длинные сессии накапливают контекст: непрерывные аудио- и видеопотоки быстро заполняют память модели. Это открытая проблема, над которой команда работает.
Harness-подход, который Thinking Machines называет «мёртвым концом», практически работает для миллионов пользователей OpenAI — Realtime API один из наиболее развёрнутых продуктов компании.
Что самое многообещающее
Архитектурный тезис получает подтверждение данными: VAD-зависимые системы действительно не умеют реагировать на временны́е триггеры или визуальные сигналы.
Стратегия та же, что у предшественников: Murati публикует парадигму до того, как конкуренты успевают оформить разговор вокруг своих продуктов. Если в течение полугода OpenAI объявит, что следующая версия Realtime API переходит от VAD к нативному стримингу, то это будет ответом.
Применения, где важна синхронность: хирургическая ассистенция, промышленный контроль качества, реабилитация, синхронный перевод — впервые становятся технически реалистичными без костылей.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
