TGViewer
Тест Тьюринга Тест Тьюринга @testuring · 2.13K subscribers
Post #2221 280
💬 Thinking Machines представила ИИ, который умеет перебивать человека

Мира Мурати ушла из OpenAI в сентябре 2024-го, привлекла $2 млрд инвестиций в свой стартап Thinking Machines при оценке $9 млрд — и 18 месяцев молчала об успехах. Не было ни продуктов, ни технических заявлений, ни релизов.

11 мая Thinking Machines опубликовала первый публичный релиз и сразу заявила, что все крупные ИИ-лаборатории построили голосовой ИИ неправильно.

Основные факты

Современный голосовой ИИ — это набор компонентов, навешанных поверх языковой модели: VAD определяет конец фразы, TTS синтезирует речь, диалоговый менеджер следит за очерёдностью. Пока пользователь говорит — модель немая. Пока модель отвечает — слепая. Thinking Machines называют это harness-подходом и утверждают, что он архитектурно ограничен: вспомогательные компоненты значительно менее умны, чем основная модель.

Альтернатива — TML-Interaction-Small: MoE-модель на 276 млрд параметров (12 млрд активных), которая обрабатывает аудио, видео и текст параллельными потоками в чанках по 200 мс без отдельного энкодера преобразования. Это называется Encoder-Free Early Fusion — сырой звук и видео поступают напрямую в трансформерные слои.

Для сложных задач, типа поиска в вебе, вызова инструментов, работает асинхронная фоновая thinking-модель. Она обрабатывает запрос, пока интерактивная модель продолжает диалог, и докидывает результат в живой разговор без паузы.

В итоге у модели Thinking Machines задержка 0,40 секунды против 1,18 с у GPT-Realtime-2 и 0,57 у Gemini 3.1 Flash. На FD-bench v1.5: TML-Interaction-Small — 77,8 балла, GPT-Realtime-2 и Gemini Live — 46–54. На тесте Cued Response Timing GPT-Realtime-2 minimal набирает 2,9%, на Temporal Action Localisation — 0%.

Высокотехнологичные черты

Архитектура позволяет три сценария, недоступных раньше:
➡️ перебить пользователя в момент ошибки, не дожидаясь конца фразы;
➡️ вести живой перевод, говоря одновременно с пользователем;
реагировать на визуальный триггер — поднятый палец,
➡️ нарушение протокола на производственной линии, повторение в тренировочном видео — без явного вопроса.

ProactiveVideoQA и RepCount-A — бенчмарки именно для таких задач, которые harness-системы решить не могут.

Основная критика

Бенчмарки FD-bench и Cued Response Timing разработала сама Thinking Machines — они пока не валидированы независимыми исследователями. Компания сама признаёт это ограничение и приглашает сообщество строить альтернативные фреймворки оценки.

TML-Interaction-Small значительно меньше frontier-моделей OpenAI и Google. Более мощные варианты пока слишком медленны для real-time — то есть сравнение по качеству рассуждений с теми же GPT-5.5 или Gemini сейчас не в пользу Thinking Machines.

Длинные сессии накапливают контекст: непрерывные аудио- и видеопотоки быстро заполняют память модели. Это открытая проблема, над которой команда работает.

Harness-подход, который Thinking Machines называет «мёртвым концом», практически работает для миллионов пользователей OpenAI — Realtime API один из наиболее развёрнутых продуктов компании.

Что самое многообещающее

Архитектурный тезис получает подтверждение данными: VAD-зависимые системы действительно не умеют реагировать на временны́е триггеры или визуальные сигналы.

Стратегия та же, что у предшественников: Murati публикует парадигму до того, как конкуренты успевают оформить разговор вокруг своих продуктов. Если в течение полугода OpenAI объявит, что следующая версия Realtime API переходит от VAD к нативному стримингу, то это будет ответом.

Применения, где важна синхронность: хирургическая ассистенция, промышленный контроль качества, реабилитация, синхронный перевод — впервые становятся технически реалистичными без костылей.


💬 Тест Тьюринга. События в сфере ИИ. Подписаться
  • ❤ 1
  • 👍 1
  • 🔥 1
More from @testuring
  1. Sep 23, 2026ИИ, который не умеет генерить текст и картинки, но зато умеет выбирать Соавтор статьи об I…
  2. Sep 22, 2026🧪 Новый инструмент проверки научных гипотез AlphaXiv выпустила OpenResearch — открытую ра…
  3. Sep 21, 2026👿 Новости из Японии: снова оркестрация вместо одной гигантской ИИ-модели 11 сентября япон…
  4. Sep 18, 2026⚠️ ИИ уже нарушает правила, которые люди только начинают писать На этой неделе произошло с…
  5. Sep 17, 2026⚡️ Новая мировая линейка неравенства между государствами будет измеряться токенами China T…
  6. Sep 16, 2026🔐 У искусственного интеллекта появляется технадзор Сразу две новости, вышедшие за последн…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →