Рынок речевых технологий пополнился двумя значимыми обновлениями от корпораций Google и OpenAI, которые задают новые векторы развития человеко-машинного взаимодействия. Google сосредоточилась на художественной выразительности синтезированной речи через интуитивно понятные теги, в то время как OpenAI сделала ставку на глубину аналитики и асинхронную обработку потока.
15 апреля 2026 года Google представила обновление модели Gemini 3.1 Flash TTS, предназначенной для преобразования текста в речь. Ключевой особенностью этого релиза стал отказ от сложных схем параметрической настройки в пользу управления через естественно-языковые маркеры. В отличие от классического подхода, использующего SSML (Speech Synthesis Markup Language), новая система позволяет разработчикам встраивать в исходный текст короткие теги, заключенные в квадратные скобки.
Спецификация модели включает поддержку более 200 аудиотегов, таких как whispers (шепот), laughs (смех), very slow (очень медленно) или happy (счастливый), что позволяет динамически менять эмоциональную окраску, громкость и темп речи внутри одного предложения. Модель поддерживает 70 с лишним языков и многоголосый диалог: система способна автоматически распределять реплики между разными синтезированными персонажами без необходимости склеивания нескольких аудиофайлов.
С технической точки зрения Gemini 3.1 Flash TTS возвращает аудио в формате 24 кГц с использованием PCM или Opus. Стоимость использования составляет $20 за 1 миллион выходных аудиотокенов, что, по оценкам аналитиков, примерно на порядок дешевле решений от ElevenLabs. В целях безопасности все генерируемые треки маркируются цифровым водяным знаком SynthID.
Примерно через три недели после анонса Google, OpenAI выпустила релиз линейки GPT-Realtime-2, которая кардинально меняет парадигму работы голосовых ассистентов. Если традиционные TTS работают по принципу «вопрос — ответ», то новый подход внедряет концепцию «пассивного прослушивания» с элементами автономного мышления.
GPT-Realtime-2 позиционируется как первая речевая модель с уровнем рассуждений GPT-5. Она способна не просто транскрибировать услышанное, а вести непрерывный потоковый анализ (streaming listening), распознавая паузы, междометия и смену контекста. Ключевым нововведением стали «предисловия» (preambles) и параллельный вызов инструментов. Ассистент может произнести фразу «Дайте-ка подумать» или «Проверяю календарь», имитируя человеческую паузу на размышление, в то время как система обращается к базам данных или API.
Модель характеризуется расширенным контекстным окном до 128 тысяч токенов, что позволяет удерживать нить часового разговора. Бенчмарки показывают рост эффективности: в тесте Big Bench Audio точность возросла с 81,4% у предыдущей версии до 96,6%. Архитектурно это решение представляет собой единый сквозной пайплайн (последовательную цепочку обработки данных), объединяющий STT, LLM и TTS, что минимизирует задержки при обработке сложных запросов.
Представленные подходы отражают разницу в философии продуктов. Google Gemini 3.1 Flash TTS нацелен на креативные индустрии, локализацию контента и озвучку диалогов, где требуется высокий контроль над интонацией. GPT-Realtime-2, напротив, сфокусирован на операторской деятельности: колл-центрах, планировании задач и ИТ-поддержке, где приоритетом является способность системы слушать между строк и инициировать действия без жесткой команды пользователя. Оба решения знаменуют переход от генерации голоса по шаблону к контекстуально- зависимому и «эмоциональному» искусственному интеллекту.
📕📕📕
Источник Apidog
Источник Dev.to
📲 MAX
Post #277
498

- ❤ 5