OpenAI выкатили GPT-Realtime-2 в API - https://openai.com/index/advancing-voice-intelligence-with-new-models-in-the-api/.
Это новая голосовая модель для realtime-агентов: слушает, отвечает голосом, может использовать инструменты и, по словам OpenAI, получила reasoning уровня GPT-5.
Рядом с ней появились еще две отдельные штуки для аудио:
- GPT-Realtime-Translate для живого перевода речи;
- GPT-Realtime-Whisper для потоковой расшифровки речи в текст.
Лично я этого ждал, потому что активно пользуюсь голосовыми интерфейсами. И кажется, мы заходим на очередной виток внимания к голосу.
Пока ставлю на 2027 🙂
Сейчас это только в API. Надеюсь, в подписку это тоже добавят в каком-то виде скоро 🙂
Post #678
484