Скоро у openai появится агентная модель уровня sol+ с нативным audio инпутом как у gemini (ставлю на до конца года)
Что это будет значить для нас:
Для всех, кто работает с генераторами музыки, диалоговыми аудио ботами, монтажем подкастов и т.д. – это огромное подспорье.
Как нативное понимание image когда-то позволило сильно прокачать возможности агентов во фронтенде, дизайне и любом другом визуале – если агент "видит" результат работы, он сразу может найти косяки и исправить их. Тот самый feedback loop, где feedback – это сам результат работы
Так же будет и с аудио. Сейчас я работаю с локальными генераторами аудио и voice cloning, и этого прям жестко не хватает. Поэтому приходится использовать самодельную версию агента с модельками gemini по API. Из альтернатив есть Antigravity – они добавили это к себе буквально через пару недель после моего эксперимента, причем сразу и с поддержкой видео (это, кстати, единственная причина использовать Antigravity, которую я знаю)
Если кому интересно, на чем основывается предсказание про появление омни модельки от openai:
Примерно месяц назад я расковырял новый коммит в codex-cli, который добавляет audio как валидный тип результата для tool_calls (наравне с text и image). Так же они добавляют это в поддержку MCP. И даже в dynamic_tools (это тулы, которые можно инжектить в codex извне. Например, codex desktop, который под капотом запускает codex, инжектит туда тулы для управления встроенным браузером и соседними чатами.
Короче, раз поддержка добавлена в харнес, то и модели должны быть на подходе
Ваш диванный предсказатель, @ai_grably