TGViewer
Generative Ai Generative Ai @deeplearning_ru · 3.7K subscribers
Post #1048 1.88K

Forwarded from Data Secrets

OpenAI выкатили в API три новые аудио-модели

🔷 Первые две – speech2text. Лучше Whisper, и вообще заявляют SOTA, которые к тому же хорошо работают с акцентами, шумом и быстрой речью.

Отличие между двумя – в размерах (ну и цене): первая gpt-4o-transcribe, вторая – gpt-4o-mini-transcribe. Разницу в метриках и приросты оцените сами 👆

🔷 Третья моделька – gpt-4o-mini-tts – позанятнее. Это, наоборот, text2speech, то есть модель, проговаривающая текст. Но не просто проговаривающая, а с той интонацией и тем голосом, которые зададите вы. Поиграться уже можно здесь www.openai.fm/

🔷 Ну и новая либа для агентов Agents SDK теперь тоже поддерживает аудио, так что с этого дня там можно создавать говорящих агентов.

openai.com/index/introducing-our-next-generation-audio-models/
  • 👍 4
  • 🤯 2
  • 👎 1
More from @deeplearning_ru
  1. Sep 18, 2026Очень хороший прогресс для локальных моделей. PrismML выпустила Bonsai 2 27B на базе Qwen3…
  2. Sep 17, 2026Google открыла исходный код ARTEMIS — инструмента, который позволяет ИИ управлять Android-…
  3. Sep 14, 2026Looped Transformer сейчас одна из самых обсуждаемых архитектурных идей. В новом техническо…
  4. Sep 11, 2026Несчастное сознание дрозофилы наконец-то обрело счастье — ее научили смотреть тиктоки с ро…
  5. Sep 10, 2026Если вам не нравится, что при работе с ИИ история, настройки и данные отправляются на чужи…
  6. Sep 8, 2026OpenAI выложили решение задачи тысячелетия Мы делимся решением проблемы Навье-Стокса, одно…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →