TGViewer
Onigiri Onigiri @onigiriscience · 13.5K subscribers
Post #145 20.6K
Видели новую презентацию от OpenAI? Оказывается, там показали далеко не все.

Так как новая модель мультимодальная, она может не просто понимать интонацию, отвечать разными голосами или петь, как показали в презентации. Но она еще может генерировать звуки, картинки и даже 3D-модели по запросу.

И вроде бы, генерация картинок была и раньше, но вот, как она была устроена: есть модель dalle, которая по текстовому запросу генерирует картинку, и есть модель gpt, которая общается текстом. Если мы просим gpt что-то нарисовать, то она формирует запрос для dalle, которая уже по этому запросу создает изображение.

Если мы общаемся с gpt голосом, то звук сначала идет в модель whisper, которая преобразует его в текст, а уже текст передается в gpt. На выходе ответ gpt тоже нужно преобразовать обратно в речь. И того, тут задействованы 3 разные модели.

Теперь это все может делать одна только gpt. А это значит, что она будет быстрее отвечать и гораздо лучше понимать изображения.
Например, она сможет рисовать одного и того же персонажа в разных ситуациях (что очень сложно для других нейросетей)

А еще, она сможет редактировать изображения или даже изображать на них полноценный текст и сложные узоры. (картинки приложил к посту)
  • 👍 255
  • 🤯 84
  • ❤‍🔥 24
  • 🔥 17
  • ❤ 13
  • 👾 5
  • 😢 4
  • 🆒 4
  • 🍾 2
More from @onigiriscience
  1. Sep 12, 2026Видели, сколько там уже симуляций с мухой? 🪰 3 сентября гугл выложили мозг и центральную…
  2. Sep 11, 2026Там в стиме вышло демо стрелочек! https://store.steampowered.com/app/5193870/Logic_Arrows_…
  3. Aug 27, 2026С этой недели стрим пока перенесу, нужно выспаться после вчерашнего перелета. А вместо это…
  4. Aug 26, 2026Post #365
  5. Aug 17, 2026Post #364
  6. Aug 14, 2026Post #363
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →