TGViewer
Мутный AI Мутный AI @mutniy_ai · 809 subscribers
Post #28 1.17K
Я уже вижу кучу сравнений нового генератора внутри Gemini (буду иногда называть его nano-banana, т.к. именно под этим названием они его обкатывали) с генератором внутри ChatGPT.

Если вы не просто энтузиаст, а типа дофига ИИшник, то подобные сравнения на собесе могут вас очень сильно дискредитировать.

Новая модель ближе к диффузионным Flux Kontext и Qwen Edit, а не к авторегрессионному ChatGPT.

Это принципиально разные технологии со своими сильными и слабыми сторонами.
Они решают разные задачи и требуют разных подходов.

Мне лично nano-banana зашла, но только для определённых задач, связанных с UGC и консистентным цветокором, т.к. она лучше попадает в цвета между генерациями.

Часть воркфлоу в моих командах достаточно давно выстроена на Flux Kontext, к которому недавно добавился Qwen Edit, и новый генератор от Google не сильно поменяет положение дел, просто заберёт часть задач.
Кстати, в Qwen Edit вы тоже можете промптить натуральным языком, если работаете с моделью через отдельный чат.

А теперь подробнее про технологические отличия.

Внутри ChatGPT - авторегрессия, которая является частью омнимодальной модели 4o.
Фактически, это ChatGPT, который сам умеет генерировать картинки.

Авторегрессия последовательно предсказывает батчи пикселей в латентном пространстве и из-за этого естественным образом удерживает связь между объектами, обходя основную проблему диффузионных моделей (они, напомню, генерируют изображение из шума, с каждым шагом всё больше уточняя его).

Именно поэтому ChatGPT генерит картинку долго и «прогружает» её сверху вниз, как baseline JPEG во времена упячки.


Внутри Gemini же - генератор, основанный на диффузии, который прикручен к LLM как отдельный модуль.
Да, вписан очень хорошо и ощущается как единое целое, но это не так.
Ну, как раньше в ChatGPT отдельным модулем был DALL-E (помянем дурака 🚬).

Тем не менее, все 3 диффузионки нового поколения умеют примерно одинаковые штуки, просто какая-то лучше умеет в текстуры, какая-то в текст, а какая-то в цвет и формы.
И основная проблема модели от google - она закрытая и доступна только по api.
Для серьезных внутренних инструментов продакшена такое решение если и подойдет, то с очень сильной натяжкой.

Зато для мемов - каеф 😁

Мутный AI - Волшебных кнопок нет, есть только инструменты.
  • ❤ 12
  • 👍 9
  • 🔥 4
More from @mutniy_ai
  1. May 6, 2026Спустя кучу времени выхожу из сумрака и рассказываю, куда пропал. Так вышло, что в начале…
  2. Dec 22, 2025В последнее время, консультируя игровые студии, собирающиеся релизиться в Стиме, все больш…
  3. Nov 21, 2025Астрологи опять снова объявили неделю нано-бананы, за которую платят господа Gemini Ultra,…
  4. Nov 13, 2025Вышел из микро-отпуска и сразу же Veo подогнали очень интересную фичу — Camera control. Су…
  5. Oct 31, 2025Ну что, товарищи, сегодня тот самый день, когда лейблы добрались до ИИшной музыки. Udio и…
  6. Oct 28, 2025Портретный режим Veo 3.1 (9:16) сильно интереснее, чем кажется на первый взгляд. Режим 9:1…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →