TGViewer
эйай ньюз эйай ньюз @ai_newz · 97.2K subscribers
Post #3740 34.2K
RIP Photoshop (нет)

Потестил я мультимодальную Gemini Flash 2.0 (Image Generation) Experimental. Мог бы сказать, что фотошоп в целом больше не нужен, но, блин, эта штука в туории может куда больше, чем мог бы Photoshop. Я совсем не представляю, как можно было бы вручную наложить шоколадный крем на круассаны с первой пикчи. 

Никакой из доступных из коробки методов не способен был такое провернуть. Через ControlNet или inpainting так не сделаешь, потому что они изменяют детали — круассаны будут чуть другими или по-другому лежать. А здесь мы имеем хирургически точное редактирование картинки одним только текстом. Единственный минус пока - это низкая детализация и низкое разрешение генераций.

Другие юзкейсы: 

- Product photo — раньше нужно было бы тренить LoRA, чтобы получить пикчу №2. Нужно больше фотографий + примерно час работы. 
- Character sheet design — пикча №3. По одному концепту получаем разворот с трех сторон для моделлеров. Можно было бы погенерить что-то подобное, но здесь мы видим консистентность, которой раньше было сложно добиться моделями из коробки.
- Нейрофотосессии — пикча №4. Повторяем лицо по одной фотографии так, словно это LoRA для Flux. 
- Гайды — пикчи №5,6,7. Может на картинке выделять, куда тыкнуть, рисовать консистентные гайды, как здесь в примере с готовкой. 
И т.д.

Вот она, сила мультимодальных моделей. Все это благодаря тому, что тут генерация изображений и LLM объединены вместе. В отличие от, например Flux или Imagen 3, тут картиночные токены выплевываются напрямую из LLM, без вызова диффузии. За счет этого и достигается более нативное редактирование входных картинок. Но такой метод все же пока уступает диффузии в качестве генерации.

Кстати, в Grok такую LLM-генерацию (Aurora) завезли еще в декабре, и ее можно попробовать в Grok3, вот только редактирование там пока отключили.
Что-то подобное показывала OpenAI ещё в прошлом году, но так в прод и не завезли (эх Cэма-Сэма). Если Gemini Flash так хорош и дешевле, то что будет с 4o? 

Попробовать можно в ai studio.

@ai_newz
  • ❤ 164
  • 🔥 97
  • 👍 56
  • 😍 8
  • 😁 4
  • 😱 4
  • 💯 3
  • 🤯 1
  • 🤩 1
  • 🙏 1
More from @ai_newz
  1. Oct 7, 2026OpenAI дропнули 722 пейпера по математике Это результат попытки OpenAI решить 4000 открыты…
  2. Oct 6, 2026Mistral выпустили Le Chaton Fat Le Chonk Mistral Large 4 это модель на триллион параметров…
  3. Oct 6, 2026OpenAI начала вводить вотермарки для текста Пока что это опция для API, которую можно добр…
  4. Oct 5, 2026Google урежут бесплатный Gemini до Flash-Lite С 9 октября в приложении Gemini начнут убира…
  5. Oct 5, 2026Почему роботов учат в симуляторах Собирать данные на реальных роботах дорого и долго. Симу…
  6. Oct 5, 2026Нейродайджест за неделю (#133) LLM - DevDay OpenAI — OpenAI представила постоянно работающ…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →