Редактирование изображений в chatGPT, Gemini и Grok.
Попробую написать понятный пост, а то в последнее время гиковато выходит.
Сравнивать качество генерации дело непростое, очень субъективно.
Вот например хорошая таблица от Игоря (обновляется), но там пока нет последних новостей.
Поэтому я сравнил, насколько новые (авторегрессионые) генераторы управляются с редактированием изображений (которое в телеге озвучивается как Фотошоп больше не нужен).
Было интересно поглядет насколько генераторы СОХРАНЯЮТ оригинал и насколько НЕ ШЕВЕЛЯТ исходную картинку.
Забегая вперед:
Gemini Image Generator лучше всех справляется с этим.
Потом Грок 3.
Потом chatGPT, который нещадно шевелит картинку.
Я просто взял свои любимые частицы (много деталей) и присунул их на вход со словами "Make particles blue". Загрузил картинку и ввел промпт в каждый генератор.
Перекрась, типа, колоркоррекция, мыжкомпозеры.
Мы, конечно, живем в удивительное время, когда новые генераторы и версии появляются про ТРИ в неделю. Раньше ждали примерно год обновления софта до новой версии (Майя, Фотошоп). А щас 2 дня.
Теперь по порядку.
У Гугла новая модель Gemini 2.5. Миллион токенов контекста, и она ОЧЕНЬ умная. Ее можно попробовать в AI Studio
Да, бесплатно, но есть лимит. Но в нее еще не завезли генерацию изображений (когда завезут, будет просто бомба, я думаю). Она смешно говорит, я сгенерила, вот! Но картинки нет.
А чтобы генерить картинки, нужно выбрать Gemini 2.0 Flash Image Generation справа на экране (или где-то на мобиле).
Тут Гугл опять всех приподзапутал, неделю назад это было в https://gemini.google.com/ и в модели 2.0 Flash Tinking Experimental. Теперь Флэш разучился редактировать(у меня, только генерация с помощью Imagen3), поэтому идем в AI Studio и генерит там, выбрав Gemini 2.0 Flash Image Generation справа.
Генерит быстро. Редактирует тоже быстро. Выдает в 16:9, не путается в аспектах и разрешениях. 1024 по ширине.
Лучше всех перекрасила мои частицы в синий. Сохранила детали на месте.
Grok 3 (на сайте grok.com) тоже сохранил мои частицы на месте, но выдал ацкие артефакты - частицы как-будто моль поела. Но мы тут про редактирование.
А вот chatGPT явно двигает детали, путается в разрешениях (иногда выдает квадратное, хотя на входе лежачая картинка). Не умеет 16:9, только 3:2. Я уже присовывал ему его родное 1536х1024, но он все равно двигает детали и морфирует картинку.
Еще раз. Я тут не про качество генерации, я про точность редактирования.
По качеству, chatGPT самый наверное крутой. По точности - нет.
Ну и я не проверял вот это вот "надень очки, сними пиджак, убери кота". Проверим в чате.
Про авторегрессию надо наверное отдельный пост сделать. Качество этих генераторов вплотную подтянулось к диффузионным (Flux, Reve, SD), а вот в плане понимания редактирования - нас ждут сюрпризы, ибо мультимодальные\авторегрессионные модели (OpenAI, Gemini, Grok) умнеют и тащат за собой качество генерации вверх.
Я полностью залипаю в chatGPT и Gemini последнюю неделю.
@cgevent
Post #11602
8.51K





- ❤ 56
- 👍 39
- 🔥 8