Почему я не разделяю всеобщего восторга по поводу новых возможностей GPT 4o
Буквально две недели назад весь медийный мир был одержим экспериментальной версией Gemini Flash, способной генерировать изображения. Парадокс заключался в том, что большинство восторженных обзоров базировались не на глубоком понимании технологических нюансов, а на примитивной способности модели создавать мемы. Неискушенная аудитория внезапно открыла для себя Google AI Studio, воспринимая его как революционный продукт, исключительно благодаря визуальному функционалу, а не тонким настройкам и списку доступных моделей. Reels, статьи, и посты о том, какая Gemini крутая просто взорвали медиа пространство.
Прошло чуть больше 10 дней и OpenAI выпустили свой ответ в виде GPT 4o, вернее, ее обновления, которая тоже может генерировать картинки. Что происходит сейчас? Правильно, о ней пишут везде, все пошли генерировать мемы и все опять пишут, какая классная теперь уже GPT 4o.
Вот только здесь есть несколько проблем
Иллюзия новизны. Генерация картинок тем подходом, что используется в LLM - это вообще не инновация. Такой должна была быть GPT 4o тогда, когда нам ее анонсировали (около года назад). А до нее - подобный подход к генерации изображений уже был известен, но не использовался в продуктах крупных компаний вроде OpenAI и Google, от чего логично, что и качество было хуже, ведь ресурсов в виде людей и железа у них в разы больше.
Качество VS Универсальность. Даже не смотря на рост качества генерации, оно все равно СУЩЕСТВЕННО хуже, чем у специализированных моделей для работы с изображениями. Это решится со временем, однако на мой взгляд, специализация в AI при прочих равных всегда будет работать лучше универсальных решений.
Профанация полезности. Малая практическая ценность данного функционала в его текущем состоянии. Очень мало кейсов. За все дни я увидел несколько сотен публикаций про картинки. И практически ВСЕ ОНИ БЫЛИ С МЕМАМИ или чем-то подобным. Я подписан на кучу профессиональных пабликов, но только в одном из них (спасибо, Артем) увидел что-то про реальную пользу.
А все потому - что реальная польза этой функции - это польза для самих компаний.
Потребительское поведение работает так, что люди склонны пользоваться продуктами и платить за те решения, которые “доступны для понимания каждому”. Не важно, инженер ты со степенью pHD, бизнесмен или домохозяйка. Картинки - это лишь умная воронка.
Механизм прост: сначала развлечение (мемы, случайные картинки), затем любопытство, далее - знакомство с дополнительными возможностями продукта и, как финал, подписка. Универсальность контента - мемы понятны всем. Идеальный инструмент для массового маркетинга.
Да, технологический прогресс налицо, но за красивой картинкой скрывается воронка старого образца - привлечение внимания через максимально доступный и понятный контент.
Стоит ли восторгаться? Решать вам. Но критически важно сохранять трезвость мышления и не поддаваться первому впечатлению.
(Заходите в комментарии, к этому посту они максимально полезные)
Post #202
481
- 👍 7