Ну что, друзья, встречайте Nano Banana от Google 🍌 (линк) — модель, которая взорвала индустрию. Она делает с фотографиями буквально что угодно и при этом сохраняет лицо и детали так, будто это реальное фото. Сегодня начали день с них.
🔥 В чём магия?
У старых моделей вроде DALL·E или Midjourney была одна большая проблема — несогласованность. Они генерили картинку пошагово, предсказывая следующий кусочек. Из-за этого при редактировании часто терялись важные детали — например, лицо превращалось в «новое».
Google пошёл другим путём. Они собрали multimodal diffusion transformer — систему из двух частей:
• Языковая понимает ваш запрос («поменяй рубашку на красную»).
• Изобразительная берёт шум и шаг за шагом превращает его в картинку.
Они постоянно общаются: языковая часть как режиссёр говорит изобразительной — «Лицо не трогай. Меняй только рубашку. Освещение оставь».
А чтобы ничего не поехало, Google встроил алгоритмы сохранения идентичности. Они буквально «замораживают» ключевые черты (например, структуру лица), и модель не имеет права их менять.
Протестировал с такими задачами как добавить логотип, заменить одежду, сделать фон и все что пришло в голову. Уточки тоже ее рук дело.
⚡ Итог: Nano Banana решает главную боль прошлых моделей — сохранение контекста и лица. Генерация получается реалистичной, быстрой и максимально аккуратной.
Если было полезно — лайк 👍 и репост. Здесь регулярно разбираем такие инструменты, которые меняют индустрию каждый день.
Post #343
327



- 👍 8
- 🔥 7