Все не так сладко с редактирующими нейронками
Я много раз восторгался возможностям нано бананы и Flux Klein.
Они очень впечатляют своими возможностями, когда пробуешь делать что-то
Но самое интересное начинается, когда нужно получить именно то, что нужно. 😬
Я тут помогаю прекрасной Арине Швецовой визуализировать шалость с велосипедной формой.
В процессе отлаживаю пайплайн создания и доработки картинок. На удивление Gemini 3 pro image (Nano Banana Pro) и Flux Klein хорошо друг друга дополняют: там где не справляется одна модель, затаскивает другая, и наоборот.
Gemini отлично работает, чтобы совмещать несколько объектов, переносить рисунок или менять позу.
Klein лучше сохраняет исходную позу, отлично меняет освещение, лучше сохраняет логотипы и детали при точечных правках (особенно с нодой inpaint crop&stich на высоком разрешении)
Вот еще несколько советов, которые помогают выжимать согласованные результаты с хорошим качеством из обеих моделей:
● Убирать все лишнее с референсных фото. Даже мощные нейронки путаются, когда нужно совместить слишком много сущностей: стиль, освещение, направление камеры, детали конкретных объектов и т.п.
Я отдельно готовил лица персонажей, форму на «невидимом манекене», отдельно редактировал шорты, очки и т.п.
Общий принцип такой: если зажмуриться и посмотреть на картинку и в ней видны ненужные элементы — надо их несчадно убирать. Klein для этого идеально подходит
● Дорабатывать текстовый запрос для ясности. В Nano Banana встроена рассуждающая нейронка, которая под капотом дописывает базовый запрос до сложного и детального, и уже его отправляет в генерацию.
Klein вообще никак не улучшает промпт — что написал, то он и отправит в модель. Поэтому для него я сделал специальный дописывальщик промпта: закидываешь свою картинку и говоришь, что надо сделать. Он на основе картинки выдает более эффективный промпт, привязываясь к деталям.
На удивление, улучшенный таким способом текст, даже в банане повышает качество результата!
● Волшебства не существует. Как бы не были хороши нейронки, а все-таки с некоторыми вещами они неимоверно тупят.
Чтобы получить позу со скрещенными руками двух людей мне пришлось знатно попотеть: сделать маску по глубине и очень детально расписывать промпт чтобы получить нужное выражение и расслабленный вайб у персонажей.
А детали формы местами пришлось допиливать по старинке в Affinity — совмещая лучшие попытки и подчищая косяки.
Так что если хотите получить по-настоящему крутой результат, готовьтесь к фрустрирующей итерационной работе с периодическими возгласами «да капец, что-ж ты творишь, это не то!» 🐱
Там Арина в канале рассказывает со своей стороны историю, ну и вся финальная красота тоже там, так что подписывайтесь!
🎤 Ссылки на утро — второй канал
⏲ Устойчивый VPN за звезду
#опыт@cogload #text2image@cogload
Post #514
156




- ❤ 4
- 🔥 2