TGViewer
Channel Public Channel
На дуде игрец | Санин про AI

На дуде игрец | Санин про AI

@allmaighty

Дрессирую генеративные нейросети на реальном продакшне. Строю пайплайны, делюсь подходами и полезным опытом.
Автор: @igorsnn | Подробнее: https://iigor.pro
Subscribers
229
Photos
21
Videos
12
Links
12
Recent Posts 11 shown
Post #53 122
Раунд 2: После правок.
  • 🔥 2
Post #51 120
Раунд 1: До правок.
Post #50 113
Меня как режиссёра ИИ почти догнал. Почти. И вот это «почти» стоит целого поста. 🏃‍♂️

В конце 2025-го мне заказали сгенерировать промо нового робота в стиле «технопорно». Чтобы металл блестел и хотелось лизнуть, как в рекламе Apple. Я тогда возился несколько дней, работал на первой версии Nano Banana и Kling 2.5. И правок от клиента было, конечно, вагон.

С тех пор модели шагнули далеко вперёд. И мне стало интересно — а смог бы я повторить ту же работу сейчас, но отдав её нейросети почти целиком? Без раскадровки, без ручного монтажа. Одним промптом.

Решил проверить и сравнить два подхода.

Первый подход: ИИ — мой ассистент на каждом шаге. Собрал character sheet, стилы по сценам, видео отдельных шотов, монтаж. Здесь у меня свое конкретное видение результата и контроль над каждым кадром. ИИ помогает писать промпты, генерирует отдельные запчасти. Монтирую я сам, музыка и сведение мои. Итог: результат за три часа.

Второй подход: ИИ делает сам почти всё. Отдаю промпт, изображение робота, получаю пятнадцать секунд анимации со звуком. На всё про всё работы минут 10.

Что получилось? Смотрим видосики ниже. Результаты вышли похожими. Оба соответствуют брифу и решают задачу.

Да, у второго есть косяки: робот статичен, музыка пустовата, местами галлюцинации. Но глядя на два ролика рядом без лупы разницу подходов можно и не оценить.

Казалось бы, всё, я безработный. 🤷

Но эксперимент был бы неполным, если бы в этот момент в чат не вошел клиент со своим мнением (и не то, что с лупой — с микроскопом!). Поэтому я сам примерил его роль и дал правку — пусть робот в финале протянет розу. 🌹

Мой ручной вариант. Изолированно исправляю стил финальной сцены. Генерю шот. Добавляю в монтаж, рендерю. Результат за 10-15 минут, причем остальной ролик весь на месте.

Вариант с одной генерацией. Правлю промпт, генерю всё заново. Результат за 5 минут. Роза есть. Но:
— робот теперь левитирует;
— три кадра с ногами подряд;
— роза белая (хотя цвет я не просил, каюсь) и висит в воздухе.

Я просил розу. Не запрещал ей левитировать. И про невесомость в промпте ничего не было.

И вот это, а не красота картинки, и есть суть. У одной генерации любая правка влияет на весь ролик. Чинишь финал, ломается середина. Исправишь середину — сломается начало и опять финал. Так и будешь их чинить по очереди, как Шурик поднимал грабителей в «Операции Ы».

Интуитивное решение — собрать чистовик из кусков разных генераций. Но локация, освещение и цвет могут гулять от прогона к прогону. Оно просто не склеится визуально.

Кто-то скажет: «Пропиши студию в промпте или приложи ее картинкой». Можно. Но чем детальнее ты прописываешь каждую мелочь, свет, окружение, негативные промпты, тем ближе ты к тому самому ручному пайплайну и тем больше к тебе требований как к режиссеру.

Одна генерация отлично делает первый (и желательно единственный) прогон. Она отлично работает для творческих проектов, визуализации идей и концептов.

Но когда у вас коммерческий клиент с дедлайном, у него для вас всегда найдётся внезапный букет роз. И вы проведёте с ним много незабываемых романтических вечеров, допиливая косяки и улучшая идеальное. 🌹🌹🌹

И вот тут решает не красивая генерация. А то, выдержит ли твой процесс этот букет. Ручной пайплайн выдержит (правка бьёт в одну сцену). Одна генерация — нет (тянешь за розу — разваливается весь ролик).

Так что да, ИИ меня почти заменил. Стройку конвейера, промпты, сборку, это он скоро заберёт целиком.

Но всё «почти» держится на одном. Клиент говорит «сделай красиво» и «добавь розу». А сотню решений между его словами и готовым кадром (красная роза или белая, дорого или пластмассово, поплыл логотип или нет) принимаю я. Машина этого не видит. Клиент этого не проговаривает.

За это отвечает режиссер. Парень, которого ИИ очень хочет догнать и заменить, но пока не получается. 🧢
  • ❤ 3
  • 👍 2
  • 🔥 1
Post #49 269
В прошлом посте я писал о том, когда вводные не существуют заранее, а рождаются из показанного результата. Но остаётся вопрос.

Как классический продакшн десятилетиями снимал кино по брифу из трёх слов?

Скажем, «Хочу кино про пельмени» 🥟

А вот как.
- Сценарист превращает пельмени в сюжет: герои, структура, драматургия;
- Продюсер знает, кого нанять, где снимать и в каком графике;
- Актёр знает, как сыграть наслаждение вкусом;
- Монтажёр знает, как склеить кадры, чтобы это наслаждение почувствовал зритель;
- Дальше цветокор, звук, музыка — список длинный.

На старте у проекта вагон неизвестных. Но каждый специалист в цепочке закрывает свой кусок, потому что для него это не неизвестные, а профессия.

Продакшн-команда — это, по сути, машина по закрытию неизвестных. Клиент приносит три слова, машина отвечает на тысячу незаданных вопросов, на выходе фильм.

А теперь ИИ-продакшн. Машины нет. Есть человек и модель. И тысяча вопросов, которые раньше расходились по цепочке специалистов, сходятся в одну точку. В промпт.

У каждого вопроса теперь два сценария: либо на него отвечаешь ты, либо модель. Наугад 🎲 Сколько вопросов оставил модели, столько случайных решений получишь в кадре.

Недавно у Anthropic вышло эссе от Thariq Shihipar ровно про это (версия на русском), правда, на материале программирования. Автор называет такие вопросы неизвестными: это разница между картой (твоим представлением о задаче) и территорией (тем, как всё обстоит на самом деле).

Составляющие любой задачи он раскладывает на четыре типа: от известных известных (того, что прямо написано в промпте) до неизвестных неизвестных (то, что мы не учли и о чем не знали). Главный тезис: качество работы ИИ упирается не в модель, а в твоё умение находить свои неизвестные.

В визуальном продакшне это работает один в один.

Я сам регулярно пользуюсь двумя механиками:

1. Интервью наоборот. Не пишу бриф сам, а прошу модель допросить меня: аудитория, настроение, свет, движение камеры, темп. По типологии из эссе так закрываются известные неизвестные: вопросы мне понятны, просто сам я их себе не задал. Модель достаёт вводные из меня так же, как я достаю их из клиента на брифе или показывая концепты.

2. Референсы вместо слов. Есть вещи, которые описывать текстом дорого и бесполезно: стиль освещения, фактура материалов, мимика персонажа. Их я показываю, прикладывая изображения. Это уже неизвестные известные: словами не опишешь, зато узнаёшь с первого взгляда. Одна точная картинка закрывает десяток вопросов, на которые я отвечал бы абзацами.

В эссе есть и другие приёмы. Например, проход по слепым зонам: просишь ИИ сначала научить тебя незнакомой области. Он вскрывает самый коварный тип — неизвестные неизвестные, — ямы, о которых ты даже не подозревал.

Из таких приёмов, по сути, и собирается новая машина по закрытию неизвестных. Только живёт она теперь не в штатном расписании, а в твоём рабочем процессе.

Промпт — не просто задание для нейросети. Это место, куда переехала работа целой команды профессионалов. И результат решает не столько версия модели, сколько количество неизвестных, закрытых перед генерацией. 🧢
  • 🔥 5
  • 🤔 2
Post #48 272
«Сделайте неправильно, и я скажу, как надо».

Так звучит главная боль моей работы. Ситуация повторяется из проекта в проект многие годы. Пока ничего не показано, вводных нет. Бриф на три слова.

Но стоит принести первый результат, и все участники мгновенно понимают, как было надо. И клиент, и арт-директор, и ещё пять уважаемых коллег с ценными предложениями.

Раньше меня это бесило, потом я понял — никто не издевается. Просто на старте почти никто не знает, как надо. И я не исключение.

Вводных может не быть изначально, но они точно появятся из любого показанного результата. Как это работает? Человек смотрит на конкретную картинку и в этот момент понимает, чего хочет. Реагировать на готовое легче, чем формулировать из пустоты.

А раз вводные добываются только показом, показывать надо как можно раньше и дешевле.

До ИИ проверить гипотезу стоило как съёмочный день или работа группы CG-профессионалов. Поэтому команды максимально прорабатывали бриф до старта, проводили кучу интервью и потом надеялись, что результат попадет в ожидания. Теперь всё это заменяет один мой вечер с нейросетью.

— Выслушиваю то, что есть, даже если это «хочу кино про пельмени»;
— формулирую 3-4 разных направления;
— генерирую по каждому концепты;
— показываю и собираю реакции.

«Я скажу, как надо» случается до продакшна, когда правка ничего не стоит. Клиент реагирует на картинки, я записываю вводные. Обе стороны довольны, и телепатия не потребовалась.

Самое интересное, что внутри иногда я сам веду себя как тот клиент. ИИ здесь огромное благо, потому что экономит время на проверку моих гипотез. Я пишу промпт, получаю результат и вижу — вот здесь повернуло не туда, гипотеза ошибочна. Я уже писал про несовпадение ожидаемой картинки в голове с результатом на экране, это оно и есть.

Так что «сделайте неправильно, и я скажу, как надо» — не тупая прихоть. Это естественный механизм рождения проекта. Просто цена каждого «неправильно» упала со съёмочной смены до одного вечера генераций.

И главное: чем дешевле «неправильно», тем быстрее случается «согласовано». 🧢
  • 🔥 4
Post #40 268
Продолжение (см. часть 1).

Итак, ваши коты нейронки сломали кадр из-за обилия правок. Текстуры поплыли, апскейл бесполезен, промпт «восстанови изображение» в Банане не помогает. Что делать?

Первый способ супер-простой, и он решает проблему на 80%.

Применяем к сломанному изображению промпт реконструкции. Он просит модель пересобрать ту же сцену, с той же камерой, композицией и палитрой, но как свежий чистый кадр, с нуля.

Промпт оставлю в первом комментарии. В нем нужно прописать все важные детали изображения, потому что ИИ не все сможет понять из одного только исходника.

В зависимости от вашей картинки, количества мелких деталей и сложных текстур, часть дефектов все-таки может остаться. И на этот случай есть второй способ, чуть более заковыристый.

В его основе лежит одна мысль, которую озвучил в первой части: чтобы полноценно исправить кадр, нужно перестать кормить модель её же блевотиной. Дать ей чистое намерение, а не шум.

По шагам:

• Делаем скетч-пасс. Из испорченного кадра генерируем набросок — только черные контуры на белом фоне. Важно в промпте попросить рисовать чёткие линии понятных объектов без абстрактных форм, иначе модель додумает ерунду.
• Делаем цвет-пасс. Из того же кадра делаем размытое изображение, применяем обычный блюр на 15-20%. Из него ИИ возьмет информацию о цвете.
• Реконструируем не по испорченному кадру, а по этим двум пассам. Контуры дают структуру, блюр держит цвет. В идеале генерим, поднимая разрешение: 1k в 2k / 2k в 4k.

И всё. Оно правда восстанавливает кадр — делает текстуры чистыми, не плодит странную геометрию и не создает фантомные объекты.

GPT и Nano Banana работают немного по-разному, но оба дают хорошие результаты. Фактура меха на динозавре вернулась, видно ворс и швы. Ковролин стал другим по рисунку, но чистым и убедительным. Стены и потолок — снова гладкие и ровные.

Мой подход — это чистое воплощение того, что в мире Stable Diffusion называется ControlNet: отдельные карты-условия для генерации. Линии задают структуру, цветовая карта держит палитру. Еще это немного похоже на рендер-пасы в 3D-графике.

Но когда я искал решение, я не думал про термины. Я просто попробовал посмотреть на задачу глазами модели. Что она видит на входе? Кадр, в котором не может разобраться, что баг, а что фича. Значит надо дать ей всё раздельно: вот правильная форма, вот правильный цвет.

Что важно учитывать.

Пассы надо проверять глазами. Если скетч налепил кривых контуров, реконструкция честно их повторит. В особо сложных случаях придется поработать ластиком и пером в фотошопе.

Если на изображении есть лица, они изменятся. После реконструкции вместо исходного человека вы гарантированно получите кого-то похожего, но другого. Лечится отдельным проходом: берём восстановленный кадр, правим лицо промптом с референсом и ставим заплаткой поверх.

Меня этот подход вытащил на живом коммерческом проекте, где заказчик фонтанировал правками как ужаленный. Отменял согласованное, правил по живому, менял локации и персонажей в уже анимированных сценах. Весело было. 🙂

Желаю, чтобы у вас так не было. Но если что, теперь у вас есть способ вылечить неизлечимое. 🧢
  • 🔥 6
Post #39 208
Первое правило ИИ-клуба: не чини починенное. 🛠

Вы редактируете картинку через нейронку, и с каждой новой правкой она деградирует. Текстуры плывут, лезут артефакты, чёткость тает. Буквально 3-4 правки, и вместо нормального кадра у вас каша, которую уже ничем не спасти.

Это не кривые руки. Это устройство самих моделей. И сейчас расскажу, откуда оно берётся и как не доводить до трупа.

Обычно мы правим одно и тоже изображение не от хорошей жизни. Если у вас есть заказчик, то он запросто может присылать правки не разом, а волнами и нарушая этапность.

Согласовали персонажей, пошли в генерацию сцен, всё хорошо. И тут заказчик решает переделать персонажа. А потом ещё разок. А потом откатить то, что согласовали неделю назад (не знаю, как у вас, но у меня это происходит на каждом третьем проекте).

И вот вы берёте готовый кадр, кидаете его в нейронку как инпут, меняете одну мелкую деталь, генерите. Потом ещё раз. И ещё.

Чтобы продемонстрировать проблему я взял чистое изображение комнаты и внес в него несколько этапов правок, каждый раз меняя одну деталь. И вот что получилось (см. картинки ниже). Текстуры стен и потолка поплыли, ковролин стал мутной тряпкой, здания за окном развалились на пиксели.

Почему так происходит?

Этому есть инженерное объяснение: iterative generative drift. Модель не копирует ваш инпут, она каждый раз заново его интерпретирует. И микроошибки копятся не в плюс, а в умножение, с каждым шагом всё быстрее.

Причем даже если вы вообще ничего не меняете, заметные артефакты вылезают уже после 5 прогонов. Я сделал 10 и получил труп. 💀

Кто знаком с проблемой, наверняка знает, что никакой апскейл тут не спасает. Он просто увеличит разрешение испорченного кадра. Был мусор 1k, стал мусор 4k. Также не работают никакие “почини артефакты”, “исправь текстуры” и прочие “8k ultra detailed hi-res”.

Как же тогда это лечить?

Сначала простое: не доводить до каши. Половина проблемы решается профилактикой.

Правьте локально. Меняется одна деталь, значит и трогать надо только её. В фотошопе: выделили фрагмент, сгенерили, изменения легли в одну область. Остальной кадр не пострадал.

Или вырезайте кусок руками. Достали нужный фрагмент, поправили отдельно, вернули обратно оверлеем с мягкими краями. Дёшево и сердито.

Так вы не кормите модель её же выхлопом по десятому кругу. И каша не накапливается.

Но что, если вы уже все сломали, как коты Наташи? 😽Или если вам нужно поправить не локальный элемент, а, скажем, сменить освещение во всем кадре или цвет стен. Картинка вроде та же, а изменения размазаны по всему полотну, локально не выделишь.

И вот тут у меня есть способ его воскресить. Про него во второй части. 👇
  • 👍 1
Post #37 245
  • 👍 1
Post #36 248
Сделать ролик нейросетью — не проблема. Проблема — делать их каждую неделю. 🎰

Знакомый Саша возит рационы питания для спортсменов, бизнес работает в России и Сербии. Клиенты приходят из соцсетей, промо-ролики нужны постоянно, отдельного рилс-мейкера нет. И перед тем как делегировать кому-то этот фронт, он решил попробовать сам. С ИИ, понятно.

Зашел в Gemini, закинул фото еды и логотип, описал акцию, запустил генерацию видео. Подробный промпт ему написал сам же Gemini.

Первый результат выглядел, вроде бы, прилично. Но если вглядываться:

— монтажные ошибки, планы не клеятся по крупности;
— логотип перерисован «по мотивам»;
— упаковка сменила размер и дизайн;
— героиня слишком пластиковая, ИИ-шная.

Значит надо править. Он попробовал тот же промпт снова. Но каждая новая генерация плодила свежий набор ошибок. Одно чинилось, другое ломалось. Про логотип Gemini в углу молчу — его в финальном видео быть не должно.

Исправлять всё это через и без того огромный промпт он не решился. Просто крутил рулетку и ждал, что выпадет удачный дубль без недостатков. Потратил несколько часов, сжег все лимиты генераций. Потом собрал удачные дубли отдельных сцен и склеил ролик в CapCut.

Ролик вышел. Но сколько сил, нервов и токенов? Контроля в таком подходе ноль, и на серии роликов проблемы будут только множиться.

С этим он и пришел ко мне. И мы пошли инженерным путем — собрали кастомный нодовый конвейер в Magnific.

Подход сразу адаптировали к регулярности: то, что меняется от акции к акции (условия, блюда, актер), меняется в два клика. Все остальное зашито в воркфлоу. Пайплайн подходит для обоих рынков — язык озвучки (ГЗК) и титров переключается в одной ноде.

Главное отличие от рулетки: когда что-то не так, я правлю не готовое видео, а часть пайплайна. Уточняю стиль съемки, корректирую структуру, зажимаю промпты, убирая лишнюю вариативность.

В итоге конвейер по шагам делает отдельные куски ролика:

— Текст. Слоган и сценарий озвучки.
— Звук. Отдельные ноды под голос и музыку — четко под наш хрон и стиль.
— Стилы. Статичные кадры каждой сцены. Здесь же проверяем пэкшот: логотип, типографика, сам продукт.
— Видео. Самый дорогой этап запускается только на утвержденных кадрах.
— Монтаж. Озвучка и музыка клеятся тут же — CapCut не нужен.

У Саши появился контроль на каждом шаге. Не нравится голос — меняем за секунду, не пересобирая остальное. Гайды по стилю, свету и ракурсам зашиты в систему, так что все ролики выходят консистентными. Правка в одной ноде влияет на все последующие этапы 🦾.

Сбор и отладка заняли пару часов. Новый пайплайн сгенерировал нам первый ролик на русском под реальную акцию с реальным тренером. Монтажных ошибок нет, упаковка сохраняет форму, логотип не искажается.

К посту прикладываю ролик Саши из Gemini на сербском и результат работы пайплайна в Magnific на русском. Сравним? Только помните: главная разница не в одной генерации, а в длине пути к результату на второй и последующих задачах серии.

Новый ролик теперь обходится в полчаса времени и 5-7 долларов. Это не «идеальный рилс с первой кнопки» — исправлять и перегенерировать придется. Но совершенно в других масштабах и на порядок предсказуемее. И такой конвейер можно смело делегировать: специалист разберется в нодах за час, и в его руках будет готовая фабрика, а не куча разрозненных промптов.

И вот главный вывод. Он не про видео и даже не про нейросети.

Пайплайн — это буквально трубопровод. Под разовую партию нефти трубу никто не строит. Грузишь в цистерну и везешь. Так и с разовой задачей: вдумчивый промпт, пара контролируемых итераций, и хватит.

А вот под регулярные объемы строят трубу. Вложился один раз — и дальше каждая «тонна» едет почти бесплатно.

Раньше такая стройка была долгой и дорогой, конвейер окупался на сотой задаче. Теперь труба собирается за пару часов и окупается уже на второй-третьей. 🧢
  • 🔥 4
  • 👍 1
Post #35 406
В 2022 я сдал заказчику проект с кучей артефактов. И они никого смутили. 😎

Тогда сам факт «это нейросеть» был настолько свежим, что работал как главный аттракцион. Вау от самой технологии глушило любые придирки к ее несовершенству.

Но за четыре года все поменялось.

Это была Церемония Премии Рунета (в те годы у неё ещё был вес). Моя команда больше десяти лет делала ей визуальное оформление, и задача звучала одинаково из раза в раз: впечатлить самой мощной 3D-графикой, какую потянем.

В тот год мир накрыло первой волной ИИ-хайпа. И мы решили рискнуть. Сделать оформление на генерациях.

Как это выглядело технически (сейчас звучит как байка из склепа):

- Midjourney v3 с управлением через командную строку в Дискорде.
- Промпт слушался плохо, поэтому картинку приходилось выбивать как джекпот. Подбросил кубики сто раз, один раз повезло.
- Kling и Seedance тогда не существовало. Картинки резали на слои и крутили перекладкой руками в After Effects.
- Открывающий ролик собрали из стоков и покадрово стилизовали через Stable Diffusion.
- SFX и музыку тоже частично генерили.

Нас было 14 человек. В титрах мы гордо поделили команду на «кремниевый интеллект» и «углеродный». То есть вынесли машины в состав как флекс. Смотрите, мол, у нас в команде работают нейросети! 🤖

Так обычно и бывает. На первой фазе хайпа ты выставляешь технологию как фишку. В титры, в анонс, на обложку. Чем заметнее, тем круче.

И мы такие были не одни. В 2023 Coca-Cola выпустила ролик Masterpiece, частично собранный нейросетями. И он прозвучал очень громко, во многом потому, что «ИИ дошёл до большой рекламы». Факт применения технологии был событием (но и сам ролик, конечно, огонь!)

После первой фазы наступает вторая. И те же шильдики начинают играть против тебя. ИИ (если его видно) — уже не «вау», а «ясно, на чём сэкономили». Поэтому честное 3д и живая съемка с актерами уже начинают восприниматься как Премиум.

Но большинство из нас работает в среднем сегменте. Здесь ИИ — это уже не фишка, а рядовой инструмент, как DSLR-камера или After Effects. Никто не продаёт продакшн-услуги со словами «у нас есть камера».

Заказчик платит не за то, что ты используешь ИИ. Он платит за то, что результат качественный, а косты ниже. Остальное это уже твоя кухня.

Сами по себе чистые генерации перестали быть достижением. Это база, стартовая планка, ниже которой разговор не начинается.

Сегодня тот же проект я бы сделал командой из 5-6 человек. Цена была бы ниже, качество — выше. И дело не в генерациях, а в управляемых, масштабируемых пайплайнах, где гибридные спецы сами генерят, сами композят, сами собирают готовый шот.

И сегодня я, конечно, не выпячивал бы факт использования ИИ. Технология побыла главным героем ровно одну фазу. Дальше она ушла туда, где ей и место — в набор инструментов.

В центре снова оказалось то, что было там всегда. Крепкая идея, вкус и чистое исполнение.

Это работало с кистью, работало с рендер-фермой, работает и с нейросетью. И будет работать с тем, что придёт ей на смену. 🧢
  • 🔥 9
  • ❤ 2
Older posts →

About this channel

How can I read @allmaighty without a Telegram account?
TGViewer shows the public web preview Telegram publishes for На дуде игрец | Санин про AI: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does На дуде игрец | Санин про AI have?
На дуде игрец | Санин про AI (@allmaighty) has 229 subscribers on Telegram, refreshed roughly every 30 minutes.
Does На дуде игрец | Санин про AI know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →