TGViewer
Data Secrets Data Secrets @data_secrets · 94.8K subscribers
Post #8968 19.6K
Что происходит под капотом Алисы AI при генерации изображений — и как работают «Объедини фото» и «Оживи фото»

Генераторы изображений уже стали частью повседневности. Мы пользуемся ими и в работе, и просто для себя. Но как именно они устроены, обычно остается за кадром. Мы решили устроить небольшой ликбез на примере нейросети Алисы AI, которая умеет не только генерировать картинки, но и оживлять, объединять и редактировать их.

В основе лежит диффузионная модель: она начинает генерацию с шума и шаг за шагом "восстанавливает" изображение. Это называется денойзингом. На первых итерациях появляется общая структура сцены, дальше – формы объектов, и только в конце – детали и текстуры. Это похоже на проявление полароида.

Модель обучена на огромном датасете пар «картинка–описание» (порядка 1 млрд). Причем описания генерирует внутренняя VLM-модель, которая подробно расписывает содержимое изображения – вплоть до мелких объектов и контекста сцены. За счет этого диффузия лучше понимает, что именно должно оказаться в кадре, и хорошо следует инструкциям.

Дальше на базе модели уже начинается более прикладная история: функции Редактирование изображения, Объедини фото или Оживи фото.

Взгляните на пример наверху: вы можете подать на вход Alice AI два изображения и промпт, и модель объединит картинки по заданному запросу. Внутри, при этом, происходит следующее: изображения прогоняются через энкодер и превращаются в латентные представления, которые затем подаются в диффузионную модель как условие вместе с текстом. А дальше происходит знакомый процесс денойзинга с ограничениями: модель должна собрать сцену, согласованную с этими латентами.

В "Оживи фото" та же логика переносится на видео. Используется диффузионная модель с архитектурой mixture-of-experts: разные эксперты отвечают за геометрию движения и за детализацию. Первый кадр кодируется в латенты и задает сцену, а дальше модель генерирует последовательность кадров по заданной логике. Все кадры видео, кстати, генерируются одновременно, а не по одному.

Если кратко: в основе всего — диффузия, но уже не как абстрактная технология, а как хорошо упакованный прикладной инструмент. А попробовать функции Объединения или Оживления фото можно в приложении Алисы 👒
  • 🗿 141
  • 🤨 39
  • 😁 20
  • 👍 16
  • ❤ 14
  • 🤯 6
  • 🦄 3
  • 🔥 2
  • ✍ 1
More from @data_secrets
  1. Oct 11, 2026Теренс Тао провел в Калтехе большую лекцию про математику в эру ИИ и выложил слайды https:…
  2. Oct 9, 2026В ночь с 7 на 8 октября в результате атаки БПЛА был серьезно поврежден дата-центр Яндекса…
  3. Oct 9, 2026Anthropic обновила Usage Policy, и теперь Claude нельзя обижать 🤡 В документе они пишут,…
  4. Oct 8, 2026OpenAI раскатили на всех пользователей GPT-6 и новую фичу под названием Intelligent UI Теп…
  5. Oct 7, 2026Новый Haiku 5.5, сводка: — В среднем запуск обходится на 75% дешевле Haiku 4.5. — Большой…
  6. Oct 7, 2026Вышел Haiku 5.5
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →