TGViewer
Мишин Лернинг Мишин Лернинг @mishin_learning · 7.45K subscribers
Post #1369 35.6K
🚀 WoW! DALL-E 2 для генерации видео! MAKE-A-VIDEO от MetaAI

📄 tl;dr

Ресерчеры из MetaAI обучили диффузионную нейросеть (типа DALL-E 2, Imagen, Стебель) MAKE-A-VIDEO, способную генерировать короткие видео-ролики по текстовому описанию!

А самое крутое то, что для этого им не потребовался датасет, содержащий пары видео - текст!


🚬 Что же за заверь MAKE-A-VIDEO?

Начнем с того, что название MAKE-A-VIDEO, отсылает нас к Make-A-Scene от тех же MetaAI — DALL-E поколения, которая имела кондишн не только в тексте, но и в семантической маске. Название имхо не очень удачное, так как тут ничего подобного нет. НО это DALL-E-like 2-го поколения и, видно, они просто решили двигать свой бренд MAKE-A- ... Ок, их дело.

Основной фишкой этой работы является развитие мысли: "Картинка это видео с одним кадром". Но как это реализовано? И главное, как можно сделать Text-To-Video без Text-To-Video данных?!

Подход напоминает DALL-E 2 — разделяй и властвуй декомпозируй и генерь,с его CLIP_text_emb -> CLIP_image_emb Prior!

Генрация видео Y может быть представлена как композиция Модулей:

🗒 Y = SR(th) ◦ SR(tl) ◦ ↑F ◦ Dt ◦ P ◦ (X_t, C(X_i))

Идея очень простая и изящная давайте прост разберем ее элементы:

0. X_i — картинка, X_t — текст. {X_i, X_t} — пара картинка-текст.

1. C(X_i) — CLIP embedding изображения X_i. N-мерный вектор, содержащий в себе необходимые фичи для описания картинки.

2. P — Prior, диффузионная нейронная сеть, отображающая X_t текстовые CLIP embedding'и в CLIP image embedding'и

Теперь понятно, что имея текст, можно получить | P (X_t) —> C(X_i) | варианты визуальных эмбеддингов возможных изображений.

3. Дальше вступает модуль Dt, который готовит 16 RGB фреймов по 64 × 64 на основе CLIP эмбеддинга первого кадра!

И на этот этапе становится понятно, что не нужны пары текст-видео!

4. Модуль ↑F делает интерполяции между кадрами и SR(th) ◦ SR(tl) делают пространственно-временной апскейл из 64pix в 256 и 768

👾 Сайт Проект (тыкать обязательно!)
📄 Paper

🤖 м и ш и н л е р н и н г
  • 🔥 25
  • ❤‍🔥 11
  • 👍 7
  • 💋 3
  • ❤ 2
  • 👎 2
  • 🏆 1
More from @mishin_learning
  1. Sep 29, 2026🤑 OpenAI теперь берут 500$ за 25x, а еще урезали подписку за 200$ с 20x до 10x Остаюсь на…
  2. Sep 22, 2026🌞🌚 GPT-6 Sol and Luna: Они там реально с ума сошли в этой ИИ гонке вооружений? Только чт…
  3. Sep 22, 2026🔥 Anthropic не дали GPT-6 долго побыть самым умным Anthropic представили Claude Opus 5.5…
  4. Sep 18, 2026Post #1926
  5. Sep 11, 2026Ну на Radiohead народу было побольше
  6. Sep 8, 2026🦝 OpenAI попали в скандал и релиз апдейт Image GPT
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →