TGViewer
Generative Ai Generative Ai @deeplearning_ru · 3.71K subscribers
Post #933 1.54K
Появилась первая качественная text2video модель с открытым исходным кодом по лицензии MIT - Pyramid Flow SD3. Это диффузионный трансформер с 2 миллиардами параметров, способный создавать 10-секундные видео с разрешением 768p и частотой 24 кадра в секунду.

Основные моменты:

Генерация 10-секундных видео с разрешением 768p и 24 кадрами в секунду.
Единая модель с 2 миллиардами параметров.
Поддержка как текст-видео, так и изображение-видео.
Эффективная тренировка с использованием Flow Matching.
Две версии модели: 384p (5 секунд) и 768p (10 секунд).
Примеры видео доступны на странице проекта.
Простая двухшаговая реализация.
Лицензия MIT, доступно на Hugging Face.
Обучение проводилось только на открытых данных.
Код для обучения будет опубликован в ближайшее время.

https://huggingface.co/rain1011/pyramid-flow-sd3
https://github.com/jy0205/Pyramid-Flow
https://pyramid-flow.github.io/
  • 🔥 2
  • ❤ 1
More from @deeplearning_ru
  1. Sep 22, 2026🚀 Anthropic представила Claude Opus 5.5 Новая флагманская модель стала сильнее Opus 5, пр…
  2. Sep 18, 2026Очень хороший прогресс для локальных моделей. PrismML выпустила Bonsai 2 27B на базе Qwen3…
  3. Sep 17, 2026Google открыла исходный код ARTEMIS — инструмента, который позволяет ИИ управлять Android-…
  4. Sep 14, 2026Looped Transformer сейчас одна из самых обсуждаемых архитектурных идей. В новом техническо…
  5. Sep 11, 2026Несчастное сознание дрозофилы наконец-то обрело счастье — ее научили смотреть тиктоки с ро…
  6. Sep 10, 2026Если вам не нравится, что при работе с ИИ история, настройки и данные отправляются на чужи…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →