LongCat-Video — открытая нейросеть с 13,6 млрд параметров, которая умеет не только генерировать видео по тексту, но и создавать говорящих аватаров, анимировать фотографии, продолжать существующие ролики и синхронизировать речь с движением губ. Всё это можно запускать локально.
Возможности:
🔣Text-to-Video — создание видео по текстовому описанию.
🔣Image-to-Video — оживляет обычные изображения.
🔣AI-аватары — создание говорящих персонажей по фотографии и аудио.
🔣Липсинк высокого качества — синхронизация речи и движения губ с использованием Whisper Large в новой версии Avatar 1.5.
🔣Поддержка нескольких персонажей и нескольких аудиодорожек одновременно.
🔣Работает не только с людьми, но и с аниме, животными и стилизованными персонажами.
🔣Генерирует длинные ролики без заметной деградации качества и «дрейфа» цветов — одна из ключевых особенностей проекта.
🔣Генерация видео 720p, 30 FPS с оптимизированной архитектурой и ускоренным инференсом.
Где пригодится?
🟢Создание AI-блогеров.
🟢Виртуальные ведущие.
🟢Озвучка фотографий.
🟢Дубляж видео.
🟢Контент для YouTube, TikTok и Reels.
🟢Игровые NPC.
🟢Маркетинговые ролики.
🟢AI-персонажи для Telegram-ботов и сайтов.
⚙️ Установка
Клонируем проект:
git clone https://github.com/meituan-longcat/LongCat-Video
cd LongCat-Video
Создаем окружение:
conda create -n longcat-video python=3.10
conda activate longcat-video
Устанавливаем зависимости:
pip install -r requirements.txt
pip install -r requirements_avatar.txt
Скачиваем модели:
pip install "huggingface_hub[cli]"
huggingface-cli download meituan-longcat/LongCat-Video --local-dir ./weights/LongCat-Video
huggingface-cli download meituan-longcat/LongCat-Video-Avatar --local-dir ./weights/LongCat-Video-Avatar
huggingface-cli download meituan-longcat/LongCat-Video-Avatar-1.5 --local-dir ./weights/LongCat-Video-Avatar-1.5
▶️ Запуск
Генерация видео:
torchrun run_demo_text_to_video.py
Оживление изображения:
torchrun run_demo_image_to_video.py
Создание говорящего аватара:
torchrun run_demo_avatar_single_audio_to_video.py
Несколько персонажей:
torchrun run_demo_avatar_multi_audio_to_video.py
Веб-интерфейс:
python run_streamlit.py
Один из самых интересных открытых проектов. В одном репозитории объединены генерация видео по тексту, анимация изображений, создание говорящих аватаров и продолжение существующих роликов. При этом разработчики делают упор на длительные видео, стабильность персонажей и качественную синхронизацию речи, что приближает проект к возможностям коммерческих сервисов.
♎️ GitHub/Инструкция
😳 Лайф | 📲 Зеркало Max
#python #soft #github