ByteDance выложили DreamID-V - open-source модель для face swap на видео (Twitter)
Главная проблема face swap в том что нет ground truth - когда меняешь лицо A на видео B, ты не знаешь как "правильный" результат должен выглядеть. Поэтому все предыдущие модели учились на implicit supervision (ID loss + reconstruction loss по отдельности) и результаты так себе.
DreamID решает это хитро:
1) Берут два изображения одного человека: A₁ и A₂
2) Берут изображение другого человека: B
3) Существующим фейссвапом на основе GAN - меняют лицо A₂ на B, получая псевдо-цель B̃
Теперь тройка (A₁, B̃, A₂) даёт явный ground truth: если заменить лицо на B̃ идентичностью A₁, результат должен быть A₂ (реальное фото!).
4) При этом мы не обучаемся на аутпутах старого фейссвапа (и модель бьет его по метрикам в несколько раз) - ведь наш таргет это реальное изображение A₂ - а синтетический только инпут
Потыкал - качество так себе, основная проблема в гармонизации: модель довольно топорно вклеивает лица, сразу видно что что-то не так (см. скрин). Освещение не матчится, выглядит как плохой фотошоп в некоторых кейсах (хотя иногда работает отлично)
Мне посоветовали FlashPortrait - там с этим сильно лучше. Но он на Wan 14B, а DreamID-V работает на 1.3B модельке
А 1.3B это очень мало (тем более там требуется 1 шаг диффузии благодоря турбо лоры) - такое реально запустить в realtime на обычной 4090. Так что очень скоро у нас будут дешёвые realtime дипфейки в открытом доступе
Post #208
2.64K



- ❤ 6
- 🔥 6
- 🤯 4
- 👍 2
- 🥰 2