TGViewer
Channel Public Channel
attention deficit

attention deficit

@papers_please

тема этого сезона: ads recommendation и recsys в целом

ситуативные разборы статей, случайные мемы и нерегулярный репост популярных каналов

by @ploshkin
Subscribers
202
Photos
8
Videos
0
Links
17

Showing posts older than #18 · Back to latest

Older Posts 16 shown
Post #16 406
📄 MUNIT: Multimodal Unsupervised Image-to-Image Translation [ECCV 2018]

Авторы работы добились мультимодальной генерации картинок между двумя доменами. Теперь не нужно обучать модель для каждой пары пород собак, т.к. порода — это просто стиль собаки 🐶

Для этого общее латентное пространство разделяется на 2: content и style, причём общим остаётся только content-пространство, а style-пространство своё у каждого домена. Сэмплируя стиль при генерации, авторы получают разные результаты.

Также в работе есть несколько теоретических результатов, наиболее важный из которых — доказательство, что cycle-consistency приводит к дельта-функциям распределения латентных кодов и как следствие к унимодальным результатам генерации.

10 эмбеддингов стиля из 10: https://teletype.in/@ploshkin/munit
Teletype MUNIT: Multimodal Unsupervised Image-to-Image Translation https://arxiv.org/abs/1804.04732
Post #15 285
Небольшой тизер 🐆➡️🐈
Post #14 319
📄 UNIT: Unsupervised Image-to-Image Translation Networks [NeurIPS 2017]

Продолжаем разбирать статьи из репозитория imaginaire

В этой работе решается общая задача image-to-image translation между двумя доменами. Поскольку сбор обучающей выборки с разметкой может быть очень дорогим (дневная / ночная съёмка) или вообще невозможным (превращение пород собак), на помощь приходит unsupervised-обучение. Имея два независимых множества картинок из разных доменов хочется смоделировать функцию, способную переводить один домен в другой не нарушая семантику.

Для этого часто используется условие cycle-consistency (см. CycleGAN), но авторы пошли дальше и предложили shared-latent space, когда для двух соответствующих картинок латентные коды в некотором пространстве совпадают.

Что из этого вышло, можно посмотреть по ссылке: https://teletype.in/@ploshkin/unit
Teletype UNIT: Unsupervised Image-to-Image Translation Networks https://arxiv.org/abs/1703.00848
Post #13 248
📄 SPADE [CVPR 2019]

Новый подход в conditional-генерации картинок: оказывается, карты сегментации нельзя пропускать через нормализацию — теряется пространственная информация. Поэтому авторы предложили выбросить энкодер и прокидывать семантику через adaptive-денормализацию, причём так, чтобы у каждого пикселя были свои параметры преобразования. А эти параметры вычислять с помощью небольших fully-conv сетей.

Но самое главное: теперь есть настоящая демка! Там можно в реалтайме нарисовать карту сегментации для пейзажа, а сетка сгенерирует картинку:
http://nvidia-research-mingyuliu.com/gaugan

Люблю, когда можно наглядно посмотреть результат, а не только черрипикнутые картинки в статье 🌚

Press F to see details: https://teletype.in/@ploshkin/spade
Teletype SPADE: Semantic Image Synthesis with Spatially-Adaptive Normalization https://arxiv.org/abs/1903.07291
Post #11 248
Вообще я понял, что погорячился с идеей разбирать по статье каждый день. На посты у меня уходит по 2–3 часа (уже не 6 как в первый раз), но они помогают хорошо структурировать информацию и лучше запомнить

Поэтому, чтобы не страдало погружение, подробность постов и я сам, я решил постить раз в 2 дня — типа день на чтение, и день на написание

Но челлендж был 1 день — 1 статья и так 30 дней, так что формально если я таки разберу 30 статей, условия будут выполнены 🤡🤡🤡
Post #10 212
📄 pix2pixHD [CVPR 2018]

Развитие статьи pix2pix для conditional-генерации реалистичных картинок высокого разрешения. Эта работа послужила фундаментом и proof-of-concept для vid2vid-подходов.

Здесь предложены разные работающие хаки для стабилизации обучения GAN’ов:
* coarse-to-fine генератор
* разномасштабные дискриминаторы
* feature-matching лосс
* использование инстанс-сегментации

Помимо этого этого предложен способ, как на инференсе влиять на синтезируемый контент (например, как превратить асфальтовую дорогу в брусчатку)

Подробные хайлайты: https://teletype.in/@ploshkin/pix2pixhd
Teletype pix2pixHD: High-Resolution Image Synthesis and Semantic Manipulation with Conditional GANs https://arxiv.org/abs/1711.11585
Post #9 191
📄 World-consistent Video-to-Video Synthesis [ECCV 2020]

Достигнута глобальная консистентность синтезируемого видео: теперь, если объект появляется в видео повторно, гарантируется, что его внешний вид будет таким же, как и раньше.

Для этого при генерации кадр за кадром строится 3D point-cloud сцены, чтобы «помнить» состояние всех точек. Для нового кадра сцена проектируется на плоскость камеры, и получается guidance image, который служит ориентиром для цветов в новом кадре

Детали: https://teletype.in/@ploshkin/world-consistent-vid2vid
Teletype World-Consistent Video-to-Video Synthesis https://arxiv.org/abs/2007.08509
Post #8 154
📄 Few-shot Video-to-Video Synthesis [NeurIPS 2019]

Статья-продолжение vid2vid. Здесь предлагается решение задачи «как сгенерировать видео из домена, которого не было в обучении». Главная идея — модуль, который на основе картинок-примеров генерирует веса для другого модуля — генерации картинок

Пересказ тут: https://teletype.in/@ploshkin/few-shot-vid2vid
Teletype Few-shot Video-to-Video Synthesis https://arxiv.org/abs/1910.12713
Post #7 141
Слишком объёмный разбор получился, больше времени потратил на публикацию, чем на сам разбор. Причём в разы)

Успокаиваю себя тем, что это реально очень нужная мне статья, и ещё не раз пригодится. Плюс дальше будет несколько опирающихся на неё статей

В общем, дальше посты будут поменьше
Post #6 144
📄 Video-to-Video Synthesis [NeurIPS 2018]

Это основная статья про видео-дипфейки. В ней впервые предложен фреймворк для conditional video generation, когда для каждого кадра есть семантическая информация, например, карта сегментации, по которой генерируется реалистичное видео

Подробнее тут: https://teletype.in/@ploshkin/vid2vid
Teletype Video-to-Video Synthesis https://arxiv.org/abs/1808.06601
Post #5 125
Марш

Тема, в которую мне хочестя погрузиться, — это GAN’ы. Про них все слышали, мало кто обучал, и ещё меньше тех, кто целостно представляет, как можно заставить их работать

Мотивация проста и состоит из трёх частей:
1. Я почти 9 месяцев работаю над генерацией лиц при участии GAN’ов и осознал, что мне не хватает матчасти
2. Компьютерное зрение в целом — это моя любовь
3. Успехи VQGAN+CLIP и хайп вокруг сильно интригуют (ничего не понятно, но очень интересно)

Так что берём седловую точку и скачем к локальному оптимуму! 🐎
Post #4 121
Внимание

Марафон — штука в первую очередь для меня самого. Я хочу погрузиться в определённую тему и хочу составить для себя много шпаргалок. Чтобы через год-два-десять не пришлось перечитвать статьи полностью, а достаточно было взглянуть на их краткие выжимки и основные идеи

По этой причине в разборах не будет пояснения тех вещей, которые я знаю достаточно хорошо. Но их всегда можно легко найти, зайдя в поисковик и нажав нужные кнопки. Вас же не забанили в поисковике? 🌚

А вот неочевидные для себя моменты и клёвые на мой взгляд идеи я буду пояснять так, чтобы будущий я смог легко понять, о чём речь. Так что если всё слишком понятно — листайте дальше 🌝

Пояснительная бригада почти всё
Post #3 111
На старт

Итак, господин @vlivashkin преисполнился идеей устроить себе марафон по чтению и разбору статей вида: 1 день — 1 статья, и так 30 дней

У меня давно в планах стоти пункт «регулярно разбирать статьи», и я даже создал этот канал 3 года назад. Но до дела так и не дошло. Как гласит народная мудрость — завести канал ещё не значит читать статьи

Поэтому я вдохновился этой прекрасной идеей и тоже решил поучаствовать в марафоне
Post #2
Channel photo updated
Post #1
Channel created
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →