🎯ТОП-3 доклада с международной конференции по Learning Representations 2021: краткий обзор от Zeta Alpha
С помощью собственного навигатора по исследованиям ИИ-компания Zeta Alpha составила выжимку из более 800 докладов ICLR 2021, с учетом цитирования и популярности авторов.
1. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale (Алексей Досовицкий, Лукас Бейер, Александр Колесников, Дирк Вайссенборн, Сяохуа Чжай и др.). Трансформеры, применяемые непосредственно к фрагментам изображений и предварительно обученные на больших датасетах, хорошо работают при классификации изображений и могут превзойти лучшие CNN на больших изображениях. https://openreview.net/forum?id=YicbFdNTTy
2. Rethinking Attention with Performers (Кшиштоф Чоромански, Валерий Лихошерстов, Дэвид Дохан, Синю Сонг, Андреа Гейн, Тамас Сарлос, Питер Хокинс, Джаред Дэвис и др.). Performers, линейные трансформеры с полным рангом и вниманием с помощью методов доказуемой аппроксимации случайных признаков, эффективно работают, не полагаясь на разреженность или низкий ранг. Авторы предлагают матричную декомпозицию механизма самовнимания на матрицы ниже, которые имеют комбинированную сложность, линейную относительно. длина последовательности L: O (Ld²log (d)) вместо O (L²d). https://openreview.net/forum?id=Ua6zuk0WRH
3. PMI-Masking: Principled masking of correlated spans (Йоав Левин и др.). Совместное маскирование коррелированных токенов значительно ускоряет и улучшает предварительное обучение BERT. Вместо случайного маскирования токенов авторы идентифицируют - используя только статистику корпуса - диапазоны токенов, которые сильно коррелированы. Для этого они расширяют точечную взаимную информацию между парами токенов до промежутков произвольной длины и показывают, как обучение BERT с этой целью обучается более эффективно, чем альтернативы, такие как равномерное маскирование, маскирование всего слова, случайное маскирование диапазона и т.д. Эта стратегия работает, не позволяя моделям предсказывать замаскированные слова, а заставляя ее использовать очень мелкие корреляции слов, которые часто появляются рядом друг с другом, чтобы повысить степень изучения более глубоких корреляции в естественном языке. https://openreview.net/forum?id=3Aoft6NWFej
Полный обзор ICLR от Zeta Alpha смотрите здесь: https://www.zeta-alpha.com/post/iclr-2021-10-papers-you-shouldn-t-miss
Post #78
210