TGViewer
Big Data Science [RU] Big Data Science [RU] @bdscience_ru · 1.62K subscribers
Post #78 210
🎯ТОП-3 доклада с международной конференции по Learning Representations 2021: краткий обзор от Zeta Alpha
С помощью собственного навигатора по исследованиям ИИ-компания Zeta Alpha составила выжимку из более 800 докладов ICLR 2021, с учетом цитирования и популярности авторов.
1. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale (Алексей Досовицкий, Лукас Бейер, Александр Колесников, Дирк Вайссенборн, Сяохуа Чжай и др.). Трансформеры, применяемые непосредственно к фрагментам изображений и предварительно обученные на больших датасетах, хорошо работают при классификации изображений и могут превзойти лучшие CNN на больших изображениях. https://openreview.net/forum?id=YicbFdNTTy
2. Rethinking Attention with Performers (Кшиштоф Чоромански, Валерий Лихошерстов, Дэвид Дохан, Синю Сонг, Андреа Гейн, Тамас Сарлос, Питер Хокинс, Джаред Дэвис и др.). Performers, линейные трансформеры с полным рангом и вниманием с помощью методов доказуемой аппроксимации случайных признаков, эффективно работают, не полагаясь на разреженность или низкий ранг. Авторы предлагают матричную декомпозицию механизма самовнимания на матрицы ниже, которые имеют комбинированную сложность, линейную относительно. длина последовательности L: O (Ld²log (d)) вместо O (L²d). https://openreview.net/forum?id=Ua6zuk0WRH
3. PMI-Masking: Principled masking of correlated spans (Йоав Левин и др.). Совместное маскирование коррелированных токенов значительно ускоряет и улучшает предварительное обучение BERT. Вместо случайного маскирования токенов авторы идентифицируют - используя только статистику корпуса - диапазоны токенов, которые сильно коррелированы. Для этого они расширяют точечную взаимную информацию между парами токенов до промежутков произвольной длины и показывают, как обучение BERT с этой целью обучается более эффективно, чем альтернативы, такие как равномерное маскирование, маскирование всего слова, случайное маскирование диапазона и т.д. Эта стратегия работает, не позволяя моделям предсказывать замаскированные слова, а заставляя ее использовать очень мелкие корреляции слов, которые часто появляются рядом друг с другом, чтобы повысить степень изучения более глубоких корреляции в естественном языке. https://openreview.net/forum?id=3Aoft6NWFej
Полный обзор ICLR от Zeta Alpha смотрите здесь: https://www.zeta-alpha.com/post/iclr-2021-10-papers-you-shouldn-t-miss
More from @bdscience_ru
  1. Oct 1, 2026Перезапуск Microsoft Copilot как «суперприложения» Компания Microsoft официально представи…
  2. Sep 25, 2026Распознавание экрана (Onscreen Awareness) Siri научилась понимать, что происходит у вас на…
  3. Sep 15, 2026Reuters раскрыло инцидент со скоординированными действиями ИИ-агентов OpenAI: Расследовани…
  4. Aug 31, 2026Самая ужасная гавайская рубашка Немецкий дизайнер Симон Веккерт разработал гавайскую рубаш…
  5. Aug 25, 2026WeatherNext от Google DeepMind совершил прорыв в метеорологии! Новый ИИ прогнозирует тропи…
  6. Aug 15, 2026🧠 Enterprise AI наконец-то перестал быть «чатиком сбоку» OpenAI опубликовали два исследов…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →