TGViewer
ML Underhood ML Underhood @mlunderhood · 5.01K subscribers
Post #353 2.37K
ICML стартует уже в понедельник!

Мы уже рассказывали о Spotlight-работе, которую наши исследователи представят на конференции в Сеуле. Сегодня расскажем о других, не менее крутых статьях.

GraphPFN: A Prior-Data Fitted Graph Foundation Model

Исследователи из Yandex Research Дмитрий Еремеев, Олег Платонов, Глеб Баженов, Артём Бабенко, Людмила Прохоренкова создали графовую foundation model, развивающую подход Prior-Data Fitted Networks (PFN). Она предварительно обучается на миллионах специально сгенерированных синтетических графов, а затем может эффективно решать задачи на реальных данных как в режиме in-context learning, так и после дообучения. На широком наборе реальных графовых датасетов GraphPFN обходит все остальные протестированные модели.

Unveiling the Role of Data Uncertainty in Tabular Deep Learning

Авторы из Yandex Research Николай Карташев, Иван Рубачёв и Артём Бабенко, исследуют, почему современные методы глубокого обучения показывают высокое качество в задачах на табличных данных. Многие успешные идеи последних лет — эмбеддинги числовых признаков, retrieval-augmented-архитектуры и продвинутое ансамблирование (TabM) — неявно повышают способность моделей работать с высокой неопределённостью в данных. Статья предлагает новый взгляд на недавний прогресс в DL на табличных данных, помогает понять, какие механизмы могут стоять за успехами современных табличных моделей, и задаёт направление для разработки новых методов.

Relevance-Based Embeddings: Lightweight Candidate Retrieval via Heavy-Ranker Calls

Исследователи Яндекса — Кирилл Шевкунов и Людмила Прохоренкова — рассматривают задачу поиска наиболее релевантных объектов для заданного запроса.
Авторы предлагают способ строить эмбеддинги запросов и объектов с использованием информации от самой модели ранжирования. Подход учитывает релевантность запроса набору опорных объектов. Это позволяет получать более информативные представления и эффективнее находить кандидатов для дальнейшего ранжирования.

One-Step Gradient Delay Is Not a Barrier for Large-Scale Asynchronous Pipeline Parallel LLM Pretraining

Среди авторов статьи — исследователи Яндекса Филипп Змушко, Егор Петров, Нурсултан Абдуллаев и Михаил Хрущев. Работа выполнена в сотрудничестве с BRAIn Lab и MBZUAI.

В статье исследуется асинхронный pipeline parallelism для обучения больших языковых моделей. Такой подход позволяет повысить загрузку GPU, избавляясь от простоев видеокарт в пайплайне, однако долгое время считалось, что задержка градиентов ухудшает качество обучения. Авторы показывают, что проблема зависит не столько от факта самой задержки, сколько от типа используемого параллелизма, а также оптимизатора. В частности, Muon сохраняет значительную устойчивость в асинхронном режиме, а предложенная техника, основанная на Error-Feedback, дополнительно сокращает разрыв между синхронным и асинхронным обучением, позволяя обучать модели на масштабе 10B MoE без потери качества.

SoftSign: Smooth Sign in Your Optimizer for Better Parameter Heterogeneity Handling

Дмитрий Феоктистов из Yandex Research совместно с коллегами из BRAIn Lab предлагают новый подход к оптимизации нейронных сетей, основанный на сглаженной версии sign-обновлений. Он позволяет учитывать различия в поведении отдельных параметров модели и адаптировать величину обновлений во время обучения под них. На основе этой идеи разработали оптимизаторы SoftSignum и SoftMuon. Они стабильно превосходят классические sign-based-методы и AdamW на широком наборе задач.

О работах, которые представим на воркшопах, расскажем отдельно. И даже покажем, как это выглядело вживую.

#YaICML2026

ML Underhood
  • ❤ 17
  • 🔥 13
  • ❤‍🔥 5
  • 😁 1
  • 😎 1
More from @mlunderhood
  1. Sep 21, 2026Выложили собственную претрейн-модель AliceAI‑Foundation-80B‑A3B‑Base — от обучения с нуля…
  2. Sep 16, 2026Выпустили агента «Исследовать» в Алисе AI. Рассказываем, почему сделали ставку на обвязку…
  3. Sep 12, 2026Вчера на ECCV послушали кейноут Яна Лекуна — делимся основными тезисами. Лекун начал с кон…
  4. Sep 11, 2026Сегодня мы опенсорсим модель, результатом работы которой пользуются 49,5 млн пользователей…
  5. Sep 10, 2026Немного цифр и Best Paper Awards на ECCV 2026 Сегодня на конференции раздавали награды — и…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →