TGViewer
attention deficit attention deficit @papers_please · 202 subscribers
Post #35 285
Про X-split

В прошлое воскресенье на датафесте рассказывал про нашу архитектуру X-split Argus — делюсь презой!

Напомню, что в рекламном стеке семейство аргусов решает задачу ранжирования, но в цирке не выступает выступает как фича / эмбед в финальном ранкере. Его основная ценность в кодировании истории и долгосрочных интересов пользователя. Вообще способность модели учитывать длинный контекст при низком латенси и высоких нагрузках — это большой челлендж в индустрии, и для него, как обычно, нет единого подхода.

Если неймдропать, то бывают:
Q-former-like подходы — жмём историю в фиксированное число токенов с обучаемыми query-векторами;
GSU / ESU — делаем для каждого пользователя индекс из исторических событий и по эмбеду запроса достаём похожие. Запросом при этом могут быть разные сущности, не только текст;
KV-cache — храним KV-вектора по истории и релаксируем сложность инференса числом свежих событий. В этом подходе инфровых задач больше, чем ML-ных;
Сегментное сжатие — делим историю на сегменты длины K и вводим отдельные токены, которые суммаризируют свои сегменты. На инференсе смотрим только на токены сегментов + на все свежие события

Байт на комменты — пишите, чё забыл


X-split — нечто среднее между первым и вторым подходом: оффлайн-модель достаёт константное число эмбедов на пользователя, а рантайм одновременно процессит недавние события и оффлайн-вектора. При этом исторические эмбеды не зависят от запроса, как в GSU, и мы не обучаем отдельные query-эмбеддинги для оффлайн-части, как в Q-former'е.

Ещё у X-split'а есть важное свойство — это модель с ранним связыванием, то есть кандидат видит всю историю пользователя через аттеншн, а не через dot product с одним вектором. Собственно, отсюда и название: X — cross-attention. Такие модели выразительно более мощные, но требуют эффективной реализации кастомной аттеншн-маски на инференсе — слава Tri Dao, у нас в 2026-м есть работающий flex attention!

——————
Как всегда, всё это уже было в Симпсонах, и ещё в 2021 году в поиск выкатывалась модель с архитектурой, которую назвали semi-split. У неё тоже было раннее связывание и сжатие длинной истории через настоящий GSU. Чего у неё не было, так это скейлинга. Благодаря переходу от itemwise-обучения к авторегрессивному, мы научились масштабировать качество модели, заливая её контекстом и компьютом

В итоге щас имеем многообещающие приросты по оффлайну и wannabe-внедрение в ближайший месяц-два. Ждём 👍

——————
Наша команда проделала огромную работу по ресерчу, а сейчас команда рекламы титаническими усилиями затаскивает это всё в прод — мощь 😎
  • 🔥 5
  • ❤ 3
More from @papers_please
  1. Aug 12, 2026произошли два леген-wait for it-дарных релиза от нашей службы: 1. gryphon — от слова gener…
  2. Jul 6, 2026Про аватарку канала Если присмотреться, то можно заметить, что это не нормальная картинка,…
  3. Jul 6, 2026с содержательными постами перерыв, пока будет развлекательный контент
  4. Jun 20, 2026Как продать картину подороже? Допустим, вы хотите продать картину. Её себестоимость — это…
  5. Jun 15, 2026Ранжирование по eCPM Вернёмся к вопросу о том, как ранжировать объявления. Во вводном пост…
  6. Jun 14, 2026Дизайн механизмов Итак, аукцион решает проблему распределения слотов между рекламодателями…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →