TGViewer
PyMagic PyMagic @pymagic · 5.56K subscribers
Post #677 2.91K
Разбор докладов с конференции

И вот подошел к концу второй день конференции Data Fusion, на котором было множество различных секций, дискуссий и кейс-сессий. Я решила написать о парочке докладов, которые мне больше всего понравились.

➡️Первый доклад «Ключевые проблемы рекомендаций на последовательностях и варианты их решения». Посвящен проблемам в Sequential рекомендациях. В первой части рассматривалась проблема разделения данных: популярный leave-one-out допускает temporal leakage и формирует нереалистичный горизонт предсказания, что может негативно влиять на ранжирование и выводы о моделях. В качестве альтернативы предложен global temporal split с выбором целевых взаимодействий Last / Random / Successive - такие схемы лучше соответствуют задаче next-item prediction, уменьшают утечки и дают более стабильные результаты, хотя и сокращают число тестовых пользователей.

⭐️В целом, проблема LOO очень понятна, особенно для последовательных данных, и было интересно услышать об обоснованности сочетания GTS с разными способами выбора целевых взаимодействий.

➡️Во второй части освещена проблема Item Cold start: в sequential моделях новые объекты не имеют обученных эмбеддингов. Frozen content embeddings оказываются негибкими, а полный fine-tuning приводит к drift представлений и ухудшает cold-start. В качестве trade off использовался frozen content-based embedding + маленький обучаемый delta-вектор с ограниченной нормой, который позволяет модели аккуратно адаптироваться под взаимодействия, сохраняя семантику контентных признаков.

➡️Еще понравился доклад про победившее решение на соревновании Data Fusion «Страж» (задача классификации неподтвержденных операций клиентов банка). Построено чисто на нейронных сетях: данные формировались окнами (~3 месяца транзакций или 512 токенов), для каждого пользователя создавали 5–10 окон, чтобы покрыть повторяющиеся паттерны. Модель - стандартный Encoder трансформер: блок трансформера включал 2 ModernBERT (для глобальных паттернов) + 2 CNN (для локальных).

⭐️Думаю, что в ближайшем будущем многие табличные задачи будут решаться с помощью трансформеров, но при этом остается важной проблема инференса в продакшене (latency и ресурсы).

Посмотреть доклады с конференции можно уже на официальном сайте https://data-fusion.ru
  • ❤ 5
  • 👍 5
  • 🔥 3
  • ❤‍🔥 2
More from @pymagic
  1. Oct 6, 2026Всем привет! 👋 Давно здесь не было новостей, поэтому начну с главной: с недавних пор я пе…
  2. May 19, 2026Уже на этой неделе с 23 мая стартует Data Fest 2026! А 24 мая пройдёт секция ML in Adverti…
  3. May 6, 2026Как кластеризовать миллионы объектов с высокой размерностью и сложной структурой данных? К…
  4. Apr 24, 2026Привет! Вечер четверга — самое время вспомнить о том, что хотелось подать заявку на спикер…
  5. Apr 8, 2026Первый день на Data Fusion 2026 Сегодня, 8 апреля, я побывала на первом дне конференции Da…
  6. Mar 20, 2026Новости Давно я тут ничего не писала, был небольшой перерыв. Для всех новеньких меня зовут…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →