TGViewer
Блог о Data Science 💻 Наука о данных Блог о Data Science 💻 Наука о данных @notedatascience · 3.87K subscribers
Post #365 3.72K

Forwarded from РИСЕРЧОШНАЯ

💬 Yet another dataset?

Сегодня — честный обзор на уже захайпленный датасет.
Если вы когда-либо занимались ресерчем в рексисе, то точно сталкивались с проблемами датасетов.
(Можно вспомнить классическую статью Are We Really Making Much Progress?)

Сначала — немного боли из прошлого:
— гигантский гэп между train и test
— однотипный фидбек
— отсутствие разнообразия пользовательских паттернов

И это всё — на фоне постоянных споров в академии про то, что вообще считается хорошим датасетом.

Даже если вы соберёте SOTA-модель — она может просто не «прокраситься» на кривом сете.
Ну серьёзно, в том же MovieLens test отстоит от train на несколько лет.

И вот — датасет от Яндекс Музыки.
Огромный:
4.78 млрд взаимодействий
9.39 млн треков
1 млн пользователей
⭐ и впервые — флаг is_organic, который показывает:
пришёл ли пользователь к треку сам или его привёл алгоритм

С одной стороны — это прям must-have для исследовательского пула.
Многоуровневый фидбек:
⭐ implicit (прослушивания)
⭐ explicit (лайки, дизлайки, отмены)

Даже эмбеддинги спектрограмм есть.

А ещё — продуманный split:
⭐ leave-one-last
⭐ temporal global
(приложу картинку в комментах — очень в тему для продовой оценки)

По сравнению с Netflix, Steam и прочими — это реально большой и комплексный датасет.

Я бы еще упомянул о бенчмарках и красивом коде куда на мой взгляд легко интегрировать свои решения.

Один момент, о котором почти никто не говорит — это домен.

Яндекс Музыка — это, как и TikTok, продукт с ярко выраженными короткими и длинными предпочтениями.
Здесь трансформеры можно не просто тестировать — здесь они раскрываются.

Но. Доверяй, но проверяй.
👀 Насколько честно размечена органика?
👀 Подходит ли датасет для cold-start задач?
👀 Для многих экспериментов вокруг LLM, мне бы хотелось увидеть больше фичей о пользователях, да и в целом фичей. (btw я понимаю, из-за чего их не включают)

Спасибо ребятам из Яндекса за такой летний подгон.
Реально мощный вклад в сообщество, действительно мало компаний могут себе это позволить.

➡️ Hugging Face и arxiv
huggingface.co yandex/yambda · Datasets at Hugging Face We’re on a journey to advance and democratize artificial intelligence through open source and open science.
  • 🐳 10
  • ❤ 5
  • ⚡ 5
More from @notedatascience
  1. Sep 23, 2026В субботу, 17 октября, Москва станет точкой притяжения для всех специалистов в области Rec…
  2. May 19, 2026Андрей Карпаты перешёл в Anthropic @notedatascience
  3. Apr 23, 2026OpenAI показали GPT 5.5 Раскатывают уже сегодня на всех подписчиков. Модель заметно умнее…
  4. Mar 31, 2026Теперь и код Claude Code утек. 👍 Говорят его слили... Ошибка в map пакете и можно разобра…
  5. Mar 25, 2026И тут очень вовремя OpenAI закрывают Sora Нейротикток OpenAI в итоге не взлетел и не имел…
  6. Mar 18, 2026OpenAI запускают серию соревнований, подготовленных членами их исследовательской команды С…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →