TGViewer
Channel Public Channel
Information Retriever

Information Retriever

@inforetriever

Author: @kkhrylchenko

Рекламу не размещаю.
Subscribers
4.12K
Photos
324
Videos
2
Links
165
Recent Posts 14 shown
Post #472 1.56K
А я сегодня стал лауреатом премии Yandex ML Prize! В номинации “Преподаватели”.

Спасибо всем моим со-преподавателям и со-организаторам курсов из ШАДа и Вышки, а также Жене Соколову за мощную поддержку со стороны Вышки. Без вас бы ничего не получилось! Если и получилось бы, то в разы хуже))

И спасибо студентам за поддержку, внимательность (в том числе на лекциях) и лестные отзывы! И Яндексу спасибо за премию и поддержку преподавания в целом.

Конечно же приятно, когда преподавательские заслуги признают. Преподавание требует очень много времени и сил, и по пути часто происходят качели — думаешь нафига оно все надо, затем едешь на лекцию к студентам, общаешься с ними и понимаешь “а вот зачем!”. И так по кругу)) Любые поощрения преподавания эти качели слегка сглаживают)

Но я, конечно, надеюсь, что это не венец моей преподавательской карьеры и все еще впереди. Есть ощущение, что нужно еще много всего сделать. Будем делать)

P.S: и еще раз попиарю наш дипрексис курс :)
  • 🔥 137
  • ❤ 64
  • 👍 10
  • 🏆 2
Post #471 1.64K
Я не покемон, но меня можно сегодня поймать на Practical ML Conf :)
  • ❤ 41
  • 👍 6
  • 🔥 4
  • 🤡 1
Post #470 1.71K
WARNING: пост на отвлеченную тему))

Я люблю историю. В детстве мне попадались различные книжки про исторических личностей — Наполеона, Цезаря, Спартака и т. д. Еще были детективы/романы/etc с разной долей историчности — например, серия книг про Эраста Фандорина или романы Конана Дойля про столетнюю войну.

В студенческие годы перешёл на формат подкастов/аудиокниг, о которых и расскажу.

Сначала я наткнулся на подкаст Dan Carlin's Hardcore History. Мой личный топ выпусков:
* (death throes of the republic) про падение Римской республики, см. на эту тему еще следующий подкаст
* (punic nightmares) про Пунические войны. Переход через Альпы это epic
* (Thor’s angels и twilight of the aesir) про викингов. Интерес к викингам появился после одноименного сериала
* (wrath of the khans) про монгольскую империю — no comments. Можно еще в Ghost of Tsushima поиграть =)
* (blueprint for armageddon) про первую мировую, начиная с детального описания как Франц Фердинанд завернул не туда на перекрестке; на реддите многие считают эту серию лучшей
* (ghosts of the ostfront) внезапно, про Вторую мировую с перспективы Советского Союза
* (the destroyer of worlds) про Холодную войну и угрозу ядерной войны; про Карибский кризис и переговоры Кеннеди с Хрущевым (тряска невероятная)
* (prophets of doom) про Мюнстерскую коммуну, когда в 16 веке в немецком городке все спятили в ожидании конца света. Актуально
* (mania for subjugation) прямо сейчас выходит хорошая серия эпизодов про Александра Македонского

Если интересно углубиться в историю Древнего Рима (все мы иногда думаем про Римскую империю), есть подкаст от Mike Duncan “The History of Rome”. Рассказ очень дотошный, от самого основания Рима и его 7 королей (да, там были короли) до падения Римской империи. Подробно проходится по всем императорам. Для понимания масштаба, я прослушал 113 эпизодов из 179; каждый эпизод длится где-то 20-30 минут. Больше всего понравился сегмент про падение римской республики, про Цезаря и Августа. Если что, первый римский император это Август, не Цезарь ;)

Чтобы узнать больше про Восточную Европу, рекомендую курс “A History of Eastern Europe” от Gabriel Liulevicius; слушал даже дважды. Второй раз, кажется, после прохождения Kingdom Come Deliverance и перед посещением Чехии)

Про Европу в целом:

* у того же лектора есть курс “War, Peace, and Power: Diplomatic History of Europe, 1500-2000”. Очень интересно слушать про дипломатические игрища и европейский баланс сил (Concert of Europe). Кажется, отсюда и от Цвейга я много узнал про Габсбургов, потом с большим интересом ходил по венскому музею истории искусств и разглядывал габсбурские коллекции.

* у Mike Duncan есть еще один подкаст под названием “Revolutions”; каждый сезон освещает какую-то конкретную революцию. Я слушал про французскую; на реддите её советуют всем, кому интересно узнать побольше про Европу. Пока что меня хватило примерно на 100 эпизодов. Mike всегда делает очень подробные хронологические рассказы, детально описывает все, что происходит в рамках выбранного исторического периода. Круто, что ничего не упускается, но в определенный момент начинаешь уставать))

* еще рекомендую книгу Стефана Цвейга “World of Yesterday”, если хочется проникнуться вайбиками Европы до мировых войн.

Перед второй поездкой в Японию хотелось про нее что-нибудь поизучать. Подробную историю Японии я быстро дропнул =) А вот про современный период есть хороший курс под названием “The Rise of Modern Japan”. Внезапно, было интересно послушать про японский кинематограф.

И раз уж зашла тема про подкасты, хочу также порекомендовать подкаст по философии — "Philosophize This!". Слушать все эпизоды подряд необязательно, они самодостаточные.
  • ❤ 40
  • 🔥 7
  • ❤‍🔥 2
  • 👍 2
  • 😱 1
  • 🎉 1
Post #469 2.58K
Yandex Advanced Personal Intelligence Lab
(лаборатория перспективных исследований персонального интеллекта)

Возвращаюсь в Яндекс!

Моя давняя амбиция — немного подвинуть рексисоидов из Дипмайнда. Показать, что мы тоже умеем (научились) в рексис. Что у нас есть свое видение, навыки, и мы можем мощно контрибьютить в общее фундаментальное развитие рекомендательных систем. А еще персонализация — это, кмк, очень важная задача, которой в силу проф. деформации топовые лабы занимаются постольку-поскольку. Человечество пока не сильно продвинулось в персонализации агентов/чатботов; в общем, есть куда поконтрибьютить.

Чтобы эту амбицию реализовать, нужно:

* построить крутую команду — такой опыт у меня уже есть. Раньше я в основном "черпал" талантов из пула ммпшников; все самые удачные наймы — это кличи на стажировку в чатик выпускников/студентов ммп. Но даже самых талантливых ребят надо было года два учить рекомендашкам/large-scale диплернингу. Сейчас ситуация проще — рексис коммьюнити / популярность рексиса среди студентов / пул кадров растут; а с онбордингом помогает дипрексис курс.

* много ресурсов. Чем больше ресурсов (GPU/CPU/диска), тем быстрее ставятся эксперименты. На масштабе рекомендаций, когда мы работаем с очень большими датасетами (см. следующий пункт), без нормальных ресурсов вообще тяжело.

* конкретно в рекомендашках еще важен доступ к пользовательским данным; и чем больше данных, тем лучше — особенно для текущих фронтирных направлений.

* и, наконец, нужен доступ к продакшну и к коллегам, которые помогут быстро итерироваться в оном продакшне. Сильного доверия оффлайн-оценке качества в рекомендациях нет — она смещена из-за специфики пользовательского фидбека и продовой рексистемы. Для железных выводов нужны A/B-тесты. Если посмотреть на тот же (рексис) Дипмайнд — там всё сильно production-oriented и почти во всех статьях репортятся результаты A/B тестов; аналогично Spotify Research.

Что в итоге имеем:

* для первого пункта нужно вкладываться в популяризацию и развитие образования в области рекомендательных систем. Очень много усилий было вложено в дипрексис курс; мы на этом не останавливаемся и планируем вторую итерацию — более масштабную и ещё более актуализированную.

* для остального нужно быть частью индустрии. В академии нет нужного количества ресурсов, доступа к данным нужного масштаба и A/B тестов на реальных пользователях.

Так вот.

Буду строить свою лабу в Яндексе! Почему Яндекс: в любом другом месте мне потребовалось бы много времени, чтобы наладить инструменты, процессы, выстроить коммуникации, встроиться в организацию. Внутри Яндекса есть разные варианты, где этим можно заниматься — я выбрал Рекламу.

Почему Реклама: это самая большая и важная рекомендательная система Яндекса. На протяжении всей карьеры в Яндексе у меня было много совместных проектов с ребятами; все ключевые разработки, типа первых яндексовых рекомендательных трансформеров / Дипранкера (нейросетевого ранжирования) / Аргуса, туда успешно доехали. Команда в рекламе большая и экспертная — есть крутые зрелые R&D / продуктовые / инфровые команды, почти со всеми из которых я хорошо знаком и вместе работал. К ребятам можно органично встроиться ресерч лабой, с хорошей синергией; и с порога получить приличное количество ресурсов.

Чем будет заниматься лаба: тем же, чем занималась моя бывшая команда, но с еще большим фокусом на ресерч. Я это позиционирую как applied research — делаем долгосрочные исследования, но при этом сохраняем прикладной фокус; прямо как (рексис) DeepMind и Spotify Research. Конечная цель — импакт в продуктах и рост метрик; и важно то, какими методами мы будем этого достигать — через фундаментальные исследования и фронтир, а не через инкрементальные улучшения и жесткий тюнинг под домены. А ещё очень важно при этом поддерживать и развивать ресерч культуру и делиться результатами с сообществом — писать статьи, участвовать в конференциях, преподавать. Также я рассчитываю, что наши наработки в конечном счете будут полезны не только рекламе Яндекса, но и другим доменам (в том числе горячо любимой мной Музыке <3). И что доведется повзаимодействовать с ребятами из YandexGPT и другими R&D командами (включая моих бывших коллег из рекомендательной службы!).

Есть видение, куда надо двигать рекомендашки (куда нас двигает bitter lesson), и есть возможность превратить его в реальность, вместе с ребятами из рекламы. Если раньше я пытался делать сразу почти всё — ресерч, разработку инструментов, фреймворков, погружаться в продукты, внедряться — и это существенно усложняло построение сильной ресерч команды, то здесь вижу НУ ОЧЕНЬ большой потенциал для симбиоза с рекламными командами, у которых все эти аспекты уже хорошо развиты. В общем, хайп н е р е а л ь н ы й!

Про образование. Для меня, наверно, самая значимая цельная вещь, которую я сделал к текущему моменту — это дипрексис курс. Хочется и дальше его развивать. Буду продолжать вести курсы в ШАДе и Вышке, а также руководить студентами; вообще, очень удобно делить идеи на сложные фундаментальные рабочие задачи и более локальные гипотезы — и вторые проверять вместе со студентами. А ещё в Вышке я теперь заместитель заведующего базовой кафедрой Яндекса, что даёт мне возможность устраивать всякие разные коллабы между Яндексом и Вышкой. Если вы работаете в Яндексе и хотели бы заниматься преподаванием / научным руководством, то я теперь тот самый человек, который может вам в этом помочь.

P.S.: со мной можно пообщаться офлайн на Practical ML Conf 19 сентября, где я буду в качестве участника дискуссии "От исследования к продукту и обратно...". Ну или можно написать в личку. Если лаба заинтересовала, но думаете что на текущий момент нет шансов в неё попасть / не готовы уходить с текущего места, то всё равно полезно дойти до меня и выразить свой интерес, на будущее.

Всё, пока, нет времени говорить, побежал двигать рексис фронтир))

P.P.S.: вижу все сообщения в личке, пока не успел их разгрести. Обязательно всем отвечу)
  • ❤ 132
  • 🔥 76
  • ❤‍🔥 28
  • 🍾 8
  • 😁 2
Post #468 2.06K
  • ❤‍🔥 30
  • 🔥 2
  • ❤ 1
  • 🤝 1
Post #467 2.34K
Небольшой тизер :)

Таксую чисто для души (шучу)
  • 😁 39
  • 🔥 9
  • 👀 4
  • 🥱 1
Post #466 3.52K
Посмотрел новый видеоролик Dwarkesh Patel про ситуацию с агентами и OpenAI, где он в том числе про третью волну агентов рассказывает. Мы после первых двух волн уже загнались, а тут еще и третья, более страшная… Непонятно почему так спокойно рассказывает, возможно оставил эмоции на четвертую волну — ждем, когда окажется, что агенты уже выкачали веса и сервят себя где-то на просторах интернета.

Вообще, если чем-то давно хотели заняться, но откладывали — возможно хороший момент))

Игорь в сиолошной рекомендует упражнения для спины, а я порекомендую компьютерную игру — сейчас самое время пройти NieR: Automata. Там, в целом, неплохо раскрыта тема persistent агентов с недостижимыми целями

P.S: от меня можно ждать в сентябре карьерных апдейтов. Stay tuned 👀
  • 🔥 22
  • 👀 5
  • 👍 3
  • ❤ 2
  • 🥴 2
  • 🤩 1
Post #462 1.93K
Отличный пост от Артёма
Post #461 2.36K
  • 🔥 86
  • 😁 1
Post #460 2.84K
На пятый день KDD’26 ничего особо интересного не было.

Генеративные и LLM-based рекомендации, agentic RecSys — основные текущие тренды в рекомендашках, которые мы с вами обсудили в рамках этой серии постов.

В общем, как и всегда, спасибо, что читали!

P.S: ну а я теперь держу путь в Японию. Следующие две недели буду собирать гачапоны на Акихабаре и откисать в горячих источниках на Хоккайдо. Не теряйте))
  • ❤ 48
  • 👍 16
  • ❤‍🔥 5
Post #459 2.54K

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • ❤ 29
  • 🔥 19
  • 😁 3
Post #450 3.08K
KDD’26, день четвертый.

Сегодня в основном вел закулисные разговоры, про которые не могу ничего рассказать. А вот про что могу:

1. Доклад от команды YouTube и GDM. Судя по всему, у них прям очень жестко цензурируются любые рассказы наружу, ничего лишнего упоминать нельзя, поэтому они придерживаются формата пересказа уже опубликованных статей.

Держите еще одно название для кандгена — nomination. А преранжирование — prescoring. А группировку айтемов в выдачу в докладе нарекли packing.

В рамках доклада выступало четыре человека. Сначала был рассказ про knowledge distillation в ранжировании:
* упоминали две свои более старые работы — Bridging the Gap: Unpacking the Hidden Challenges in Knowledge Distillation for Online Ranking Systems и Zero-shot Cross-domain Knowledge Distillation: A Case study on YouTube Music
* и как раз на KDD’26 у них вышла новая статья — Addressing Intent Dissonance in Cross-Domain Distillation on YouTube. Кто первый прочитает, напишите в комментариях что там :)

Затем был раздел про анализ последовательностей:
* упоминали нашу любимую Top-K Off-Policy Correction for a REINFORCE Recommender System, а также оригинальный YoutubeDNN, в котором впервые предложили next watch prediction
* затем показали свою новую работу ClockRoPE: Random Fourier Rotations for Temporal Routine Modeling, в которой, как я понял, сделали time-aware RoPE, то есть учли время при анализе последовательности
* и еще одну новую работу Tokens are All You Need: Dual-purpose Semantic IDs for Achieving LLM-Level I/O Efficiency in recommendation systems. Заменили в рекомендательной нейросети эмбеддинги на семантические айдишники

Потом говорили про LLM x RecSys:
* упомянули TIGER, а также статью про semantic IDs для ранжирования в YouTube, PLUM, STATIC
* Token Factory: Efficiently Integrating Diverse Signals into Large Recommendation Models. Заменили в LLM семантические айдишники на эмбеддинги :)
* LLM-Based User Personas for Recommendations at Scale. Используют LLM для exploration с помощью генерации новых для пользователя интересов
* TokenMinds: Pretrained User Tokens and Embeddings for User Understanding in Large Recommender Systems. Делают семантический айдишник пользователя. У меня в этом году студент такую дипломную работу в бакалавриате вышки защитил))

Последняя, четвертая секция называлась Gemini Commercial Intelligence:
* это как раз работы команды Derek Cheng, подарившей миру DCN-v2
* как и писал в прошлом посте, делают ИИ-ресерчера, который их заменит (ну и нас тоже, за компанию). Прикладываю статьи ниже
* AgenticTagger: Structured Item Representation for Recommendation with LLM Agents
* PACEvolve: Enabling Long-Horizon Progress-Aware Consistent Evolution
* PACEvolve++: Improving Test-time Learning for Evolutionary Search Agents
* также активно занимаются бенчмарками для этого ИИ-ресерчера. Статья Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory
* еще делают модель, которая по набору товаров будет генерировать рекламу, в которой эти товары присутствуют. Звучит немного рандомно, но в тему коммерциализации укладывается

3. Был доклад от Федора Борисюка про эволюцию ранжирования в Линкедине. Подсвечу лишь статью Semantic Search At LinkedIn; вроде как это их главная работа про ранжирование на текущий момент. Федор, как всегда, первый автор :)
  • ❤ 15
  • 👍 7
  • 🔥 1
Older posts →

About this channel

How can I read @inforetriever without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Information Retriever: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Information Retriever have?
Information Retriever (@inforetriever) has 4.12K subscribers on Telegram, refreshed roughly every 30 minutes.
Does Information Retriever know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →