Яндекс открыл код YTsaurus Flow — с ним алгоритмы быстрее замечают, что интересы пользователей изменились
Технология обрабатывает клики, лайки и другие события сразу по мере их появления.
Немножко контекста. Чтобы рекомендации и реклама попадали в интересы человека, алгоритмам нужны свежие данные о его действиях: что он покупал, какую музыку слушал, о чем спрашивал. Обычно эти данные обрабатывают не сразу, их сначала накапливают, примерно как посылки для отправки поездом. Из-за этого информация поступает в систему с задержкой, которая может составлять часы. Flow сводит ее практически к нулю.
Что по технике:
— Каждое событие обрабатывается ровно один раз, без потерь и дублей.
— При сбоях технология продолжает работать, перераспределяя нагрузку между доступными серверами.
— Flow работает в рамках YTsaurus, поэтому накопленную и свежую информацию можно учитывать в одной системе.
В Яндексе Flow уже используют Маркет, антифрод и Реклама. В Рекламе он каждую секунду обрабатывает более 100 ГБ данных и миллионы событий. Подготовка данных для дообучения некоторых моделей раньше занимала больше 10 часов, а теперь эту задержку удалось почти полностью устранить.
Подойдет и за пределами рекламы: для подготовки данных для обучения ML-моделей, обновления информации на сайтах и в приложениях, подсчета просмотров, кликов и заказов. Выложили под Apache 2.0, а значит, использовать технологию можно и в коммерческих продуктах.
github.com/ytsaurus/ytsaurus/tree/main/yt/yt/flow
То есть Яндекс открыл не экспериментальную разработку, а технологию, которая уже успешно работает в его сервисах 💡
Post #10109
6.18K

- 🗿 30
- ⚡ 13
- ❤ 7
- 👍 5
- 😁 3
- ☃ 1
- 🔥 1
- 👏 1
- 🎉 1
- 💘 1