YTsaurus Flow рассчитан на непрерывные потоки данных большого объёма: события в интернете обрабатываются в реальном времени, без ожидания, пока данные накопятся в партии.
За счёт этого алгоритмы быстрее замечают смену интересов пользователей и точнее подбирают рекламу, товары, книги и фильмы.
Flow работает в режиме exactly-once: каждое событие учитывается однократно, без потерь и дублей. Сбои не останавливают работу: нагрузка перераспределяется между доступными серверами. Технология встроена в YTsaurus, открытую платформу Яндекса для работы с большими данными, ориентированную на крупный бизнес. Благодаря Flow компании смогут работать с данными не только партиями, но и по мере поступления, а накопленная и свежая информация будет учитываться в одной системе.
🟡В продакшене
В Яндекс Рекламе нагрузка на Flow — свыше 100 ГБ данных и миллионы событий ежесекундно. Там же технология сократила время подготовки данных для дообучения части рекламных моделей: раньше процесс занимал более 10 часов, теперь задержка почти полностью устранена. Маркет применяет Flow для оперативной статистики и реакции на изменения спроса, антифрод-системы — для обнаружения действий злоумышленников.
🟡Где ещё применять
Обучающие выборки для ML, актуальные данные для сайтов и приложений, счётчики просмотров, кликов и заказов — самые разные проекты, где важна актуальность данных.
📌 Лицензирование: Apache 2.0
🟡Статья
🟡GitHub
@ai_machinelearning_big_data
#news #ai #ml
