Открываем код YTsaurus Flow: как обрабатывать более 100 ГБ/с в реальном времени без потерь и дублей
Сегодня мы выложили в опенсорс YTsaurus Flow — движок потоковой обработки данных, созданный командами Yandex Infrastructure и Яндекс Рекламы. Он работает с потоками свыше 100 ГБ/с, хранит состояние между событиями и обеспечивает exactly-once по умолчанию. Исходный код доступен под лицензией Apache 2.0.
На Хабре разбираем, как Flow распределяет нагрузку между воркерами, восстанавливается после сбоев и фиксирует данные, состояние и прогресс одной транзакцией. Рассказываем про графы из компьютейшнов, автоматическую адаптацию пайплайна под поток данных, защиту от устаревших воркеров и работу в нескольких дата-центрах. На примере рекламных моделей показываем, как переход с пакетной обработки на потоковую помог значительно ускорить подготовку данных для их дообучения.
#статья
Post #259
108
