В опенсорсе появилась технология для обработки данных в реальном времени
Яндекс выложил в открытый доступ технологию для непрерывной обработки больших потоков данных YTsaurus Flow, которая обрабатывает клики, лайки и другие события по мере их появления — обычно такие данные накапливают и обрабатывают с задержкой до нескольких часов.
⚡️ Собственная разработка Яндекса стала отечественной альтернативой зарубежным решениям для потоковой обработки данных вроде Kafka и Spark. Теперь крупные российские компании могут самостоятельно развернуть Flow, использовать в проектах и дорабатывать под свои задачи.
⚡️ В Маркете технология уже помогает быстрее собирать статистику для анализа спроса, в антифрод-системах — оперативно обнаруживать подозрительные действия, в Яндекс Рекламе — обрабатывать данные для подбора предложений.
⚡️ Масштаб обработки — более 100 ГБ данных в секунду и миллионы событий. Flow работает с кликами, показами, лайками, заказами и другими событиями в реальном времени.
⚡️ Технология сокращает задержку при подготовке данных для рекомендательных моделей в Рекламе: раньше на это уходило больше 10 часов, теперь около двух.
⚡️ Экономический эффект — меньше затрат на инфраструктуру и быстрее обновление моделей. За счет обработки данных в реальном времени можно оперативнее реагировать на изменения спроса и интересов пользователей, не тратя ресурсы на лишнюю обработку и повторную запись данных📌
💻 СофтТех в Telegram | в MAX
Post #4858
3.02K