Меняются данные и подходы работы с ними: как в таких условиях выбрать правильную технологию?
Об этом на Fintech Data Day рассказали Михаил Комаров, директор по развитию бизнеса в области данных и ИИ «Ростелекома», и Григорий Бокштейн, ведущий эксперт по управлению данными TData.
За 15 лет мир данных кардинально изменился:
— Инструменты, в эффективность которых поначалу мало кто верил, уже прошли пик популярности и постепенно утрачивают клиентскую базу. Жизненные циклы технологий сокращаются: если раньше технологический стек пересматривали раз в 5 лет, теперь приходится это делать практически ежегодно.
— Параллельно уходят в прошлое казавшиеся вечными темы дискуссий — например, о преимуществах монолита «всё в одном» перед выделенным DWH — сейчас такой спор звучит странно.
— Объем данных постоянно растет, и одновременно меняется их природа и сценарии использования — очень быстро был пройден путь от транзакционных данных и справочников через кликстрим и неструктурированные данные до ИИ и LLM.
— Изменились ожидания бизнеса: если раньше отчетность требовалась максимум раз в месяц, то сейчас обновления нужны чаще, чем раз в 5 минут.
Это ведет к росту числа сценариев и требований — значит, к большему разнообразию технологий и фрагментации. Когда‑то можно было «купить Oracle и жить на Oracle», добавив немножко Exadata — этого вполне хватало. Сейчас же в компаниях уживаются несколько разных технологий под разные задачи, и их количество будет увеличиваться.
Что происходит сейчас?
Восторженное отношение к Lakehouse, которое мы сейчас наблюдаем, очень напоминает веру в Hadoop 10-летней давности, в то, что магическим образом прибыль «должна была вырасти» на 20% сразу после его установки.
Безусловно, в основе Lakehouse — отличная архитектура: разделенные compute и storage, специализированные технологии… Однако Iceberg, Trino, StarRocks — всего лишь компоненты «здесь и сейчас»: через год их могут сменить другие. Не стоит гнаться за хайпом — у каждой технологии есть своя область применения и свое место. Например, сейчас многие выбирают Iceberg для хранения данных в LakeHouse, но он не универсален, и сейчас уже набирают популярность альтернативные форматы хранения для определенного круга задач. Надо принять изменчивость мира данных.
Что с этим делать?
✅ Помнить — технологии внедряются для решения бизнес‑задач в оптимальные сроки, с оптимальной надежностью и бюджетом, и подбирать их с учетом текущего стека, отслеживать перспективные новинки и трезво оценивать затраты на внедрение и выгоды для бизнеса.
✅ Найти ответы на практические вопросы: какие типы данных хотим обрабатывать? Где и как их хранить? Какие требования к скорости и задержкам мы предъявляем?
✅ Определить экономическую целесообразность миграции с предыдущего стека технологий на новый. В миграцию на платформы Greenplum, Hadoop, ClickHouse и пр. (на которых работает 70% компаний) вложены огромные ресурсы. Для понимания — хранилище «Ростелекома» вмещает более 10 петабайт данных и тысячи источников. Переезд на новую платформу часто экономически нецелесообразен. При этом используемые сейчас решения — зрелые и понятные, их плюсы и минусы ясны, на рынке достаточно экспертизы — логично продолжать их развивать.
✅ Изначально проработать вопросы по ИБ при выборе технологий, т.к. часто об этом думают в последний момент, а технология этим требованиям не удовлетворяет: в продакшне выясняется, что нет многоуровневого доступа к данным, политик и пр.
✅ Выбрать релевантные инструменты. Например, продукты TDatа на open source позволяют закрыть полный цикл работы с данными — от хранения до управления. В их числе: RT.DataGovernance для упорядочивания и документирования данных и RT.ClusterManager для автоматизации развёртывания, управления и мониторинга продуктов платформы TData, а также доработанные версии GreenPlum, ClikHouse, которые в том числе получили сертификацию ФСТЭК, и собственная сборка Hadoop.
✅ Заранее ответить самим себе, что именно мы строим: «песочницу» для быстрых экспериментов или регламентированные процессы — и осознанно выбрать подход.
Post #110
402