🔵 Data Lake
Data Lake — метод хранения данных системой или репозиторием в сыром (неструктурированном) или частично обработанном виде
✨большой срок хранения данных
✨есть возможность их преобразования
✨поддерживаются разные схемы чтения данных
Как хранятся данные
Сырой (Raw) слой
🔘загружаются без предварительной обработки
Обработанный (Processed) слой
🔘структурируются, очищаются, трансформируются
🔘форматы: табличные, агрегированные данные.
Аналитический (Curated) слой
🔘оптимизированы для аналитики и бизнес-отчетов, например, формируются OLAP-кубы или специализированные наборы данных
Форматы хранения
🔘структурированные: SQL-таблицы, Parquet, ORC.
🔘полуструктурированные: JSON, XML
🔘неструктурированные: видео, изображения, аудиофайлы, логи
Данные сохраняются как есть, структура определяется во время анализа.
Где используется Data Lake?
⏺аналитика Big Data: анализ поведения, прогнозы, сегментация (e-commerce, банки, нефтегаз и тд)
⏺ML и AI: подготовка данных для моделей (рекомендации, NLP, CV)
⏺телекоммуникации: хранения и анализа данных о клиентах, трафике, сетевых устройствах
⏺кибербезопасность, поддержка: логи, аудио, видео, текст
⏺объединение источников: CRM, IoT, соцсети, финтех
Виды интеграций с Data Lake
🔹ETL/ELT-процессы: загрузка данных из источников с минимальной трансформацией или после обработки
🔹API
🔹с BI и ML-платформами: например, Tableau, Power BI, Spark или TensorFlow для обработки данных напрямую из хранилища
Пример работы
Сбор данных о продажах из онлайн-магазина (CSV-файлы), отзывы клиентов (текст), логи веб-сервера (JSON) и записи звонков в службу поддержки (аудио)
➡️ для анализа отзывов используется NLP (извлекает из текстов тональность)
➡️ создаются модели машинного обучения по веб-логам анализиру
➡️ по объединным данным о продажах и звонках создаются отчеты
Чем отличается от СУБД и DWH
⏺СУБД: хранит структурированные данные в таблицах, оптимизирована для транзакций (например, учет заказов)ю Также предназначена для бизнес-логики
💙Data Lake: поддерживает любые форматы данных и предназначен для аналитики
⏺DWH: хранит обработанные и агрегированные данные для аналитики и отчетности
💙Data Lake: сохраняет исходные данные в сыром виде
Плюсы и минусы
➕хранение любых данных (структурированные, полу- и неструктурированные)
➕легко обрабатывать большие объемы данных, быстрый доступ к ним
➕базируются на Open Source решениях
➖риск "болота данных": потеря структуры и полезности данных без управления метаданными
данные требуют дополнительных шагов для анализа (ETL/ELT)
➖сложность реализации контроля доступа
➖для аналитики данные нужно обработать
➖для сбора реляционных данных есть гораздо более удобные решения
📎 Материалы
1. Data Lake
2. Хранилище данных vs. Data Lake. Или почему важно научиться ходить перед тем, как начать бегать
3. Чем озеро данных отличается от базы и зачем оно нужно аналитикам
4. Что такое озеро данных?
5. Распределенное хранилище данных в концепции Data Lake: с чего начать
6. Как мы организовали высокоэффективное и недорогое DataLake и почему именно так
7. Data Lake – от теории к практике. Сказ про то, как мы строим ETL на Hadoop
8. Что в глубинах Data Lake? Строим архитектуру, укладываем слои, распределяем ответственность
9. Озера данных vs обычные БД
#инфраструктура
➿➿➿➿➿➿➿➿
🧑🎓 Больше полезного в базе знаний по системному анализу
Post #536
15.3K
- 🔥 17
- 👍 8
- ❤ 7
- 👎 1