TGViewer
Nik в мире данных Nik в мире данных @analytics_engineer · 1.31K subscribers
Post #60 2.64K
Обнаружил интересный пост - https://javisantana.com/2024/11/30/learnings-after-4-years-data-eng.html

90% утверждений резонируют с моим опытом

People focus on learning the tools, which is good, but they forget about principles.


Перейти с одного решения на другое для 99% задач потребует неделю знакомства с инструментом и изучения архитектуры нового решения 😎. Есть небольшое число задач, требуемое максимальной оптимизации и знания кишков, но такая оптимизация является внутренним решением с структурой данных, придуманной под него и разрабатывается итерационно

Ingestion is 80% of the job but usually it’s not even monitored.


Загрузка данных в базу данных / файловую систему - то место, которое часто можно ускорить за небольшие усилия. Особенно, если у вас какое-то самописное решение по вставке данных. ✨

Data quality is like unit testing but in production.


Как фанат WAP паттерна, полностью поддерживаю такое. У меня были разговоры с принципал инженерами, почему у нас нет покрытия юнит тестами, и зачем нам runtime проверки. Считаю, что технические проверки должны быть у каждого ETL при загрузке (а в идеале и бизнес-проверки в том числе). На паре проектов у меня было, что косты dq были почти такие же, как косты ETL загрузок.

Most companies just need basic bash / make knowledge, a single instance SQL processing engine (DuckDB, CHDB or a few python scripts), a distributed file system, git and a developer workflow (CI/CD).


Ну это прямо база. Один раз я решал задачу переписывания загрузки сотен мегабайт в неделю (!!!) через Apache Spark и Hadoop. Задача оптимизации заключалась сделать так, чтобы нетворк и shuffle был минимален и все считалось на одной ноде 😂 А выбрать другую архитектуру нельзя было, так как архитекторы банка решили, что все витрины должны считаться в хадупе 👋

There is always a schema. You decide on it when you write the data or later when you read it, but at some point, you need to decide attributes and data types for your data


В экстремальном случае уже на уровне дата продукта / витрины появляется схема и разбор полустуктурированных данных произойдет на этапе подготовки данных. Так что парсинг JSON потребуется все равно =)
  • 👍 19
  • 🔥 11
  • ❤ 1
More from @analytics_engineer
  1. Aug 30, 2026AI Dev Tools Zoomcamp 2026 launches tomorrow. The course teaches you how to: - Choose the…
  2. Aug 10, 2026В целом, заметил, что в моем bubble нетворке обсуждают подписки и конкретные модели сильно…
  3. Jul 28, 2026Решил сделать площадку для обсуждений / созвонов по Agentic / AI Engineering in Data на ос…
  4. Jul 20, 2026Ищу к себе двух инженеров, удаленка (100-150$k) Вакансия ближе к разработке и ML https://j…
  5. Jul 6, 2026в бигтехе после сокращений, флатерингов, лейфоф промзошла тихая девальвация уровней. она и…
  6. Jun 30, 2026DEMate - тот, кто тебя заменит Meta пошарила статью про DEmate - внутреннего AI-ассистента…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →