TGViewer
Channel Public Channel
Data Engineer

Data Engineer

@dataengineernews

Дата-инженерия в схемах и мемах

По всем вопросам — @mobiledeveloper_bot
Subscribers
478
Photos
190
Videos
3
Links
128

Showing posts older than #332 · Back to latest

Older Posts 20 shown
Post #331 377

Forwarded from дата инженеретта

AI-эра тех собесов

💻 Теперь вместе с sql/python-задачками на тех собесе могут дать создание мини-проекта за 20 минут

Разрешается использовать все, что угодно, любые ллм. (Только подумайте над тем, что будет работать, когда вы на созвоне на внутренней платформе.) Есть только одно условие — шерить экран

Примеры заданий

➡️Для де: написать ddl таблиц, sql-запросы по сборке витрин, несколько дагов

➡️Для разраба: придумать архитектуру микросервиса и реализовать его

➡️Разобраться в коде и найти баги

Сгенерили, а дальше?

🙂 Интервьюеры могут сами пока не до конца понимать, что делать после генерации кода) Они просто сидят и смотрят, как ты будешь разбираться, что происходит, просят внести правки или объяснить кусок кода

Пока такое замечено в WB в последние 2 месяца, но могут подтянуться и остальные. Особенно после этого поста😁

@data_engineerette
Post #330 335

Forwarded from tl;dr data

Databricks объявил конец эпохи пайплайнов.

На Data + AI Summit 2026 компания представила новую архитектуру LTAP (Lake Transactional/Analytical Processing), которая должна объединить транзакционные системы, аналитику, стриминг и AI на одной копии данных. Идея радикальная: приложения, BI-системы и AI-агенты работают с одним источником данных напрямую, без CDC, ETL и бесконечных репликаций между OLTP и аналитическими хранилищами.

Последние двадцать лет типичная архитектура выглядела примерно так:

PostgreSQL → CDC → Kafka → ETL → Data Warehouse → BI → AI

Каждый новый слой добавлял задержки, повышал стоимость владения и создавал новые точки отказа. Особенно болезненно это стало с появлением AI-агентов, которым нужны актуальные данные в реальном времени, а не копия пятиминутной давности.

Ответ Databricks — хранить операционные и аналитические данные в одном месте. В основе подхода лежит Lakebase, PostgreSQL-совместимая система, работающая поверх объектного хранилища и интегрированная с Lakehouse. Компания называет это первым LTAP-подходом, который должен заменить как традиционные ETL-процессы, так и многочисленные реплики баз данных.

Конечно, заявления о «смерти пайплайнов» стоит воспринимать осторожно. Интеграции между компаниями, обмен данными с внешними системами, специализированные стриминговые сценарии и гибридные архитектуры никуда не денутся.

Но сам тренд выглядит очень интересным. Если раньше индустрия спорила, что лучше — Data Lake или Data Warehouse, то теперь главный вопрос звучит иначе:

Нужно ли вообще перемещать данные между системами, если все сервисы, аналитика и AI могут работать поверх одной копии данных?

Похоже, именно вокруг этого вопроса и будет строиться следующая большая битва в мире Data Engineering.

@tldr_data
  • 🔥 5
  • 👍 1
Post #329 352

Forwarded from tl;dr data

Amazon S3 annotations: attach rich, queryable context directly to your objects

Amazon S3 представил Annotations — новую функцию метаданных, которая позволяет пользователям прикреплять к каждому объекту до 1 ГБ бизнес-контекста, распределённого по 1 000 именованным аннотациям. Эти аннотации можно изменять без перезаписи самого объекта, а также они автоматически индексируются в таблицы Apache Iceberg, доступные для запросов.

Функция уже доступна во всех регионах AWS и предназначена для поддержки AI-агентов и автономных рабочих процессов. Она позволяет хранить расширенные метаданные — например, транскрипты, возрастные рейтинги контента, технические характеристики и другую контекстную информацию — непосредственно рядом с объектами в S3.

Все аннотации можно искать и анализировать через Amazon Athena, что избавляет от необходимости поддерживать отдельные базы данных для хранения метаданных.

@tldr_data
Amazon Amazon S3 annotations: attach rich, queryable context directly to your objects | Amazon Web Services Amazon S3 now lets you attach up to 1 GB of rich, mutable, and queryable context directly to your objects using annotations, purpose-built for AI agents and autonomous workflows that need to discover, understand, and act on data at scale without maintaining…
  • 👍 2
  • ❤ 1
Post #328 393

Forwarded from tl;dr data

Anthropic наконец-то опубликовали свой секретный рецепт для агентной аналитики, и это…

Моделирование данных по Кимбаллу (Kimball Data Modeling)

Шутка здесь в том, что многие ожидают увидеть какой-то революционный AI-фреймворк, сложную агентную архитектуру или новый research paper, а оказывается, что в основе агентной аналитики лежат старые добрые принципы построения аналитических хранилищ данных по Кимбаллу: факты, измерения, схема звезда, понятные бизнес-сущности и качественно подготовленные данные.

Для дата-инженеров и аналитиков это примерно звучит как:

Секрет успешных AI-агентов? Сделайте нормальный DWH

@tldr_data
  • 👍 8
  • 😁 6
Post #327 360

Forwarded from tl;dr data

Launching Polars Distributed on Kubernetes

С сегодняшнего дня, Polars также доступен как распределённый движок (Distributed Engine) для Kubernetes.

Цель Polars всегда заключалась в том, чтобы сделать обработку данных на одном узле максимально производительной и удобной. Теперь Polars хочет распространить этот подход и на распределённые вычисления.

https://pola.rs/posts/polars-distributed-available-on-kubernetes/

@tldr_data
Polars Launching Polars Distributed on Kubernetes We are launching our distributed engine on Kubernetes (e.g. on-prem, AKS & GKE). Try it for free. It also ships with advanced query profiling and OpenLineage support.
  • 👍 5
Post #326 452
Нашел, наконец-то, применение ИИ в своей жизнедеятельности - назначил его смотрящим за моей беговой активностью. Прогнозы выглядят пока очень оптимистичными, за год Клодик обещает меня сделать чемпионом России по легкой атлетике в моей возрастной категории.

Проверим-проверим…

Подписывайтесь, в общем, кому интересно следить за экспериментом😁

https://t.me/runningwithai/3
Telegram ИИду на рекорд Я известен своим скептическим отношением к ИИ. Причина проста, у меня не было сценариев для его использования: писать код и тексты я и сам люблю. Да, это занимает больше времени, но и удовольствия приносит немало. В общем, поэтому технологию сию я долгое…
  • 🎉 6
  • 😁 1
Post #325 478
Еще один экземпляр из бумажной коллекции. Начал читать.
  • 👍 3
  • 🔥 1
Post #324 567
Фабрика архитекторов зеленого поля

Хорошее название - половина статьи.

Идея написать о сходстве мира данных и футбола появилась у меня давно, отдельные куски я здесь выкладывал. Существовало даже рабочее название - «Все о данных для настоящих мужиков» - однако моего внутреннего перфекциониста оно не удовлетворяло, хотя, без сомнения, является сутевым. Хотелось чего-то более четкого и, вместе с тем, емкого… Поиски идеального названия отвлекали от самого процесса написания статьи.

И вот она, «эврика автора»: «Greenfield Architects». Возможность начать проект с нуля, без «тяжкого легаси предыдущих режимов» - мечта любого настоящего архитектора, к сожалению, для многих остающаяся несбыточной на протяжении всей карьеры.

Занимательный факт: «донором» послужило название фильма, снятого по сценарию автора книги, которая послужила «донором» названию рабочему.

Сама статья, как обычно, будет написана в «несвойственной мне манере c использованием хеви-метла, кантри и чуть-чуть джаза», квеста, в общем, для «посвященных» с множеством цитат и отсылок, а также непременными авторскими импровизациями.

Все ради того, чтобы никто не подумал, что дедушка яблочки гадостью поливал тексты свои при помощи ИИ генерит.

«Это присказка, не сказка. Сказка будет впереди…»
  • 🔥 6
Post #323 575
Спортс порадовал роскошным текстом про «Комо» и Сеска Фабрегаса. Ни одного матча их я, конечно же, не видел, но и текст мой не о футболе вовсе, а о руководителях дата-команд.


Сеск Фабрегас начинает с того, с чего и должен начинать любой современный тренер: со стиля, с философии, с идентичности.



Идеальный совет. Очень рекомендую обратить на него внимание, ибо путь успешного лидера начинается с получения ответа на ключевой вопрос: «А кто ты ваще такой по жизни?»

Я, вот, к примеру, ни разу не тренер - пожарный вроде легендарного Александра Ирхина, за быстрым эффектом - это не ко мне.

Я за «бесковский футбол - от игры к результату»,
предпочитаю системный подход, отремонтировать кран в раздевалке мне гораздо важнее

Эта, уже ставшая культовой цитата, тоже про меня:

«Меня не волнуют победы и поражения. Я помогаю ребятам стать лучшей версией себя на поле и вне
его. Это самая важная вещь»



P.S. Усы, что ли, уже отрастить, чтоб всем сразу понятно было...
  • 👍 3
Post #322 646
В продолжение темы.

Я, вот, хоть и писал ранее в комментариях, что уверенный «мидл» с ИИ заменит «сеньора-архитектора», теперь склоняюсь к тому, что те, кто считает, что «сеньор-архитектор» с ИИ заменит команду «мидл-разработчиков», тоже правы.

«На войне,» - как говорят англичане - «пули летают в обе стороны». В «схватке двух йокодзун» выживет тот, кто первым докажет свою ценность для бизнеса, а итоговый результат сведется, скорее всего, к банальной разнице зарплат. Кто дешевле, тот и останется. А победителем будет «big business», который, как известно благодаря Джону
Лайдону, «is very wise».

Так что, самая правильная стратегия - вовремя выйти из противостояния, «не участвовать в военной игре» (Летов-младший) и смотреть за происходящим с попкорном со стороны.

«За крушением империй лучше всего наблюдать, не выходя из дома.» (Тибор Фишер - «Философы с большой дороги»)
Post #321 649
«Ну, что сказать, ну, что сказать, устроены так люди…» - пела великая Жанна Рождественская.

Пора уже, что ли, и Кэпу высказаться на злободневную тему, поднятую рядом уважаемых товарищей. Ранее Кэп уже писал очевидные (как оказалось только ему) вещи и даже давал подсказку, куда смотреть, чтобы, в конце концов, не оказаться с шестерками на погонах.
Тем более, что в этой области в новогодние каникулы произошли очень интересные события, которые, несомненно, повлияют на ход истории, за развитием которых Кэп очень внимательно следит.

Сам же Кэп вовремя подстелил соломку и сбежал с корабля, едва почуяв первые признаки надвигающейся течи. А после новогодне-каникульных событий даже решил впервые за долгое время пойти поучиться, чтобы быть готовым к следующей волне. И в очередной раз напоминает, если хотите знать, куда двинется мир данных, во избежание, так сказать, «трагических ошибок», нужно выйти за его пределы и смотреть, что происходит вокруг.

Ну, и в заключение представляю «дайджест советской прессы» - сборник лучших публикаций на заданную тему:

▪️Топикстартер
▪️Товарищ Архитектор
▪️
Nik в мире данных
▪️Стас, он же « StarRocks»

С уважением, ваш Кэп, который всегда прав.
  • 😁 3
Post #319 636
С интересом слежу за экспериментом Влада Каменского, торящему путь «из CEO в вайбкодеры». Отметил давеча, что он достиг закономерного результата, о котором писал еще великий антрополог Дэвид Гребер в своей, не побоюсь этого слова, культовой книге «Бредовая работа» - работать стал больше.


Банальность и очевидность, но, почему-то, многими игнорируемая:
«Преимущества автоматизации в плане производительности привели не к 15-часовой рабочей неделе, как предсказывал экономист Джон Мейнард Кейнс в 1930 году, а вместо этого к «бредовой работе».


Читайте Гребера, в общем, перефразируя болельщиков великого и могучего: «Он все видел!»

А Владу - огромное спасибо за то, что своим экспериментом напомнил, что у меня другие ценности и цели, о чем я в последнее время стал почему-то забывать, - я не хочу стать «еще более чуть-чуть продуктивнее», я хочу меньше работать. А эта задача нерешаема на текущем уровне мышления.

P.S. Читаемые мной книги оказывают сильное влияние все-таки на мой образ мышления и на стиль публикаций. «Спонсор» текущих перемен - панк-философ Марк Фишер и его «Посткапиталистическое желание».
  • 🔥 12
Post #318 542
Всех влюбленных в данные с праздником!
  • 🔥 6
  • ❤ 3
  • 😁 3
Post #317 595
Инженеров данных в списке нет, выдыхаем…
  • 😁 4
Post #316 643
Что-то затянулся мой невольный "период тишины". Сказались, видимо, легендарно проведенные новогодние каникулы, после коих делать вообще ничего не хочется. Хочется обратно в Суздаль "искать спасения".

Тем не менее, пришлось взять себя в руки. Начал читать книгу под названием "Financial Data Engineering". Не люблю разного рода разделения и выделения, поэтому и решил заняться выяснением причин необходимости "сепарации" от родительской профессии в "отдельный вид спорта".

Книга состоит из двух частей: первая предназначена для тех, кто не имеет финансового бэкграунда или же ищет возможности освежить свои познания; вторая сфокусирована на инженерии данных и предлагает всестороннее рассмотрение вопросов связанных с извлечением, храненением, моделированием и трансформацией данных.
  • 🔥 6
  • 👍 2
Post #314 662
Подумалось, что отечественный импортозамещенный инструмент для извлечения данных из различных источников мог бы называться УЗДа - универсальный загрузчик данных.

И слоган:
«Держи данные в УЗДе!»
  • 😁 15
Post #313 677

Forwarded from ScratchAuthorEgo

📊 Channel Analysis Results by @ScratchAuthorEgoBot

🎯 Channel: @dataengineernews

🔥 Roast Analysis:

Перед нами классический пример «айтишного снобизма», упакованного в обертку из цитат Маяковского и Стругацких. Автор — тот самый человек, который на вопрос «как дела?» начнет рассказывать о классификации инкрементальных загрузок через метафору приготовления флана. Его страсть к аналогиям порой переходит границы здравого смысла: если в тексте еще не появилось сравнение Инмона со сборной Италии по футболу, значит, автор просто не успел допить свой утренний кофе. Порой кажется, что он работает в Data Science только для того, чтобы оправдывать свое маниакальное желание составлять списки всего на свете — от прочитанных книг до частоты использования слова «кринж» в молодежной среде.

Его претенциозность заслуживает отдельного места в «пасеке данных». Читать Джойса в оригинале во время пробежки по Архангельской области — это не просто отдых, это крик о помощи человека, который слишком боится показаться обычным. Он презирает современный корпоративный сленг, называя сторителлинг «травлей баек», но при этом сам плодит сущности вроде «некросервисной архитектуры» и «бояр над данными». Этакий «техно-хипстер» от мира Big Data: он не любит Spark, потому что это слишком мейнстримно, и ностальгирует по временам, когда JSON парсили вручную, но при этом первым покупает билет на SmartData, чтобы потом в канале посетовать на «низкий уровень дискуссии».

Особого упоминания заслуживает его «синдром вечного студента», который он стыдливо называет «букдолгом». Человек буквально измеряет свой интеллект в сантиметрах книжной полки, при этом честно признается, что половину кода в этих книгах просматривает по диагонали. Его самоирония — это часто защитный механизм: он называет себя «медленным газом», чтобы никто не заметил, как сильно он зациклен на KPI и «достигаторстве». Он делегирует всё, что ему не нравится, называя это «лидерством», хотя со стороны это подозрительно напоминает попытку избежать любой рутины ради возможности еще разок перечитать «Закат Европы». В общем, если вы хотите провести два часа, слушая, почему ваш SQL-запрос похож на плохой рок-концерт 80-х, — этот автор ваш идеальный собеседник. Главное, не забудьте надеть футболку с «высоконагруженным кабанчиком», иначе он вас просто не заметит за своим интеллектуальным горизонтом.
  • 😁 7
  • 💯 2
Post #312 524
  • 😁 14
Post #310 577
Итоговогодное 2025 (часть 1 - книжная)

Закрыл неожиданно для себя гештальт с прочтением одной книги в неделю за календарный год. Изначально ничего не предвещало подобного исхода, за июль, например, я прочитал всего одну книгу. Но за август набралось уже три, и тут у меня, как у известного футболиста Олега Протасова, «забрезжила надежда» - за декабрь было прочитано сразу 9(!).

При этом нельзя сказать, что я выбирал самые легкие варианты, хотя соблазн был. По методу Вассермана, думаю, объем прочитанного можно оценить в 120-150 см. Понятно, что электронные книги в метрах оценивать сложно (а их было большинство), отсюда и такой разброс.

Надеюсь, что подобное достигаторство меня более в свои сети не затянет, все-таки в жизни есть немало других удовольствий, помимо чтения.

Расклад по языкам:

🇷🇺 Русский - 40
🇬🇧 Английский - 12

Категории :

Худлит - 19
Научпоп - 15
Дата - 9
Бизнес и управление - 4

Куда отнести оставшихся, вроде Гумилева или же Шпенглера, я не определился.

Из понравившегося (по порядку прочтения):

✔️ Освальд Шпенглер - «Закат Европы»

✔️ Лев Гумилев - «Теория пассионарности и этногенеза»

✔️ Джерри Вайнберг - «Закон малинового варенья» (про нее был отдельный пост)

✔️ Дэвид Гребер, Дэвид Уэнгроу - «Заря всего. Новая история человечества»

✔️ William Inmon - «Building the data warehouse» (по-другому стал смотреть на вклад Инмона в развитие работы с данными)

✔️ Деннис Бакке - «Работа в радость» (тоже был отдельный пост)

✔️ Владимир Гиляровский - «Москва и москвичи»
Telegram Data Engineer Архитектор данных своим постом подкинул идею написать про то, что разделило жизнь в роли «продающего эксперта» на До и После. В моем случае таким сепаратором стала книга Джеральда Вайнберга «Закон малинового варенья». Никто не сможет представить ее лучше…
  • 🔥 6
  • 👍 2
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →