TGViewer
Channel Public Channel
Инжиниринг Данных

Инжиниринг Данных

@rockyourdata

Делюсь новостями из мира аналитики и карьерными советами.

15 лет в Аналитике и Инжиниринге Данных, 10 лет в MAANG

🛠️ dataengineer.ru | 🏄‍♂️ Surfalytics.com

№5017813306

Реклама:
https://almond-rule-130.notion.site/1199f595f76a8030ba1be1e607c9a8ce
Subscribers
23.7K
Photos
2.3K
Videos
64
Links
3.4K
Recent Posts 16 shown
Post #6124 1.38K
В Surfalytics придумал новую полезную фичу - mock собеседование system design перед реальным собеседованием. На вход у меня есть описание вакансии и вместе с ИИ я составлю примерную архитектуру и решения, которые использует компания и дальше уже провожу собеседование, которое максимально приближено к кейсам компании (к кейсам описания вакансии)

Провели про AWS System Design, где подсветили несколько советов и решений.

https://youtu.be/2gTo-mdTBQw?si=xG_2Qhy_th-IxwsO
YouTube AWS data engineering system design mock interview | Surfalytics Nikita (data engineer) designs an analytics platform on AWS from scratch for a SaaS company with three RDS Postgres databases (2 TB / 800 tables), API sources (Stripe, QuickBooks, Zendesk, HubSpot), and 20-60M mobile events per day. Requirements: hourly freshness…
  • ❤‍🔥 28
  • ⚡ 2
  • 🫡 1
Post #6123 2.13K
Как сегодня строят рекомендательные системы — и что будет с ними завтра?

30 сентября собираем RecSys-сообщество — разработчиков, ML/DS-специалистов и всех, кто делает персонализацию и рекомендации в реальных продуктах.

В программе — доклады от экспертов Сбера. Поговорим о свежих подходах и нестандартных решениях на реальных кейсах.

А после докладов переключаемся на неформальный режим: знакомимся, спорим про RecSys, обсуждаем идеи, находим единомышленников и просто хорошо проводим вечер среди своих.

📍г. Нижний Новгород, пространство «Гараж»

Количество мест ограничено — успей забрать своё по ссылке!
Post #6122 2.5K
На выходных Сергей провел воркшоп про развертывание Metabase BI на AWS ECS. Он все сделал полностью в ручную. Ни один токен AI не был потрачен.

Вообще ECS это главный контейнер сервис для хостинга любых Open Source решений для BI, ETL, ML, Streaming. Есть много альтернатив, о чем важно знать, но знать ECS/ECR must have.

https://youtu.be/guMdPaIqp3U

PS В след раз мы посмотрим на Airflow 3.1 на ECS.
YouTube Deploy Metabase on AWS: ECS Fargate, RDS Postgres, and an Application Load Balancer | Workshop In this FREE Surfalytics workshop, Sergey deploys Metabase on AWS from scratch: ECS with Fargate for the container, RDS Postgres for persistent configuration, an Application Load Balancer as the public entry point, and security groups that build a tunnel…
  • ⚡ 23
  • ❤‍🔥 6
Post #6121 3.2K
У нас все готово, если вы вдруг решили зайти к нам на meetup
  • ❤‍🔥 19
  • 🍌 6
  • ⚡ 2
  • 💯 1
Post #6120 3.99K
Я всегда рад, когда люди находят работы и прокачиваются. Но рад в тройне, когда попадают в Клуб 500 🤑
  • ❤‍🔥 46
  • 🫡 8
  • ⚡ 3
  • 🌚 3
  • 👨‍💻 1
  • 🙈 1
Post #6119 4.13K
Data Driven 2026: аналитика встречается с AI-инфраструктурой

26 сентября Яндекс отмечает десятую, юбилейную Data Driven — и в этот раз конференция заходит на нашу территорию: AI-ready-данные, инфраструктура под агентов и главный вопрос сезона — а можно ли вообще доверять тому, что насчитал AI-агент?

Кого слушать:
Роман Халкечев (CDO Поисковых сервисов и ИИ Яндекса) — расскажет о том, как AI переписывает правила игры при работе с данными, меняет способ принятия решений в компании и трансформирует профессии аналитика и дата инженера;

Олег Хомюк (CDO Яндекс Поиска) — как объективно измерить качество AI-агентов и инфраструктуры AI-ready-данных;

Артём Солоухин (зам. руководителя ML и инновационных инструментов Центральной аналитики) — покажет MARS, первую мультиагентную рабочую среду в Яндексе;

Максим Стаценко (руководитель BigData Tech & Research Центральной аналитики) — расскажет, как собрать агента-аналитика, которому реально можно доверять.

Плюс дискуссии, стенды с экспертами, нетворкинг и афтерпати в честь 10-летия — будет шумно.

📍Москва + онлайн, 26 сентября. Мест офлайн ограниченное количество

Регистрируйтесь по ссылке: https://events.yandex.ru/events/data-driven-2026

Новости конференции: t.me/Data_Driven_Yandex
Data Driven 2026 Поговорим про AI-first аналитику, data-driven подход и о том, как изменится роль аналитика в ближайшие годы.
  • ⚡ 4
  • ❤‍🔥 3
Post #6118 3.34K
Сегодня последний день регистрации на КосмоХакатон

18–20 сентября, Петербург, Красноярск или онлайн из любой точки страны. Четыре задачи на выбор: снабжение орбитального топливного узла и безопасность космонавта в открытом космосе в Петербурге (фонд 1,2 млн ₽), мониторинг лесных пожаров и верификация углеродных кредитов по спутниковым снимкам в Красноярске (600 тыс. ₽). Есть и для тех, кто про данные и ML, и для тех, кто про стратегию и экономику.

Лучшие забирают приз на площадке и билет в московский финал 25–27 сентября, где разыграют ещё 2,4 млн рублей.

Команду можно собрать на платформе.

Подробности и регистрация
  • ⚡ 1
Post #6116 3.28K
Свежий документ для подготовки к собеседования на позицию Sr Data Engineer из одной большой американской компании

Этап 1 — Скрининг с нанимающим менеджером

Продолжительность: 45 минут
Разговорное интервью с нанимающим менеджером.
Что оценивается:
• Общее понимание роли и команды
• Соответствие навыков требованиям позиции
• Понимание стратегических целей должности
• Уровень экспертизы относительно ожиданий по грейду
• Знакомство с технологическим стеком из описания вакансии

Этап 2 — Техническое интервью (Python / SQL)

Продолжительность: 60 минут (30 мин Python + 30 мин SQL)
Живое практическое кодирование в CoderPad, чистый Python без библиотек и фреймворков.
Что оценивается:
• Знание базовых структур данных — list, dict, set
• Умение программно парсить данные
• Умение писать алгоритмы с использованием базовых конструкций — циклы for/while
• Решение задач умеренного уровня сложности
• Владение SQL (вторая половина сессии)
Важные замечания:
• Можно задавать уточняющие вопросы по задаче — только по Python
• Нельзя копировать условие задачи в AI
• Любое использование AI-инструментов в процессе должно быть раскрыто

Этап 3 — Панельные интервью

Четыре части с разными командами.
Этап 3а — Панель: Взаимодействие с командой Data Science
Продолжительность: 30 минут
Обсуждение проектов с командой Data Science.
Что оценивается:
• Опыт в экспериментировании и моделировании
• Умение совместно с DS-командой решать бизнес-задачи
• Глубина обоснования выбора подходов к моделированию и экспериментам

Этап 3б — Панель: Взаимодействие с DE / ML Platform
Продолжительность: 30 минут
Совместное упражнение с командой Data Engineering, которая управляет репозиторием ML-фичей.
Что оценивается:
• Умение глубоко погружаться в техническую задачу
• Перевод требований продукта и DS в проектирование масштабируемого ML-пайплайна
• Кросс-функциональное взаимодействие со стейкхолдерами DE/ML Platform

Этап 3в — Панель: Компетенции в Data Engineering
Продолжительность: 45 минут
Глубокое техническое погружение в экспертизу, доставку и исполнение — от требований до результата.
Что оценивается:
• Экспертный уровень SQL и dbt
• Опыт с современными технологиями пайплайнов — открытые табличные форматы (Iceberg, Delta, Hudi) и распределённые SQL-хранилища (Databricks SQL Warehouse, Snowflake, BigQuery, Redshift)
• Проектирование пайплайнов по схеме Bronze → Silver → Gold
• Опыт в моделировании данных
• Практики обеспечения качества данных
• Тестирование
• Управление данными (Data Governance)
• Оркестрация
• Опыт с AI / LLM для ускорения рабочих процессов разработки
• Умение выбирать правильный инструмент под задачу
• Работа с большими объёмами данных (например, Kafka → DynamoDB)
• Сквозное владение процессом — от требований до поставки

Этап 3г — Панель: Взаимодействие с командой ACE
Продолжительность: 30 минут
Совместное упражнение с командой ACE.
Что оценивается:
• Сбор требований и понимание доменных потребностей
• Управление и поддержка кода
• Обеспечение поддерживаемости и удобства использования
• Ответственность и решение проблем
• Работа с AI / LLM
  • 🐳 24
  • ❤‍🔥 7
Post #6115 3.44K
Пока мы тут про AI пишем, в большинстве традиционных бизнесов ничего не поменялось.

Классическая рубрика про ошибку в Excel. У нас в провинции Британской Колумбии отчитались об ошибке на 1,5 ярда $ из-за ошибки в Excel.


Ключевые детали происшествия:

Причины (4 ошибки в расчетах):

• Основная ошибка: Формулу конвертации валют из долларов США в канадские доллары случайно применили к ячейкам таблицы, которые уже содержали суммы в канадских долларах (ошибка при перетягивании формулы в Excel).

• Некорректный пересчет объемов природного газа.

• Использование расходных данных за 2025 год вместо 2026 года в одном из блоков.

• Аналогичное использование устаревших данных за 2025 год в другом блоке.


Последствия: Прогнозируемый дефицит провинции (13,3 млрд долларов) вырастет после корректировки. В министерстве заявили о внедрении новых мер контроля качества расчетов, чтобы избежать подобных ошибок в будущем.


Я бы им Shift Left порекомендовал бы
🔫😊🔫
  • 🙉 29
  • 🙈 19
  • 😭 5
  • 🫡 4
  • ❤‍🔥 1
  • 🐳 1
  • 🤷 1
Post #6114 3.31K

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • 👨‍💻 28
  • 🐳 10
  • ⚡ 7
  • 🌚 7
  • ❤‍🔥 4
Post #6112 3.78K
Как-то незаметно прошла новость, что SAP купил Dremio.


Зачем купили: SAP строит платформу AI-агентов, которым нужен доступ к данным из любых источников — как SAP, так и сторонних систем. Dremio решает именно это: позволяет запрашивать данные где угодно без ETL и копирования. Плюс

Dremio вписывается в более широкую стратегию — вместе с Reltio (очистка данных) и Prior Labs (AI-модели) SAP собирает полный data+AI стек.
Что такое Dremio: Высокопроизводительная lakehouse-платформа. Главные фишки — федеративные запросы к любым источникам без перемещения данных, нативная поддержка Apache Iceberg и автоматическое ускорение запросов (Reflections). Известна ещё тем, что co-создала Apache Arrow и Apache Polaris — оба стали индустриальными стандартами.


Не уверен, что Dremio ждет хорошее будущее. Когда-то BusinessObjects был лучшим BI инструментом, пока в 2007 году его не купил SAP.

Из других покупок:
• Sybase в 2010 году - одно из первых поколоночных хранилищ
• Altiscale в 2016 году - решения для Hadoop/BigData


В Ванкувере есть офис SAP, я даже видел вакансии раньше по data к ним.

Вообще к SAP у меня теплые воспоминания:

1. Я учил английский и SQL используя SAP BO и тренинги
2. В 2011 году я почти получил офер в Ирландию, но в целом понял, что западные технологии дают возможность работать по всему миру
3. Еще работая на первой работе в банке я провернул концепт fake it till you make it и несколько человек зашли в ИТ на позицию BI разработчик по SAP BO без ИТ опыта.
4. В ламоде наверно до сих пор есть видео про SAP BO, первая BI академия. Даже есть на YouTube - Lesson 1 Introduction into SAP BO Web Intelligence
5. Я почти перешел в офис SAP в Москве на позицию pre-sale/sale engineer. Главный мотиватор был, что они давали Audi A4 своим консультантам + поездки в Европу на тренинги.
6. Мне казалось, что SAP BW консультанты получали какие космические деньги на проектах - от 25т рублей в день через ИП, и это было в 2012 году!

У вас есть теплые воспоминания?
  • 🐳 1
Post #6111 3.72K
19 сентября в 2:30 pm в Ванкувере решили собраться на Jericho beach, приходите кто хочет. С меня самовар:)
  • ❤‍🔥 4
  • 🤷 4
  • 😭 3
  • ⚡ 2
  • 💯 1
Post #6110 4.22K
Как знакомо, когда организации хотят заставить всех vibe кодить свои приложения, чтобы выпилить вендора, и рассказать как они урезают косты.

Получается такая гремучая смесь tech debt и черной дыры для сжигания токенов.

Особенно, когда финансы, продажи, маркетинг сами себе создают приложения.

Я уже испытал такой подход в одной большой компании. Не проникся.

А как у вас?
  • ❤‍🔥 16
  • 🙊 12
Post #6101 4.13K
Главная ошибка в разговоре об ИИ-агентах — оценивать их по демо. Демо почти всегда выглядит круто, но в проде все упирается в границы ответственности, данных и безопасности.


Коллеги из Cloud․ru поделились популярными мифами об ИИ-агентах и обозначили реальные границы их возможностей — читайте в карточках.

📌 Еще больше интересного контента про ИИ и технологии ребята из Cloud․ru публикуют в своем канале — подписаться
  • 😭 8
  • 👨‍💻 6
Older posts →

About this channel

How can I read @rockyourdata without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Инжиниринг Данных: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Инжиниринг Данных have?
Инжиниринг Данных (@rockyourdata) has 23.7K subscribers on Telegram, refreshed roughly every 30 minutes.
Does Инжиниринг Данных know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →