TGViewer
Channel Public Channel
Data Engineer Работа Вакансии

Data Engineer Работа Вакансии

@de_rabota

Вакансии Data Engineer


Размещение вакансий и рекламы - @hr_rus
Стоимость размещения - t.me/it_rab/11

Каналы вакансий других IT профессий - @it_rab
Subscribers
4.95K
Photos
31
Videos
18
Links
854

Showing posts older than #1370 · Back to latest

Older Posts 20 shown
Post #1368 1.79K
#middle #гибрид #москва

Cloud.ru
Data Engineer
Опыт работы: от 3 до 6 лет
Формат работы: гибрид (Москва)

Cloud.ru — ИТ-компания в сфере облачных и ИИ-технологий. Направление кибербезопасности, команда проектирует и развивает data-пайплайны для обработки событий кибербезопасности.

☑️ Чем предстоит заниматься
-Проектирование и развитие data-пайплайнов для обработки событий кибербезопасности
-Нормализация и обогащение событий безопасности
-Проектирование и оптимизация аналитического хранилища данных (ClickHouse / StarRocks / аналоги)
-Подготовка витрин данных под быстрые запросы и аналитику
-Эксплуатация data сервисов в Kubernetes: деплой, ресурсы, отказоустойчивость, масштабирование

☑️ Наши пожелания к кандидатам
-Опыт построения с нуля DWH или Data lake
-Опыт построения и эксплуатации data pipelines (ETL, ELT и/или streaming) в production среде
-Уверенный SQL, включая оптимизацию запросов и анализ производительности
-Опыт работы с OLAP-СУБД (ClickHouse/StarRocks/Druid/Pinot или аналоги)
-Уверенные знания Kubernetes и опыт эксплуатации сервисов в production среде

Контакты: hr@cloud.ru / Telegram-канал @cloudruprovider

🔥 Подписаться на наши каналы / @best_itjob / @it_rab
  • 🤔 7
Post #1367 1.77K
#middle #офис

X5 Tech
Data Engineer (Python + Spark)
Формат работы: офис (Москва)

В команде разрабатывается ML-система, детектирующая Out-of-stock ситуации и аномалии в продажах, которая в near-real-time выявляет потенциальные проблемы с наличием товара и отправляет предупреждения сотрудникам магазинов.

☑️ Чем предстоит заниматься
-Разрабатывать и оптимизировать Spark-пайплайны для обработки данных в масштабе (200+ млн строк ежедневно)
-Настраивать хранение и доступность данных в DWH
-Автоматизировать интеграцию данных: продажи, акции, цены, остатки, погода, календари
-Работать в связке с Data Science-командой, обеспечивая стабильный и качественный поток данных для моделей
-Участвовать в развитии платформы прогнозирования спроса

☑️ Наши пожелания к кандидатам
-Стек: PySpark 2/3, Spark SQL
-Hadoop / Hive / Trino / S3 / ClickHouse / Postgres / Greenplum
-Airflow, Python3, Docker, YARN/k8s, pytest

Откликнуться

🔥 Подписаться на наши каналы / @best_itjob / @it_rab
  • 🤔 4
  • ❤ 1
Post #1365 2.37K
#intern #гибрид #краснодар

MAGNIT TECH
Стажёр-разработчик DWH
Стажировка «уровень ПРО», 10 месяцев, старт сентябрь 2026
Формат работы: Москва (гибрид/офис)

MAGNIT TECH — крупная аккредитованная ИТ-компания, технологическое ядро розничной сети «Магнит». Оплачиваемая программа для студентов и выпускников, которые хотят решать реальные задачи ритейла и строить карьеру в компании. Возможен переход в штат по итогам программы.

☑️ Кому подойдёт
-Студент 3+ курса бакалавриата, специалитета или магистратуры по ИТ-направлению
-Уже проходил стажировку или работал над проектами
-Есть сильные pet-проекты или опыт участия в хакатонах
-Готовность уделять стажировке от 20 часов в неделю

Условия: официальное оформление, договор, зарплата, менторство от экспертов компании, доступ к образовательным программам.

Контакты: studentprogram@magnit.ru / Telegram-канал @magnittech

🔥 Подписаться на наши каналы / @best_itjob / @it_rab
Post #1363 2.54K
#senior #офис #москва #спб #нн

CINIMEX
Data Engineer
Опыт работы: глубокий экспертный опыт с Apache Spark от 4-5 лет
Формат работы: офис/гибрид (Москва, Нижний Новгород, Санкт-Петербург)

CINIMEX — IT-компания с 29-летней историей, разработчик ПО и системный интегратор. Работает с российскими банками ТОП-20, ритейлерами, производственными и добывающими компаниями.

☑️ Чем предстоит заниматься
-Разработка ETL-пайплайнов (Apache Spark on Java, HDFS (parquets), ClickHouse, Hive, Greenplum)
-Разработка витрин данных в Greenplum и ClickHouse
-Оркестрация ETL-процессов
-Оптимизация ETL-процессов (батчинг, ретраи, SLA-контроль)
-Взаимодействие с BI-разработчиками и DevOps для своевременной доставки данных в Superset

☑️ Наши пожелания к кандидатам
-Глубокий экспертный опыт работы с Apache Spark от 4-5 лет (оптимизация джобов, работа с широкими и узкими зависимостями, настройка памяти и shuffle-операций)
-Опыт работы с ClickHouse и Hadoop (HDFS, Hive)
-Опыт проектирования и разработки потоков данных, алгоритмов загрузки и обработки данных
-Продвинутые знания SQL
-Готовность осваивать Java для использования Spark

Откликнуться

🔥 Подписаться на наши каналы / @best_itjob / @it_rab
Post #1361 2.22K
#senior #офис #москва

Bell Integrator
MLOps Engineer/Solution Architect
Опыт работы: от 3-4 лет
Формат работы: гибрид (Москва, Вавилова 19)

Ищем талантливого MLOps Engineer/Solution Architect для проектирования и разработки интеграционных решений в крупный банк РФ. Команда отвечает за AI-инициативы бизнеса в сфере глобальных рынков, решает Data Science задачи с применением ML/DL алгоритмов — от бустинга и ансамблей моделей до больших языковых моделей (LLM).

☑️ Чем предстоит заниматься
-Совместно с Data Scientist и Product Owner выявлять требования в архитектурных / интеграционных решениях для разрабатываемых приложений
-Декомпозировать и документировать требования
-Совместно с корпоративными архитекторами, экспертами кибербезопасности и командой сопровождения выбирать технические компоненты и проектировать интеграционные решения
-Разрабатывать интеграционные решения и шаблоны кода для масштабирования и стандартизации процесса разработки и вывода в продакшн
-Проектировать и развивать концептуальную архитектуру платформы и инфраструктуры приложений

☑️ Наши пожелания к кандидатам
-Опыт работы от 3-4 лет, опыт промышленной разработки на Python
-Опыт работы с популярными РСУБД (Greenplum, Teradata, Oracle, PostgreSQL)
-Опыт интеграции продуктов экосистемы Hadoop (HDFS, Hive, Spark)
-Опыт синхронной, асинхронной интеграции сервисов и брокеров сообщений (Kafka, RabbitMQ)
-Опыт проектирования CI/CD решений на базе Jenkins и Bitbucket/Git

Контакты: hr@bellintegrator.ru / Telegram @bellintegrator_career

🔥 Подписаться на наши каналы / @best_itjob / @it_rab
  • ❤ 2
  • 🤔 2
Post #1360 2.29K
Data Engineer в Корпоративное хранилище
#удаленка
Компания: Wildberries

🔹Что нужно делать
-Обеспечивать стабильную, производительную и безопасную работу Data Platfrorm на базе Trino, Spark, S3 и Apache Iceberg, включая администрирование и управление ролевой моделью доступа, документирование изменений в проекте
-Настраивать, обновлять, мониторить и тюнить кластера Trino
-Настраивать коннекторы (Iceberg, S3)
-Оптимизировать производительность запросов (resource groups, query analysis)
-Оптимизировать производительность Iceberg (partitioning, clustering, metadata management)
-Разрабатывать и внедрять централизованные ролевые модели для доступа к данным и ресурсам платформы

🔹Какой опыт и знания нужны
-Обладаете пониманием взаимодействия Spark с Iceberg и S3
-Имеете опыт эксплуатации Apache Iceberg (администрирование таблиц в формате Iceberg, настройка и использование Hive Metastore)
-Обладаете пониманием и применением: compaction, expiration snapshots, time travel, schema evolution
-Имеете навыки Linux, Bash, Python для автоматизации
-Обладаете опытом управления политиками доступа и правами доступа через Ranger в S3 и Iceberg
-Имеете опыт разработки и внедрения централизованной ролевой модели для доступа к данным и ресурсам платформы
-Иметь опыт администрирования Greenplum или ClickHouse (установка, настройка, оптимизация, интеграция с S3/Iceberg).

Откликнуться

Python Job в Telegram | в VK | в Max
  • 🔥 2
  • 🤔 1
Post #1358 2.56K
Дата- инженер
#удаленка
Компания: Альфа-Банк

🔹Чем предстоит заниматься
зСопровождение и анализ существующих процессов загрузки данных ETL
-Мониторинг процессов загрузки и выявление аномалий
-Приемка миграции существующих процессов загрузки с Oracle на Greenplum
-Тестирование и установка доработок в продуктивный контур
-Разбор обращений пользователей в рамках компетенций второй линии поддержки
-Проверка технической документации

🔹Наши пожелания к кандидатам
-Оконченное высшее образование
-Опыт работы от 2х лет
-Языки программирования: SQL
-Технологический стек: Oracle, Greenplum, Apache Spark, ApacheAirflow, Kafka
-Навыки работы с: Jira + Confluence или аналогичное, Git, CI/CD, XML, JSON
-Навыки системного анализа, тестирования

Откликнуться

IT Jobs в Telegram | в VK | в Max
  • ❤ 3
  • 🤔 1
Post #1357 1.77K
Data-инженер в команду SQL-SWAT
#удаленка
Компания: Авито

☑️Какие задачи вас ждут:
-разрабатывать сервисы, CLI-инструменты и LLM-инструменты для ускорения и упрощения процесса миграции;
-самостоятельно мигрировать объекты с помощью созданных инструментов:
-транслировать код;
-верифицировать данные;
-переносить историю;
-переключать зависимости;
-обучать и поддерживать пользователей при работе с селф-сервис-инструментами автоматизированной миграции;
-в рамках регулярных дежурств поддерживать пользователей в чатах и консультировать по вопросам работы с витринами данных;
-мигрировать сложные и критичные витрины данных на новую платформу с сохранением производительности и соблюдением SLA;
-улучшать существующие инструменты с применением современных технологий, например AI-элементов для ускорения процессов;
-взаимодействовать с владельцами витрин из аналитических команд, согласовывать допустимые расхождения в данных и необходимые изменения бизнес-логики.

☑️Примеры будущих задач:
-доработать сервис трансляции SQL-кода, чтобы ускорить трансляцию на 20%;
-создать LLM-инструменты для верификации данных во время миграции на локальной машине пользователя;
-мигрировать сложные MERGE REFRESH-витрины с учётом специфики Trino и деградацией времени ежедневного расчёта не более чем на 10%;
-оптимизировать витрины на Trino, чтобы снизить потребление вычислительных ресурсов на 20%;
-ответить на вопрос пользователя в чате, например о том, почему витрина не проходит тесты на производительность.

Откликнуться

🔥 Подписаться на наши каналы / @best_itjob / @it_rab
  • 🔥 1
Post #1356 2.33K
Стажер Data Engineer в Аналитика Datagovernance [Big Data, МТС Веб Сервисы]
#гибрид #intern
Москва
Компания: МТС

🔹Чем предстоит заниматься
-Разрабатывать ETL-процедуры для сервисов datagov с использованием python, pyspark, hadoop, airflow;
-Собирать данные из разных реляционных и нереляционных источников;
-Создавать наполнять витрины в hive/postgres/clickhouse/greenplum

🔹Что мы ожидаем
-Студенты 3 - 6 курсов бакалавриата, специалитета или магистратуры;
-Хорошее знание Python;
-Уверенное знание SQL и умение работать с реляционной СУБД
-Будет плюсом: опыт использования с фреймворками обработки данных типа pandas/polars/spark и подобными

Откликнуться

IT Jobs в Telegram | в VK | в Max
Post #1354 2.57K
Data Engineer
#удаленка #senior
Компания: BGStaff

☑️Ключевые задачи
-Проектирование, разработка и сопровождение ETL/ELT-пайплайнов с использованием Snowflake и SQL
-Управление облачной инфраструктурой на AWS (S3, Glue, Lambda, CloudWatch, IAM)
-Написание чистого и поддерживаемого кода на Python
-Автоматизация развертывания и настройки инфраструктуры через Terraform
-Оркестрация рабочих процессов с помощью Apache Airflow
-Мониторинг и устранение неполадок в пайплайнах, контроль качества данных и производительности систем
-Совместная работа с дата-сайентистами, аналитиками и разработчиками для создания масштабируемых решений

☑️Обязательные требования
-5+ лет коммерческого опыта в Data Engineering или смежных областях
-Глубокие знания Snowflake и продвинутый уровень владения SQL
-Реальный опыт работы с AWS (S3, Glue, Lambda, CloudWatch, IAM)
-Уверенное владение Python для обработки данных и автоматизации
-Практический опыт использования Terraform (инфраструктура как код)
-Опыт работы с Apache Airflow для оркестрации пайплайнов
-Отличные коммуникативные навыки и английский язык уровня C1
-Способность работать самостоятельно в распределённой команде

☑️Будет плюсом
-Опыт интеграции и разработки REST API
-Знание CircleCI или других CI/CD-инструментов
-Опыт работы в полностью удалённых международных командах
-Понимание принципов управления данными и безопасности
Локация: Удалённо (предпочтительно за пределами РФ и РБ, желательно страны Латинской Америки или Канада)
График работы: по восточному времени США (EST) до 17:00, с привязкой к американскому рабочему календарю.
Уровень английского языка: C1 (продвинутый профессиональный)

Контакты: promo@bgstaff.ru

Python Job в Telegram | в VK | в Max
  • ❤ 4
Post #1353 2.32K
Data Engineer
#гибрид
Москва
Компания: Облако.ру

🔹ОБЯЗАННОСТИ
-Проектирование и развитие data-пайплайнов для обработки событий кибербезопасности;
-Нормализация и обогащение событий безопасности;
-Проектирование и оптимизация аналитического хранилища данных (ClickHouse / StarRocks / аналоги);
-Подготовка витрин данных под быстрые запросы и аналитику;
-Эксплуатация data сервисов в Kubernetes: деплой, ресурсы, отказоустойчивость, масштабирование;
-Обеспечение наблюдаемости и качества данных (метрики, алерты, replay/backfill);
-Участие в разборе инцидентов и оптимизации производительности data платформы. 

🔹ТРЕБОВАНИЯ
-Опыт построения с нуля DWH или Data lake.
-Опыт построения и эксплуатации data pipelines (ETL, ELT и/или streaming) в production среде;
-Уверенный SQL, включая оптимизацию запросов и анализ производительности;
-Опыт работы с OLAP-СУБД (ClickHouse/StarRocks/Druid/Pinot или аналоги);
-Понимание принципов потоковой обработки данных (идемпотентность, дедупликация, обработка ошибок);
-Опыт проектирования и оптимизации витрин и схем хранения данных;
-Уверенные знания Kubernetes и опыт эксплуатации сервисов в production среде;
-Понимание принципов надежности, масштабирования и наблюдаемости data систем.

Откликнуться

🔥 Подписаться на наши каналы / @best_itjob / @it_rab
Post #1351 2.03K
Data Engineer в команду SMT
#удаленка
Компания: 2ГИС

🔹Что предстоит делать
-Разрабатывать с нуля MVP новой дата‑платформы и инфраструктуры для ingest/transform.
-Мигрировать существующие пайплайны с Hadoop/HDFS на новую архитектуру (S3, Kafka, Spark, ClickHouse).
-Работать с большими объёмами данных и высоконагруженными Kafka‑топиками.
-Строить отказоустойчивые пайплайны обработки и доставки данных.
-Участвовать в архитектурных решениях, внедрять best practices хранения, мониторинга и качества данных.
-Проектировать витрины данных под продуктовую и управленческую аналитику (OLAP).
-Сопровождать миграцию BI‑отчётов на новую платформу (например, DataLens, Power BI).

Откликнуться

🔥 Подписаться на наши каналы / @best_itjob / @it_rab
  • ❤ 1
Post #1350 1.9K
Data Engineer, Подготовка офлайн-факторов ранжирования
#удаленка #middle
Компания: OZON

☑️Примеры задач
-Подготовка витрин и датасетов для команд, аналитики, DS и ML.
-Оптимизация Spark-задач, SQL-запросов и процессов поставки данных. Настройка регулярных процессов подготовки витрин данных и контроль их качества.
-Разбор инцидентов в процессах подготовки витрин и повышение их надежности.

☑️Нам важно
-Опыт разработки пайплайнов обработки данных от 2х лет.
-Уверенное владение Python и SQL.
-Опыт работы с PySpark/Spark или готовность быстро погрузиться.
-Опыт работы с Airflow или другими системами оркестрации обработки данных. Умение разбираться в существующем коде и улучшать его качество. Внимательность к надежности, производительности и мониторингу.

Откликнуться

IT Jobs в Telegram | в VK | в Max
  • ❤ 1
Post #1349 2.38K
Data Engineer
#удаленка
Компания: Авиасейлс

🔹Что нужно делать
-активно участвовать в командном чате: отслеживать запросы, оперативно реагировать на вопросы и задачи в рабочее время;
-мониторить системы и решать возникающие инциденты вместе с дежурными дата инженерами;
-оптимизировать текущие процессы обработки данных;
-модернизировать текущую дата платформу вместе с Core командой дата инженеров.

🔹Чего ждём от тебя
-опыт работы инженером данных от 1 года;
-знание языков программирования: Python/SQL (обязательно), опыт работы с другими языками будет плюсом.
-понимание принципов ETL/ELT процессов и опыт работы с инструментами
-понимание как работают распределенные вычисления
-опыт работы в нашем стеке Apache Spark, Apache Airflow, DBT, Trino будет плюсом;
-самостоятельность и ответственность, умение коммуницировать с разными командами и людьми
желание развиваться и выстраивать процессы вокруг себя.

Откликнуться

🔥 Подписаться на наши каналы / @best_itjob / @it_rab
  • ❤ 4
Post #1348 2.24K
Data Engineer в Корпоративное хранилище
#удаленка
Компания: Wildberries

🔹Что нужно делать
-Обеспечивать стабильную, производительную и безопасную работу Data Platfrorm на базе Trino, Spark, S3 и Apache Iceberg, включая администрирование и управление ролевой моделью доступа, документирование изменений в проекте
-Настраивать, обновлять, мониторить и тюнить кластера Trino
-Настраивать коннекторы (Iceberg, S3)
-Оптимизировать производительность запросов (resource groups, query analysis)
-Оптимизировать производительность Iceberg (partitioning, clustering, metadata management)
-Разрабатывать и внедрять централизованные ролевые модели для доступа к данным и ресурсам платформы

🔹Какой опыт и знания нужны
-Обладаете пониманием взаимодействия Spark с Iceberg и S3
-Имеете опыт эксплуатации Apache Iceberg (администрирование таблиц в формате Iceberg, настройка и использование Hive Metastore)
-Обладаете пониманием и применением: compaction, expiration snapshots, time travel, schema evolution
-Имеете навыки Linux, Bash, Python для автоматизации
-Обладаете опытом управления политиками доступа и правами доступа через Ranger в S3 и Iceberg
-Имеете опыт разработки и внедрения централизованной ролевой модели для доступа к данным и ресурсам платформы
-Иметь опыт администрирования Greenplum или ClickHouse (установка, настройка, оптимизация, интеграция с S3/Iceberg).

Откликнуться

Python Job в Telegram | в VK | в Max
  • 🤔 8
  • 🔥 4
  • ❤ 3
Post #1346 2.1K
🚀 Вакансия: Data Engineer (удаленно/гибрид)
Компания: ООО "ОДСС" https://odsscompany.ru (аккредитованная IT-компания)
Локация Москва
Зрплата от 150 до 170 т.р.
Оформление по ТК РФ

Мы ищем в свою команду инициативного Data Engineer для разработки и поддержания инфраструктуры данных для большого проекта озера данных, включающего себя сложные сценарии приема и обработки данных из разных источников.

Что предстоит:
• разработка и поддержание парсеров
• автоматизация обработки и преобразования данных
• отладка и мониторинг конвейеров данных

Технологический стек: Python, PostgreSQL, Dagster, Selenium

Что мы ждем от тебя:
- знание основных библиотек Python для работы с данными
- опыт обработки и скрейпинга/парсинга сложных и слабоструктурированных документов в форматах pdf, doc, docx, xls, xlsx
- опыт работы автоматизации конвейеров данных и знание соответствующих программных инструментов
- представление об управлении качеством данных
- представление о возможностях отладки мониторинга
- понимание специфики форматов данных (JSON lines, Parquet, XML, CSV и тд.)
- понимание методов получения и поставки данных (как, например, S3, REST API, SOAP, RPC)
- знание английского языка на уровне, достаточном для чтения технической документации
- знание Git
- готовность осваивать новые технологии и разрабатывать индивидуальные технические решения под поставленные задачи.

Плюсами будут:
- опыт работы с данными из открытых источников и понимание их специфики
- опыт долгосрочного поддержания работы парсеров
- опыт работы с библиотеками Python для computer vision

Преимущества проекта
✅ Проект только стартовал — мало легаси, много свободы для экспериментов
✅ Можно влиять на выбор технологий и архитектурных решений

Для быстрой связи @LvovaOV
  • 🤔 13
  • ❤ 2
Post #1345 2.01K
Data Engineer
#офис #гибрид #senior
Компания: CINIMEX

☑️Задачи:
-Разработка ETL-пайплайнов (Apache Spark on java, HDFS (parquets), ClickHouse, Hive, Greenplum);
-Разработка витрин данных в Greenplum и ClickHouse;
-Оркестрация ETL-процессов;
-Оптимизация ETL-процессов (батчинг, ретраи, SLA-контроль);
-Взаимодействие с BI-разработчиками и DevOps для своевременной доставки данных в Superset.

☑️Ожидаем от Вас:
-Глубокий экспертный опыт работы с Apache Spark от 4-5 лет (оптимизация джобов, работа с широкими и узкими зависимостями, настройка памяти и shuffle-операций);
-Опыт работы с ClickHouse;
-Опыт работы с Hadoop (HDFS, Hive);
-Опыт проектирования и разработки потоков данных, алгоритмов загрузки и обработки данных;
-Опыт оптимизации ETL-пайплайнов и SQL кода;
-Продвинутые знания SQL;
-Готовность осваивать Java для использования Spark.

☑️Мы предлагаем:
-Работу в аккредитованной IT-компании;
-Формат работы: офис/гибрид (г. Москва/Нижний Новгород/Санкт-Петербург);
-Гибкое начало рабочего дня: с 08:00 до 11:00 (по МСК);
-ДМС со стоматологией, телемедициной и полисом ВЗР;
-Возможность взять больничный без больничного: 7 дней в году;
-Поэтапную адаптацию от hr и линейного руководителя;
-Ревью и развитие: оцениваем результаты, обсуждаем карьерные цели и выстраиваем индивидуальный план развития;
-IT-конференции, курсы, тренинги и сертификации за счет компании;
-Корпоративный английский;
-Развитие личного бренда: готовим спикеров к выступлениям на конференциях, помогаем в написании статей;
-Внутренние митапы, онлайн/офлайн активности (квизы, вечера настольных игр, спортивные мероприятия).

Контакты: hr@cinimex.ru

IT Jobs в Telegram | в VK | в Max
Post #1343 2.05K
Data Engineer в команду CDP
#удаленка
Компания: 2Гис

🔹Тебе предстоит
-Повысить эффективность пайплайнов для расчета с daily-признаков на основе batch процессинга.
-Создать эффективный пайплайн для расчёта realtime-признаков на основе Kafka‑топиков.
-Проектировать и разрабатывать сервисы, обрабатывающие миллиарды событий пользователей.
-Решать сложные инженерные задачи: расчеты метрик, построение витрин.
-Работать с потоками данных и интеграциями между CDP и другими системами 2ГИС.
-Влиять на архитектурные решения и качество кода.
-Работать в распределенной команде, взаимодействуя с аналитиками, продактами и инженерами других направлений.

🔹Ждем от тебя
-Опыт работы с highload-системами.
-Опыт проектирования архитектуры данных или платформенного кода.
-Опыт работы с Kafka, ClickHouse или другими системами потоковой и аналитической обработки данных.
Хорошо понимает, как работает Spark и умеет его готовить. Хорошо владеешь одним из языков программирования (например, Python или Scala).
-Самостоятельность и проактивность — ты не ждешь постановок, а предлагаешь решения.
-Желание разбираться в бизнес-логике и создавать продукт, а не просто писать код.

Откликнуться

IT Jobs в Telegram | в VK | в Max
  • 🤔 2
Post #1340 2.22K
Инженер данных
#гибрид
Москва
Компания: Альфа-Банк

🔹Чем предстоит заниматься
-Реализация высоконагруженных конвейеров обработки данных для обеспечения надежной и бесперебойной репликации данных из ИТ-систем Банка.
-Реализация комплексных задач по подготовке данных в целевых аналитических хранилищах (DataLake, SandBox, FeatureStore) для построения признаков, необходимых для разработки моделей машинного обучения.
-Разработка и поддержание в актуальном состоянии документации по разработанному функционалу.
-Своевременное отражение статуса выполнения задач в Jira.
-Проверка качества кода (код-ревью), написанного инженерами и младшими инженерами данных.

🔹Наши пожелания к кандидатам
-Python - уверенное знание структур данных и алгоритмов, эффективное применение принципов ООП и ФП (Функциональное программирование), опыт написания модульных и интеграционных тестов, знание и опыт применения библиотек обработки и анализа данных - numpy, pandas.
-Опыт разработки и внедрения в промышленную эксплуатацию сервисов загрузки и обработки неструктурированных и слабо структурированных данных (текст, xml, json) из внешних источников.
-Способность разобраться с API поставщиков данных, используя доступную документацию.
-SQL - умение создавать сложные запросы с использованием аналитических оконных функций и использовать инструменты профилирования для оптимизации их производительности, опыт работы с БД Oracle, Postgres, Greenplum.
-Уверенное знание и опыт работы с инструментами разработки, планирования и мониторинга рабочих процессов (workflow engines) пакетной обработки данных.
-Airflow- Опыт разработки сложных, высоконагруженных приложений обработки данных на основе PySpark, уверенное знание настроек Spark и их влияния на производительность приложений Spark.

Откликнуться

🔥 Подписаться на наши каналы / @best_itjob / @it_rab
  • 🤔 1
Post #1338 2.34K
Data-инженер в команду SQL-SWAT
#удаленка
Компания: Авито

☑️Какие задачи вас ждут:
-разрабатывать сервисы, CLI-инструменты и LLM-инструменты для ускорения и упрощения процесса миграции;
-самостоятельно мигрировать объекты с помощью созданных инструментов:
-транслировать код;
-верифицировать данные;
-переносить историю;
-переключать зависимости;
-обучать и поддерживать пользователей при работе с селф-сервис-инструментами автоматизированной миграции;
-в рамках регулярных дежурств поддерживать пользователей в чатах и консультировать по вопросам работы с витринами данных;
-мигрировать сложные и критичные витрины данных на новую платформу с сохранением производительности и соблюдением SLA;
-улучшать существующие инструменты с применением современных технологий, например AI-элементов для ускорения процессов;
-взаимодействовать с владельцами витрин из аналитических команд, согласовывать допустимые расхождения в данных и необходимые изменения бизнес-логики.

☑️Примеры будущих задач:
-доработать сервис трансляции SQL-кода, чтобы ускорить трансляцию на 20%;
-создать LLM-инструменты для верификации данных во время миграции на локальной машине пользователя;
-мигрировать сложные MERGE REFRESH-витрины с учётом специфики Trino и деградацией времени ежедневного расчёта не более чем на 10%;
-оптимизировать витрины на Trino, чтобы снизить потребление вычислительных ресурсов на 20%;
-ответить на вопрос пользователя в чате, например о том, почему витрина не проходит тесты на производительность.

Откликнуться

🔥 Подписаться на наши каналы / @best_itjob / @it_rab
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →