TGViewer
Channel Public Channel
Data Engineer Работа Вакансии

Data Engineer Работа Вакансии

@de_rabota

Вакансии Data Engineer


Размещение вакансий и рекламы - @hr_rus
Стоимость размещения - t.me/it_rab/11

Каналы вакансий других IT профессий - @it_rab
Subscribers
4.95K
Photos
31
Videos
18
Links
854

Showing posts older than #1310 · Back to latest

Older Posts 20 shown
Post #1309 2.05K
#работа #удаленка #ИИ #LLM #голосовойИИ
Специалист по голосовому ИИ 🤖
❗️ Это не вакансия разработчика. Код продукта вы писать не будете

Компания: АИ МОП
📍 Удалёнка
💰 Ваш доход привязан к бизнес-показателям клиента, на которые вы влияете напрямую
«Так люди не разговаривают».
Ловили себя на этой мысли, читая ответ ИИ? И могли сразу сказать — почему именно? Тогда читайте дальше.

Мы создаём голосовых ИИ-агентов на собственных моделях.
Нам нужен человек, который на рефлексе различает написанный текст и произнесённую речь
Это два разных языка - не один контент в разной обёртке

Что это значит:
-Вы знаете, что такое просодия — интонация, ритм, паузы и почему без неё агент звучит «роботом» даже с идеально грамотным текстом
-Вы отличаете междометия («ну», «хм», «слушай») как живую речь от слов-паразитов как шума
Вы слышите, когда текст «читается», а не «говорится», и можете объяснить это словами, а не интуицией

Что будете делать:
-Проектировать поведение голосового ИИ через промпты
переводить письменную логику в естественную устную
-Исследовать небольшие LLM в голосовых сценариях
-Настраивать диалог так, чтобы он двигал экономику клиента- конверсию, удержание, длину сессии, долю доведённых до цели разговоров

Будет плюсом:
-Опыт с голосовыми или диалоговыми системами
-Лингвистический фон или осознанный интерес к устной речи
-Понимание продуктовых метрик

📩 Откликается? Пишите: @MissAngelinochka
Post #1307 1.75K
Ведущий инженер данных в VK Видео, Москва
#удаленка #senior
Компания:VK

🔹Задачи
-Разрабатывать и поддерживать процессы обработки и доставки данных для аналитических и ML команд
-Собирать витрины, оптимизировать
-Писать адхоки и выгрузки, раздебаги
-Собирать требования

🔹Требования
-Понимание работы параллельных вычислений на кластере
-Опыт с Airflow, Spark, Hadoop, ClickHouse, YT (опционально)
-Знание Python: алгосы базовые (для понимания оптимального кода), классы и прочий сложный код (для чтения исходников и создания велосипедов типа операторов/сервисов)
-Знание Git и работа с кодом в команде (ревью)

Откликнуться

🔥 Подписаться на наши каналы / @best_itjob / @it_rab
Post #1304 1.91K
Senior Data Engineer в Маркет
#гибрид #офис #senior
Компания: Яндекс

🔹Какие задачи вас ждут
-Принятие конечных сетевых решений по реализации поставок данных
Вам предстоит проектировать схемы поставок данных, выбирать подход к внесению доработок в витрины за оптимальное время с минимизацией рисков от релизов. И ещё нужен будет критический взгляд на результат в интересах потребителей данных.
-Развитие фреймворков обработки данных
Вы будете применять существующие инструменты работы с данными и выделять их недостатки, продвигать повестку по их улучшению или поиску новых для более эффективного решения задач.
-Руководство реализацией сложных технических поставок
Нужно будет разбираться в алгоритмической составляющей инструментов и находить эффективные решения, в том числе упрощая постановку задачи.

🔹Мы ждем, что вы

-Уверенно знаете Python на уровне написания собственного фреймворка и SQL на уровне оптимизации запросов
-Умеете проектировать DWH: слои, модели хранения данных, процессы ETL
-Хорошо понимаете принципы работы распределённых систем Hadoop или YTsaurus, ClickHouse
-Умеете выбирать технологии для решения конкретных задач
-Знаете основные алгоритмы и структуры данных, особенно используемые в работе с большими данными
-Имеете опыт работы от трёх лет
-Умеете работать в командной строке Unix-подобных систем (Linux, macOS)

🔹Будет плюсом, если вы
-Имеете опыт промышленной разработки на C++
-Работали в ecom-отрасли
-Решали задачи в роли аналитика, управляли командой или проектами

Откликнуться

🔥 Подписаться на наши каналы / @best_itjob / @it_rab
  • 🤔 3
Post #1302 1.77K
Data Engineer в команду CDP
#удаленка
Компания: 2Гис

🔹Тебе предстоит
-Повысить эффективность пайплайнов для расчета с daily-признаков на основе batch процессинга.
-Создать эффективный пайплайн для расчёта realtime-признаков на основе Kafka‑топиков.
-Проектировать и разрабатывать сервисы, обрабатывающие миллиарды событий пользователей.
-Решать сложные инженерные задачи: расчеты метрик, построение витрин.
-Работать с потоками данных и интеграциями между CDP и другими системами 2ГИС.
-Влиять на архитектурные решения и качество кода.
-Работать в распределенной команде, взаимодействуя с аналитиками, продактами и инженерами других направлений.

🔹Ждем от тебя
-Опыт работы с highload-системами.
-Опыт проектирования архитектуры данных или платформенного кода.
-Опыт работы с Kafka, ClickHouse или другими системами потоковой и аналитической обработки данных.
Хорошо понимает, как работает Spark и умеет его готовить. Хорошо владеешь одним из языков программирования (например, Python или Scala).
-Самостоятельность и проактивность — ты не ждешь постановок, а предлагаешь решения.
-Желание разбираться в бизнес-логике и создавать продукт, а не просто писать код.

Откликнуться

IT Jobs в Telegram | в VK | в Max
  • 🤔 1
Post #1300 2.37K
Стажер Data Engineer в Аналитика Datagovernance [Big Data, МТС Веб Сервисы]
#гибрид #intern
Москва
Компания: МТС

🔹Чем предстоит заниматься
-Разрабатывать ETL-процедуры для сервисов datagov с использованием python, pyspark, hadoop, airflow;
-Собирать данные из разных реляционных и нереляционных источников;
-Создавать наполнять витрины в hive/postgres/clickhouse/greenplum

🔹Что мы ожидаем
-Студенты 3 - 6 курсов бакалавриата, специалитета или магистратуры;
-Хорошее знание Python;
-Уверенное знание SQL и умение работать с реляционной СУБД
-Будет плюсом: опыт использования с фреймворками обработки данных типа pandas/polars/spark и подобными

Откликнуться

🔥 Подписаться на наши каналы / @best_itjob / @it_rab
  • ❤ 1
Post #1299 2.33K
Data Engineer/ MLOpsE
#офис #гибрид #middle
Москва
Компания: Bell Integrator

☑️ЧТО МЫ ОЖИДАЕМ ОТ КАНДИДАТА:
-Понимание основ облачных технологий и технологий виртуализации и контейнеризации;
-Опыт с экосистемой Hadoop (HDFS, Hive, Spark и п-р.);
-Опыт промышленной разработки Python;
-Опыт работы с ETL (Airflow и пр.);
-Опыт работы с CI/CD решениями на базе Jenkins и Bitbucket / Git.

БУДЕТ ПЛЮСОМ:
Опыт работы с платформами оркестрации контейнеров K8s, OpenShift;
Опыт внедрения DS-моделей в промышленный контур;
Опыт работы с Kafka;
Опыт работы с популярными РСУБД (Greenplum, Teradata, Oracle, PostgreSQL);
Понимание принципов построения хранилищ данных DWH;
Знания в RL и Графовых нейросетях;
Отличные знания в области классического ML и DL.

☑️ЧЕМ ПРЕДСТОИТ ЗАНИМАТЬСЯ:
-Разработка, поддержка и оптимизация ETL-процессов команды на платформах банка;
-Внедрение разработанных DS-моделей в промышленную среду (MLOps);
-Поддержка промышленной эксплуатации разработанных решений.

☑️МЫ ПРЕДЛАГАЕМ:
-Возможность участия в интересных проектах.
-Возможность профессионального и карьерного роста в компании.
-Опыт работы в команде профессионалов.
-Специальные тарифы для сотрудников в спортивные клубы и языковые курсы и пр.
-Офисный\гибридный формат работы в Москве.
Контакты: hr@bellintegrator.ru

IT Jobs в Telegram | в VK | в Max
  • 🤔 4
Post #1298 1.88K
Data Engineer (Python + Spark)
#офис
Москва
Компания: X5 Tech

☑️ Задача
Мы строим end-to-end пайплайны, которые собирают данные из разных источников (онлайн и оффлайн-продажи, ERP, внешние API), очищают, трансформируют и подготавливают их для моделей машинного обучения (бустинг и нейронные сети). От качества этих пайплайнов зависит точность прогноза и миллионы управленческих решений в закупках и логистике
• Разрабатывать и оптимизировать Spark-пайплайны для обработки данных в масштабе (200+ млн строк ежедневно)
• Настраивать хранение и доступность данных в DWH
• Автоматизировать интеграцию данных: продажи, акции, цены, остатки, погода, календари
• Работать в связке с Data Science-командой, обеспечивая стабильный и качественный поток данных для моделей
• Участвовать в развитии платформы прогнозирования спроса, делая её более надёжной, масштабируемой и удобной

☑️Наш стек
• PySpark{2,3} / Spark SQL
• Hadoop / Hive / Trino / S3 / clickhouse / postgres/ greenplum
• Airflow
• Python3
• Docker, YARN / k8s
• pytest

Откликнуться

Python Job в Telegram | в VK | в Max
Post #1297 1.96K
Data Engineer for VLM Training Data (GigaChat Vision)
#офис
Москва
Компания: Сбер

🔹Обязанности
-Собирать и структурировать потребности ML-команды в данных: какие данные нужны для обучения, дообучения, оценки и улучшения VLM.
-Предлагать и реализовывать идеи пайплайнов очистки, фильтрации, дедупликации, категоризации и генерации данных.
-Ориентироваться в современных практиках построения датасетов для Vision-Language Models: image-text pairs, synthetic data, filtering, quality scoring, data mixture design, dataset versioning.
-Отвечать за инфраструктуру хранения и подготовки данных, включая:
импорт данных из различных источников: production, Common Crawl, open-source datasets, generated data;
валидацию и контроль качества данных;
хранение и версионирование датасетов;
экспорт данных в форматы, пригодные для обучения моделей.
-Проектировать и реализовывать пайплайны обработки данных на большом масштабе, включая десятки миллиардов изображений.
-Разрабатывать пайплайны генерации синтетических данных для обучения и улучшения VLM.
-Собирать статистику по данным, строить отчёты и визуализации для анализа состава, качества и покрытия датасетов.
-Обеспечивать воспроизводимость, наблюдаемость и надёжность data-процессов.
-Работать в тесной связке с ML-инженерами, исследователями и инфраструктурной командой.

🔹Требования
-Сильный опыт в data engineering и построении production-grade data pipelines.
-Уверенное владение Python, включая multiprocessing, multithreading и async-подходы.
-Опыт работы с большими объёмами данных и распределённой обработкой.
-Практический опыт с объектными хранилищами, в частности S3 или аналогами.
-Опыт работы с YTsaurus или похожими системами для распределённого хранения и обработки данных.
-Понимание принципов валидации, очистки, дедупликации и версионирования датасетов.
-Опыт работы с DVC, Git, Docker.
-Опыт работы с PostgreSQL или другими реляционными базами данных.
-Умение проектировать устойчивые пайплайны: от импорта данных до финального экспорта в training-ready формат.
-Способность самостоятельно разбираться в нечетко сформулированных задачах и доводить их до работающего решения.
-Готовность работать на стыке engineering и ML research.

Откликнуться

IT Jobs в Telegram | в VK | в Max
  • ❤ 1
Post #1296 1.91K
🚀 Вакансия: Data Engineer (удаленно/гибрид)
Компания: ООО "ОДСС" https://odsscompany.ru (аккредитованная IT-компания)
Локация Москва
Зарплата от 150 до 170 т.р.
Оформление по ТК РФ

Мы ищем в свою команду инициативного Data Engineer для разработки и поддержания инфраструктуры данных для большого проекта озера данных, включающего себя сложные сценарии приема и обработки данных из разных источников.

Что предстоит:
• разработка и поддержание парсеров
• автоматизация обработки и преобразования данных
• отладка и мониторинг конвейеров данных

Технологический стек: Python, PostgreSQL, Dagster, Selenium

Что мы ждем от тебя:
- знание основных библиотек Python для работы с данными
- опыт обработки и скрейпинга/парсинга сложных и слабоструктурированных документов в форматах pdf, doc, docx, xls, xlsx
- опыт работы автоматизации конвейеров данных и знание соответствующих программных инструментов
- представление об управлении качеством данных
- представление о возможностях отладки мониторинга
- понимание специфики форматов данных (JSON lines, Parquet, XML, CSV и тд.)
- понимание методов получения и поставки данных (как, например, S3, REST API, SOAP, RPC)
- знание английского языка на уровне, достаточном для чтения технической документации
- знание Git
- готовность осваивать новые технологии и разрабатывать индивидуальные технические решения под поставленные задачи.

Плюсами будут:
- опыт работы с данными из открытых источников и понимание их специфики
- опыт долгосрочного поддержания работы парсеров
- опыт работы с библиотеками Python для computer vision

Преимущества проекта
✅ Проект только стартовал — мало легаси, много свободы для экспериментов
✅ Можно влиять на выбор технологий и архитектурных решений

Для быстрой связи @LvovaOV
  • 🤔 14
  • ❤ 2
  • 👍 2
Post #1295 2.04K
Senior Data Engineer в Маркет
#гибрид #офис #senior
Компания: Яндекс

🔹Какие задачи вас ждут
-Принятие конечных сетевых решений по реализации поставок данных
Вам предстоит проектировать схемы поставок данных, выбирать подход к внесению доработок в витрины за оптимальное время с минимизацией рисков от релизов. И ещё нужен будет критический взгляд на результат в интересах потребителей данных.
-Развитие фреймворков обработки данных
Вы будете применять существующие инструменты работы с данными и выделять их недостатки, продвигать повестку по их улучшению или поиску новых для более эффективного решения задач.
-Руководство реализацией сложных технических поставок
Нужно будет разбираться в алгоритмической составляющей инструментов и находить эффективные решения, в том числе упрощая постановку задачи.

🔹Мы ждем, что вы

-Уверенно знаете Python на уровне написания собственного фреймворка и SQL на уровне оптимизации запросов
-Умеете проектировать DWH: слои, модели хранения данных, процессы ETL
-Хорошо понимаете принципы работы распределённых систем Hadoop или YTsaurus, ClickHouse
-Умеете выбирать технологии для решения конкретных задач
-Знаете основные алгоритмы и структуры данных, особенно используемые в работе с большими данными
-Имеете опыт работы от трёх лет
-Умеете работать в командной строке Unix-подобных систем (Linux, macOS)

🔹Будет плюсом, если вы
-Имеете опыт промышленной разработки на C++
-Работали в ecom-отрасли
-Решали задачи в роли аналитика, управляли командой или проектами

Откликнуться

🔥 Подписаться на наши каналы / @best_itjob / @it_rab
  • 🤔 3
Post #1294 2.29K
Data-инженер
#удаленка
Компания: Золотое Яблоко
🔹ЧТО НУЖНО ДЕЛАТЬ:
-Разработка и поддержка текущих ETL-процессов сбора данных
-Разработка проверок качества данных, интеграция новых источников
-Участие в тестирование разработанного функционала
-Определение возможностей для автоматизации и оптимизации процессов загрузки и обработки данных
-Участие в митапах с бизнесом с целью отладки технических вопросов в поступающих задачах

🔹ЧТО ЖДЕМ ОТ КАНДИДАТА:
-Опыт работы на позиции Data-инженера от 2 лет
-Навыки работы с технологиями: SQL, Python, Spark, Airflow, Clickhouse, Trino, Gitlab, dbt, k8s, Mongo DB, Docker + прочие современные инструменты для работы с большими массивами данных.
-Практические знания в области big-data
Контакты: https://job.goldapple.ru/vacancy/6964a414bf490ee4caf2b38d-data-inzhener

🔥 Подписаться на наши каналы / @best_itjob / @it_rab
  • 🔥 3
Post #1293 2.16K
Data Engineer / Рекомендации
#удаленка
Компания: Wildberries

🔹Что нужно делать
-Поддерживать пайплайны на Greenplum;
сопровождать и оптимизировать существующие ETL/ELT-процессы: мониторинг, диагностика деградаций, партиционирование, работа с каталогом;
-заниматься интеграциями новых источников;
-подключать новые продуктовые команды и внешние источники: технический ресёрч, проектирование схем интеграции, data contracts.
Взаимодействие с владельцами источников на уровне технических требований;
-участие в миграции: перепроектирование слоёв под Iceberg (partitioning, schema evolution, snapshot management), понимание компромиссов MPP vs object storage.

🔹Какой опыт и знания нужны
-Владеете опытом с Airflow как оркестратором;
-имеете работы с Hadoop (Spark/Yarn/Hdfs);
-имеете работы c Greenplum или другими MPP-системами;
-работали с Trino как query engine.

Откликнуться

🔥 Подписаться на наши каналы / @best_itjob / @it_rab
  • 👍 1
Post #1292 2K
Дата-инженер в Дата-сервисы VK Tech, Москва
#удаленка #офис #middle #senior
Компания: VK

☑️Задачи
-разрабатывать и поддерживать ETL/ELT-процессы с использованием Python и Airflow;
-оптимизировать запросы и распределённые вычисления под ClickHouse и YT;
-мониторить состояние ETL-процессов, обеспечивать их надёжность и наблюдаемость;
-помогать аналитикам с оптимизацией их SQL-запросов и структур данных;
-проектировать и поддерживать хранилище данных VK Tech (схемы, витрины, SCD);
-участвовать в миграции вычислительной платформы с YT на Hadoop/Spark.

☑️Требования
-опыт разработки и поддержки ETL-процессов на Python + Airflow;
-уверенное знание SQL (JOIN, оконные функции, CTE, агрегации);
-понимание концепций DWH: витрины данных, медленно меняющиеся измерения (SCD), слои raw/ods/cdm/dds;
-опыт оптимизации запросов в распределённых системах (ClickHouse или Spark);
-знание Git (ветки, коммиты, pull requests, code review);
-умение читать и анализировать чужой код.

Откликнуться

Python Job в Telegram | в VK | в Max
Post #1290 1.7K
Data Engineer (Python + Spark)
#гибрид
Москва
Компания: X5 Tech

🔹Обязанности
В команде разработывается ML-система, детекирующая Out-of-stock ситуации и аномалии в продажах, которая в near-real-time выявляет потенциальные проблемы с наличием товара и отправляет предупреждения сотрудникам магазинов для оперативной проверки и выкладки.

🔹 Задача
Мы строим end-to-end пайплайны, которые собирают данные из разных источников (онлайн и оффлайн-продажи, ERP, внешние API), очищают, трансформируют и подготавливают их для моделей машинного обучения (бустинг и нейронные сети). От качества этих пайплайнов зависит точность прогноза и миллионы управленческих решений в закупках и логистике
• Разрабатывать и оптимизировать Spark-пайплайны для обработки данных в масштабе (200+ млн строк ежедневно)
• Настраивать хранение и доступность данных в DWH
• Автоматизировать интеграцию данных: продажи, акции, цены, остатки, погода, календари
• Работать в связке с Data Science-командой, обеспечивая стабильный и качественный поток данных для моделей
• Участвовать в развитии платформы прогнозирования спроса, делая её более надёжной, масштабируемой и удобной

☑️Требования
Наш стек
• PySpark{2,3} / Spark SQL
• Hadoop / Hive / Trino / S3 / clickhouse / postgres/ greenplum
• Airflow
• Python3
• Docker, YARN / k8s
• pytest

Откликнуться

🔥 Подписаться на наши каналы / @best_itjob / @it_rab
Post #1289 1.82K
Data Engineer
#удаленка
Компания: Облако.ру

🔹Обязанности
-Проектирование и развитие data-пайплайнов для обработки событий кибербезопасности;
-Нормализация и обогащение событий безопасности;
-Проектирование и оптимизация аналитического хранилища данных (ClickHouse / StarRocks / аналоги);
-Подготовка витрин данных под быстрые запросы и аналитику;
-Эксплуатация data сервисов в Kubernetes: деплой, ресурсы, отказоустойчивость, масштабирование;
-Обеспечение наблюдаемости и качества данных (метрики, алерты, replay/backfill);
-Участие в разборе инцидентов и оптимизации производительности data платформы.

🔹Требования
-Опыт построения и эксплуатации data pipelines (ETL, ELT и/или streaming) в production среде;
-Уверенный SQL, включая оптимизацию запросов и анализ производительности;
-Опыт работы с OLAP-СУБД (ClickHouse/StarRocks/Druid/Pinot или аналоги);
-Понимание принципов потоковой обработки данных (идемпотентность, дедупликация, обработка ошибок);
-Опыт проектирования и оптимизации витрин и схем хранения данных;
-Уверенные знания Kubernetes и опыт эксплуатации сервисов в production среде;
-Понимание принципов надежности, масштабирования и наблюдаемости data систем.

Откликнуться

🔥 Подписаться на наши каналы / @best_itjob / @it_rab
  • 🤔 7
Post #1288 2.15K
Senior Data Engineer в Маркет
#гибрид #офис #senior
Компания: Яндекс

🔹Какие задачи вас ждут
-Принятие конечных сетевых решений по реализации поставок данных
Вам предстоит проектировать схемы поставок данных, выбирать подход к внесению доработок в витрины за оптимальное время с минимизацией рисков от релизов. И ещё нужен будет критический взгляд на результат в интересах потребителей данных.
-Развитие фреймворков обработки данных
Вы будете применять существующие инструменты работы с данными и выделять их недостатки, продвигать повестку по их улучшению или поиску новых для более эффективного решения задач.
-Руководство реализацией сложных технических поставок
Нужно будет разбираться в алгоритмической составляющей инструментов и находить эффективные решения, в том числе упрощая постановку задачи.

🔹Мы ждем, что вы

-Уверенно знаете Python на уровне написания собственного фреймворка и SQL на уровне оптимизации запросов
-Умеете проектировать DWH: слои, модели хранения данных, процессы ETL
-Хорошо понимаете принципы работы распределённых систем Hadoop или YTsaurus, ClickHouse
-Умеете выбирать технологии для решения конкретных задач
-Знаете основные алгоритмы и структуры данных, особенно используемые в работе с большими данными
-Имеете опыт работы от трёх лет
-Умеете работать в командной строке Unix-подобных систем (Linux, macOS)

🔹Будет плюсом, если вы
-Имеете опыт промышленной разработки на C++
-Работали в ecom-отрасли
-Решали задачи в роли аналитика, управляли командой или проектами

Откликнуться

🔥 Подписаться на наши каналы / @best_itjob / @it_rab
  • ❤ 1
  • 👍 1
  • 🔥 1
Post #1286 2.36K
Senior Data Engineer
Формат работы: удаленно/гибрид - на выбор; с 9/10 до 18/19 по мск
Занятость: full-time
ЗП: обсуждается индивидуально

Компания:
Мы — международная компания Coral Club!
Более 25 лет занимаемся разработкой, изготовлением и продвижением продукции для здорового образа жизни. За это время мы стали экспертами в формировании wellness-культуры.

Ключевые требования:
- Опыт работы в роли Data Engineer или Analytics Engineer от 3-6 лет.
- Экспертный уровень владения SQL. Нужно уметь работать со сложными структурами (JSONB, массивы), анализировать планы выполнения запросов (EXPLAIN) и проводить рефакторинг кода.
- Уверенный Python. Навыки написания ETL-скриптов, работа с библиотеками для взаимодействия с БД и понимание того, как писать поддерживаемый код.
- Опыт с Apache Airflow. Умение проектировать пайплайны, настраивать ретраи и мониторить выполнение задач.
- Понимание специфики PostgreSQL и ClickHouse. Нужно знать, как эффективно перекладывать данные между строчной и колоночной базами, учитывая их особенности.

Зона ответственности:

- Разработка логической и физической структуры хранилища (DWH/Lakehouse), выбор стратегий хранения и форматов данных для обеспечения масштабируемости (включая изолированные «песочницы» для аналитиков, подготовку данных для обучения ML-моделей и т.д.).
- Разработка надежных пайплайнов для сбора данных из любых источников (API, БД, брокеры сообщений, логи) и обеспечение их бесперебойной доставки.
- Реализация процессов ELT с использованием инструментов трансформации (например, dbt), обеспечение чистоты и консистентности данных на всех этапах.
- Разработка высокопроизводительных витрин, оптимизированных под задачи бизнес-аналитики и BI-инструментов.
- Установление стандартов разработки, описание архитектуры и принятие решений по развитию стека инструментов для обработки данных.

Условия:
- График: 5/2, гибрид/ удаленно - на выбор. (офис в Москве - Барклая 6с25, м.Фили)
- Семинары, тренинги, конференции внутри компании.
- Компенсация внешнего обучения.
- Скидки на приобретение продукции компании до 50% и дополнительные программы лояльности для сотрудников.

Контакты:
Писать в личные сообщения 👉 @elisaveta_hr
Пожалуйста, прикладывайте резюме к отклику.
  • 🤔 1
Post #1285 2.14K
Инженер данных в Доставку
#гибрид
Компания: Яндекс

🔹Какие задачи вас ждут
-Разработка и поддержка ETL-процессов
Вы будете проектировать и поддерживать ETL-пайплайны для обработки данных — от источников до дашбордов, работая в составе V-team своего домена данных.
-Повышение качества и стабильности данных
Вам предстоит обеспечивать стабильность и производительность витрин и дашбордов, разрабатывать механизмы контроля качества данных и оптимизировать существующие процессы обработки.
-Поддержка инфраструктуры данных
Вы будете поддерживать работу ключевых компонентов платформы (ClickHouse, Greenplum, YTsaurus, ETL-сервисы), взаимодействуя с инфраструктурными командами.
-Техническая поддержка аналитиков
Вы станете основным контактным лицом для аналитиков по техническим вопросам работы с данными и инструментами платформы.

🔹Мы ждём, что вы
-Отлично знаете Python
-Работаете с Greenplum, Vertica, ClickHouse или любыми другими MPP-СУБД
-Работаете с большими объёмами данных в Hadoop (HDFS, Spark, Hive), YTsaurus или аналогичных экосистемах
-Понимаете принципы проектирования хранилищ данных, ETL-фреймворков, а также систем мониторинга состояния хранилища
-Умеете оптимизировать запросы и оценивать вычислительную нагрузку

Откликнуться

IT Jobs в Telegram | в VK | в Max
  • 🔥 1
Post #1284 2.08K
Data Engineer
#удаленка #middle
Компания: deeplay

🔹Предстоит поддерживать и развивать:
-Десктопное кроссплатформенное ПО (Java 17+, Swing);
-Монолитное ПО, включает в себя клиентскую и серверную части (взаимодействие посредством gRPC);
-Отсутствие фрэймворка, используются собственные наработки;
-Организация взаимодействия с БД (PostgreSQL, ClickHouse) посредством jdbc, без подключения дополнительных библиотек;
-Организация работ механизмов в многопоточном режиме с помощью ExecutorService, CompletableFuture;
-Покрытие кода тестами (Mockito, JUnit);
-Аналитические запросы и большие объёмы данных (~60 TB).

🔹Основное: 
PostgreSQL: глубокое знание системных каталогов, статистики, индексов, партиционирование, наследование, foreign tables,  EXPLAIN ANALYZE,  cost model, pg_stat_statements, pg_stat_activity, pg_locks, индексные стратегии, lock monitoring
SQL: сложные запросы с CTE, window functions, lateral joins, динамический SQL, хранимые процедуры, триггеры, функции, query rewriting, понимание планов выполнения

🔹Для реализации задач тебе потребуется:
-Опыт работы в аналогичной роли от 3 лет
знание теории реляционных БД, понимание логической, физической моделей БД;
-опыт оптимизации сложных запросов;
-опыт поиска проблем в работающих под высокой нагрузкой системах.
-Опыт создания и поддержки ETL-процессов;
-Глубокий практический опыт разработки на Python (pandas, numpy);
-Опыт работы с Apache Airflow, самостоятельное создание DAG;
-Опыт работы с СУБД PostgreSQL, написание средних/сложных и нетривиальных SQL-запросов;
-Умение самостоятельно брать задачи, по необходимости уточнять требования и доводить до финального результата;
-Навык поиска оптимальных решений: умение работать в условиях неопределенности, формулировать вопросы и предлагать решения.
Будет плюсом:
Bash: скрипты для автоматизации рутинных операций
Linux: command line (уверенный уровень), systemd, cron, bash scripting
Понимание алертинг стратегии
Опыт работы с ClickHouse
Docker (базовое понимание)
Ansible/Terraform: базовое понимание для автоматизации
Python/Pandas для сложной аналитики
Jupyter notebooks для исследовательского анализа
pgBadger для детального анализа
Мониторинг БД: анализ connection pools (PgBouncer), performance troubleshooting, анализ wait events

🔹Мы предлагаем:
-Гибкий подход к формату и месту работы — выбирай любое место на карте или один из комфортных офисов в Омске, Новосибирске и Санкт-Петербурге;
-Корпоративную культуру: общаемся на равных, поддерживаем друг друга, ценим обратную связь и инициативность, легкость общения и юмор.
-Возможность влиять на процессы: если увидишь потенциал для улучшения, сможешь воплотить свои идеи, повысить эффективность и качество продукта.
-Стать частью команды, которая находит драйв в своих задачах и стремится к технологическому лидерству в индустрии.
-Доступность руководства компании и открытую внутреннюю политику.
Контакты: talent@deeplay.io

🔥 Подписаться на наши каналы / @best_itjob / @it_rab
  • ❤ 1
Post #1282 2K
Data Engineer, Ozon fresh
#удаленка #офис
Компания: OZON

🔹Вам предстоит:
-Писать алгоритмы обработки больших данных (несколько сотен миллионов строк в таблице).
-Исследовать и подготавливать данные.
-Оптимизировать текущие вычисления.
-Заниматься продуктивизацией алгоритмов и их сопровождением.
-Делать ревью кода и анализ инцидентов.

🔹Мы ожидаем:
-Наличие опыта в роли Data engineer от 2 лет.
-Высшее математическое или техническое образование.
-Уверенное владение Python, PySpark, SQL.
-Знание устройства Hadoop, HDFS, Hive.
-Опыт работы с системами контроля версий (Git).

Откликнуться

🔥 Подписаться на наши каналы / @best_itjob / @it_rab
  • 🔥 2
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →