#аутстаф
Ищем 1 Senior DevOps
(ID 90214)
Требования:
Блок 1. Kubernetes и контейнерная инфраструктура.
- Эксплуатация кластера: Обновление без простоя (rolling, PDB, drain), диагностика подов (OOM, throttle, eviction), persistent storage для stateful-нагрузок;
- Автоскейлинг: HPA / VPA / Cluster Autoscaler; понимание metrics pipeline, custom metrics, ограничения и взаимодействие механизмов;
- Мониторинг кластера: Ключевые метрики (CPU, memory, PVC, restarts, node pressure, API latency); алертинг через Prometheus / встроенный мониторинг облака;
- IaC для k8s: Terraform/Helm для развертывания кластеров и приложений; модульность, параметризация, CI/CD для манифестов.
Блок 2. Apache Airflow и ETL-оркестрация.
- Архитектура и executor: Обоснованный выбор executor (Local / Celery / Kubernetes) под объём и изоляцию; деплой Airflow в k8s через Helm;
- Обработка ошибок и retry: Retry policy, exponential backoff, idempotent tasks, DLQ, on_failure alerting (Slack/Telegram); стратегии partial reload;
- Мониторинг и оптимизация DAG: Анализ длительности задач, pool saturation, sensor лаги; оптимизация - партиционирование, deferrable operators, устранение XCom-бутылочных горлышек;
- Версионирование и деплой DAG: GitSync vs образ vs CI/CD pipeline; семантическое версионирование, rollback, изоляция сред (dev/staging/prod).
Блок 3. Базы данных и хранилища.
- Выбор СУБД: OLTP (PostgreSQL) vs OLAP (ClickHouse); понимание границ применимости, распределённых таблиц, движков хранения;
- Репликация и бэкапы: Настройка репликации, PITR, автоматические/ручные бэкапы; понимание RPO/RTO, тестирование восстановления;
- Performance и оптимизация: Query profiling (pg_stat, system.query_log), индексы, партиционирование, materialised views; диагностика медленных запросов;
- Миграция данных: Логическая vs физическая миграция, DMS/инструменты, minimal downtime (logical replication), валидация и cutover plan.
Блок 4. Общие DevOps-практики и инцидент-менеджмент.
- IaC и конфигурации: Terraform для облака (сети, ВМ, managed-сервисы); управление секретами (Vault / Lockbox / External Secrets), rotation, least privilege;
- Мониторинг и алертинг: Метрики и логи инфраструктуры и приложений; дашборды, SLO/SLI, on-call; tracing для ETL-пайплайнов;
- Disaster recovery и capacity planning: Multi-AZ, резервные кластеры, документированные runbook'и; тренд-анализ роста данных, бюджетное планирование;
- Инцидент-менеджмент: Диагностика деградации ETL, восстановление упавшего scheduler'а, миграция больших объёмов; blue-green deployment с минимальным риском.
О проекте:
ИТ-компания
Локация: Россия
Время работы: UTC+3
Гражданство: РФ
Формат: Удаленно
Срок привлечения: 3 месяца
📨 Регистрируйтесь, загружайте резюме на https://skillstaff.ru и оставляйте отклик на запрос
❗️Все актуальные запросы — здесь
Post #4594
190