TGViewer
Downtime Bar&Grill Downtime Bar&Grill @downtime_bar · 1K subscribers
Post #184 628
Какие навыки нужны для SRE? – Разбор ключевых навыков и технологий, которые помогут в карьере SRE. Часть 1

Работа Site Reliability Engineer (SRE) — одна из самых ответственных и технически насыщенных ролей в IT. Она требует уникального сочетания инженерных знаний, умений в области автоматизации и понимания архитектуры современных систем. В этом посте разберём ключевые навыки и технологии, которые помогут вам построить успешную карьеру в SRE.

⚪️ Глубокие знания в области Linux/Unix систем
Linux и Unix составляют основу большинства серверных инфраструктур. Понимание процессов управления ресурсами, сетевых настроек, файловых систем и разрешений — обязательная база. Без уверенного владения командной строкой (CLI) и знания утилит вроде iostat, vmstat, iotop, uname, netstat, mdadm, shutdown, ping, ls, ps, vi, cd, ip, df, du, fdisk, free, date, grep, awk, sed, mkdir, history и exit, SRE может столкнуться с трудностями при отладке и мониторинге системы.

⚪️ Сетевые навыки и протоколы
Настоящий SRE должен понимать, как работают сетевые протоколы (HTTP(s), DNS, TCP/IP), знать основы маршрутизации и балансировки нагрузки. Эти знания помогают разбираться в задержках, решать проблемы с доступностью, пропускной способностью и обеспечивать отказоустойчивость.

⚪️ Автоматизация и скриптинг
Автоматизация повседневных задач — один из основных принципов SRE. Знание языков скриптов (Bash, Python, PHP, или если Вам совсем не повезло Perl) и инструментов для автоматизации, таких как Ansible, Chef, Puppet или Terraform, позволяет минимизировать количество рутинных операций, тем самым освобождая время для более сложных задач.

⚪️ Инструменты контейнеризации и оркестрации (Docker, Kubernetes)
Современные приложения часто работают в контейнерах, а Kubernetes стал стандартом для оркестрации контейнеров. Знание этих технологий помогает SRE создавать гибкие, масштабируемые и легко управляемые системы, обеспечивая быстрое развертывание, моментальный отказ всего кластера (но это не каждый день!) и стабильную работу приложений.

⚪️ Мониторинг и алертинг
SRE должен иметь навыки настройки и использования систем мониторинга (Prometheus, Grafana, ELK Stack, Zabbix). Эти системы позволяют отслеживать состояние приложений и инфраструктуры, оперативно выявлять сбои и своевременно реагировать на инциденты. Основным навыком работы с мониторингом в настоящее время считается навык открыть дашборд и посмотреть в него хотя бы один раз в день. Умение понять, что показывает мониторинг, является джедайским навыком и встречается примерно один раз на сто тысяч человек. Работа с алертами и создание настраиваемых дашбордов — также важная часть работы.

Читать продолжение👇

Что еще почитать?

Про инженерную культуру
- Зачем нужна инженерная культура
- Как на собесе понять, что в эту компанию тебе не надо
- Индикаторы упадка компании
- Можно ли в одиночку поменять культуру в компании

Базы данных
- Базовая настройка MySQL
- Настройка транзакционного лога InnoDB в MySQL

#полезныематериалы #SRE @downtime_bar
  • 🔥 7
  • ❤‍🔥 1
  • ❤ 1
More from @downtime_bar
  1. Sep 23, 2026Зарегистрироваться и подключиться: https://fournines.timepad.ru/event/4181137/ Если опозда…
  2. Sep 22, 2026Всем привет! У нас радостная новость - в нашем с вами канале первая тысяча человек, с кото…
  3. Sep 21, 2026Начинаем новую неделю! Уже послезавтра пройдет первая из серии встреч по базам данных и SR…
  4. Sep 20, 2026Рубрика воскресный рекомендасьон. Если есть желание почитать что-то очень прикладное и при…
  5. Sep 19, 2026Сезон встреч и конференций продолжается Performance Conf собиралась уже двенадцатый раз и…
  6. Sep 16, 2026Вчера внезапно собрались на ламповый межусобойчик в славном городе Липецке, в помещении Сб…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →