Какие навыки нужны для SRE? – Разбор ключевых навыков и технологий, которые помогут в карьере SRE. Часть 1
Работа Site Reliability Engineer (SRE) — одна из самых ответственных и технически насыщенных ролей в IT. Она требует уникального сочетания инженерных знаний, умений в области автоматизации и понимания архитектуры современных систем. В этом посте разберём ключевые навыки и технологии, которые помогут вам построить успешную карьеру в SRE.
⚪️ Глубокие знания в области Linux/Unix систем
Linux и Unix составляют основу большинства серверных инфраструктур. Понимание процессов управления ресурсами, сетевых настроек, файловых систем и разрешений — обязательная база. Без уверенного владения командной строкой (CLI) и знания утилит вроде iostat, vmstat, iotop, uname, netstat, mdadm, shutdown, ping, ls, ps, vi, cd, ip, df, du, fdisk, free, date, grep, awk, sed, mkdir, history и exit, SRE может столкнуться с трудностями при отладке и мониторинге системы.
⚪️ Сетевые навыки и протоколы
Настоящий SRE должен понимать, как работают сетевые протоколы (HTTP(s), DNS, TCP/IP), знать основы маршрутизации и балансировки нагрузки. Эти знания помогают разбираться в задержках, решать проблемы с доступностью, пропускной способностью и обеспечивать отказоустойчивость.
⚪️ Автоматизация и скриптинг
Автоматизация повседневных задач — один из основных принципов SRE. Знание языков скриптов (Bash, Python, PHP, или если Вам совсем не повезло Perl) и инструментов для автоматизации, таких как Ansible, Chef, Puppet или Terraform, позволяет минимизировать количество рутинных операций, тем самым освобождая время для более сложных задач.
⚪️ Инструменты контейнеризации и оркестрации (Docker, Kubernetes)
Современные приложения часто работают в контейнерах, а Kubernetes стал стандартом для оркестрации контейнеров. Знание этих технологий помогает SRE создавать гибкие, масштабируемые и легко управляемые системы, обеспечивая быстрое развертывание, моментальный отказ всего кластера (но это не каждый день!) и стабильную работу приложений.
⚪️ Мониторинг и алертинг
SRE должен иметь навыки настройки и использования систем мониторинга (Prometheus, Grafana, ELK Stack, Zabbix). Эти системы позволяют отслеживать состояние приложений и инфраструктуры, оперативно выявлять сбои и своевременно реагировать на инциденты. Основным навыком работы с мониторингом в настоящее время считается навык открыть дашборд и посмотреть в него хотя бы один раз в день. Умение понять, что показывает мониторинг, является джедайским навыком и встречается примерно один раз на сто тысяч человек. Работа с алертами и создание настраиваемых дашбордов — также важная часть работы.
Читать продолжение👇
Что еще почитать?
Про инженерную культуру
- Зачем нужна инженерная культура
- Как на собесе понять, что в эту компанию тебе не надо
- Индикаторы упадка компании
- Можно ли в одиночку поменять культуру в компании
Базы данных
- Базовая настройка MySQL
- Настройка транзакционного лога InnoDB в MySQL
#полезныематериалы #SRE @downtime_bar
Post #184
628

- 🔥 7
- ❤🔥 1
- ❤ 1