Начало
⚪️ Инженерия надежности и отказоустойчивость
SRE отвечает за стабильность и отказоустойчивость сервисов. Важно понимать принципы архитектуры распределённых систем, иметь опыт с репликацией данных, балансировкой нагрузки и построением систем резервирования. В курилке также пригодятся знания о хайповых технологиях, таких как "chaos engineering".
⚪️ Знания в области CI/CD и DevOps практик
Site Reliability Engineer активно участвует в процессах CI/CD, чтобы оптимизировать разработку и релизы. Дар нажимать правильные кнопки и не нажимать неправильные будет ключевым для предотвращения инцидентов, умение работать с инструментами (Jenkins, GitLab CI, GitHub Actions), для автоматизации процессов развертывания, тестирования и обновления приложения — возможно поможет достигнуть премии или повышения ЗП (но это не точно), но точно поможет интегрировать надёжность прямо в жизненный цикл разработки.
⚪️ Работа с облачными платформами (AWS, GCP, Azure)
Большинство компаний используют облачные инфраструктуры для масштабирования и управления ресурсами. Понимание облачных сервисов, их возможностей и ограничений помогает SRE правильно проектировать инфраструктуру и эффективно спустить все деньги на DigitalOcean управлять ресурсами.
⚪️ Менталитет разработчика и аналитическое мышление
SRE не только поддерживает системы, но и улучшает их, выявляя и устраняя неполадки. Для этого требуются аналитическое мышление и умение писать код. Основы написания и оптимизации кода на языках вроде Go или Python полезны для устранения проблем в приложениях и повышения их производительности. Не пытайтесь улучшить код на PHP и C++, для первого это бесполезно, а второе все равно не получится.
⚪️ Коммуникативные навыки и умение работать в команде
SRE постоянно взаимодействует с разработчиками, операторами и бизнес-сторонами. Умение четко объяснять технические аспекты, договариваться о приоритетах и поддерживать спокойствие в стрессовых ситуациях — важная часть работы.
Итог: чтобы стать успешным SRE,
Что еще почитать?
Про SRE и отказоустойчивость
- Почему падает прод?
- Что такое SRE?
- IT: эффективность и хайп
- Оптимизация и стоимость в сегодняшнем IT
- Что такое Chaos Engineering?
Как делать и как не делать
- Мониторинг и алертинг
- Антипаттерны в DevOps и SRE
- Культура взаимодействия между DevOps и SRE
#полезныематериалы #SRE @downtime_bar
