Впервые в «Пути SRE»? Начните отсюда 👇
Здесь мы разбираем SRE через то, с чем инженеры реально сталкиваются в production: инциденты, SLO, observability, алерты, postmortem, on-call и ситуации, где «сделали по best practice» ещё не означает «сделали хорошо».
🐻 Если пока разбираетесь в базе → вот с чего можно начать: что важнее, SLA или SLO и зачем вообще нужны оба
🙂 Если хочется чего-нибудь побоевее → ночная задача про БД: сервис тормозит именно тогда, когда нагрузка почти исчезает
🤨А здесь можно проверить свою гипотезу → разбор задачи
🐸 Хотите ещё одну → куда исчезли логи между Fluentd и Elasticsearch?
😁 А вообще тут собрали хороший мясной дайджест за май-июнь: от метастабильных сбоев и высокой нагрузки до тихих алертов и будней SRE
И оставайтесь рядом. В ближайшее время здесь будет больше инженерных разборов, задач по шагам, кейсов из production и коротких включений практикующих SRE.
Кстати, этой осенью у Слёрма два SRE-старта.
Если хотите понять, насколько вам вообще подходит SRE, то ловите 7-дневный интенсив, старт 21 сентября
Если уже работаете с инфраструктурой или production и хотите пройти полный цикл практики, то для вас есть большой курс, старт 26 октября. Три недели работы SRE-командой
А канал никуда не заканчивается после обучения. Будем дальше ломать, чинить и спорить о надёжности здесь ;)
Post #363
908

- ❤ 2
- 🔥 2
- ⚡ 1
- 👍 1