Как читать логи и не паниковать 🐸
Прод упал. Ты открываешь логи, а там 40 тысяч строк. Первая реакция - закрыть и сделать вид, что ничего не было.
Давай по порядку, как это делают спокойные люди.
1. Сначала время, потом текст. Найди момент, когда всё сломалось, и смотри 30 секунд до него. Причина почти всегда там, а не там, где всё красное.
2. Ищи первую ошибку, а не самую страшную. Дальше идёт лавина последствий. Она выглядит эффектнее, но чинить надо начало цепочки.
3. Фильтруй, а не читай. grep -i error, journalctl -u сервис --since "10 min ago", tail -f. Читать логи глазами целиком - это не работа, это медитация.
4. Смотри, что менялось. Деплой, конфиг, сертификат, место на диске. В 8 случаях из 10 ответ здесь.
5. Не верь сообщению об ошибке на 100%. «Connection refused» может значить, что сервис не поднялся, а не что сеть сломалась.
Мониторингу и разбору инцидентов до падения, а не после, учим на курсе «DevOps-инженер с нуля».
➡️ Начни с бесплатной части курса
Post #1219
3.03K

- 🤝 20
- 😱 5
- 👀 3