Всем DevOps! В конце недели подготовили для вас кейс прямиком из производственной среды.
После выката нового ML-инференс-сервиса в Kubernetes поды один за другим уходят в CrashLoopBackOff. На первый взгляд кажется, что проблема в приложении. Но все ли так очевидно?
STATUS: CrashLoopBackOff
При этом в событиях Kubernetes видно:
Liveness probe failed:
connect: connection refused
А в логах контейнера:
Starting model server...
Loading model weights...
Loaded shard 1/4
Loaded shard 2/4
<SIGTERM received, shutting down>
И фрагмент Deployment:
livenessProbe:
initialDelaySeconds: 10
periodSeconds: 5
failureThreshold: 3
👨💻Что здесь происходит? Почему сервис так и не успевает запуститься и оказывается в бесконечном CrashLoopBackOff?
Голосуйте в опросе ниже ⬇️
#devops #kubernetes #k8s #разборинцидента
