Помните чувство, которое хоть раз проходил каждый дежурный: первым минутам инцидента, когда алерты сыплются один за другим, а понять, что вообще происходит, ещё нельзя?
Хорошо настроенный мониторинг прекрасно показывает, что горит, но не объясняет, почему это горит и что происходит вокруг события. Именно этот разрыв и есть самая дорогая часть инцидента.
Этим летом Слёрм запустил бесплатную «Вечернюю школу. ИИ для инженеров: польза и риски». Шесть открытых онлайн занятий о том, где искусственный интеллект реально помогает инженеру, а где создаёт новые риски.
Занятия построены на живых кейсах и рабочих процессах: инженеры, архитекторы, безопасники и даже юрист разбирали, как ИИ встраивается в разбор инцидентов, автофикс прода, SOC и code review, на разных моделях и инструментах.
В первом докладе Сергей Тимиряев, DevOps и MLOps, рассказал о своем проекте:
⚪️ ИИ-агент из двух частей, Data Enricher и AI Worker, автоматически собирает контекст инцидента: метрики из Prometheus, состояние подов и нод в Kubernetes, свежие деплои и рестарты
⚪️ AI Worker передаёт обогащённый алерт в языковую модель через OpenRouter и публикует готовую гипотезу причины прямо в Telegram, реплаем на исходный алерт
⚪️ решение сокращает MTTA, время до подтверждения инцидента, с 20 до 30 минут ручного разбора до одной-двух минут, а часто и до секунд
⚪️ финальное решение всегда принимает инженер: агент не заходит в прод, не удаляет ресурсы и работает в Kubernetes API только на чтение
👈 Смотреть доклад
Исходный код проекта из видео открыт на GitHub
@DevOpsKaz 😛
