TGViewer
Кучевые АйТи Кучевые АйТи @oblakoteka · 2.04K subscribers
Post #593 586
SLA сам себя не выполнит

Хороший сервис — это незаметный сервис. Он просто функционирует, и за этим скрывается невидимая работа: профилактика, мониторинг и умение команды действовать без лишней суеты.

Сегодня Ирина Курбатова, директор техподдержки Облакотеки расскажет, на чем держится надежность сервиса. Спойлер: не на героизме, а на рутине.

⏪ В Облакотеке есть базовый принцип: «Вызов, возможности, вдохновение — при развитии. Системность, процесс, порядок — при эксплуатации». Клиенты и партнеры ждут от провайдера предсказуемую доступность, производительность и функциональность при управлении услугой.

«Предсказуемость» должна быть измерена и закреплена в SLA. Чаще всего провайдеров облаков сравнивают по доступности. Хорошим считается показатель в 99,9%. А вот каждая сотая доля сверх этого, например, до 99,95%, требует от компании кратно больших вложений в инфраструктуру и организационные процедуры.


За надежность отвечает отдельный процесс — управление непрерывностью услуг. Он включает в себя несколько направлений: автоматический мониторинг сервисов и инфраструктуры, плановые и профилактические работы, управление нештатными ситуациями и анализ результатов работы.

Чтобы и команда, и системы действовали отлажено и четко, помимо документации по сервису нам понадобится процессная документация. Именно в ней мы фиксируем:

➡️ цели, методику оценки достижения цели;
➡️ распределение ролей, их полномочия и взаимодействие;
➡️ порядок шагов для достижения результата и контроль сроков;
➡️ чек-листы, маршруты, правила, написанные кровью прошлого опыта;
➡️ алгоритмы и критерии принятия решений;
➡️ требуемые инструменты и ресурсы;
➡️ границы, исключения, риски;
➡️ регулярный анализ результатов и поиск возможностей улучшения.

Как это выглядит на практике? Скажем, перед нами стоит цель: минимизировать влияние нештатных ситуаций на доступность, безопасность, производительность и качество услуг.

Тогда мы будем измерять продолжительность, масштаб, существенность влияния и количество нештатных ситуаций за период. В главных ролях — дежурная линия поддержки, медиатор, ответственный за восстановление, инженерные команды и клиентский сервис.

Из инструментов нам потребуется мониторинг, чаты рабочих групп (группы восстановления, группы клиентского сервиса), инфраструктурные ресурсы и доступы, система Helpdesk, налаженные коммуникации с поставщиками, сайт публикации для клиентов актуальной информации о состоянии сервисов.

Что мы делаем по шагам:
1️⃣ Выявление — алерты от мониторинга, в редких случаях — обращения клиентов.
2️⃣ Первичный анализ и эскалация — подключаем экспертов к анализу выявленных симптомов.
3️⃣ Первичная информация — фиксируем симптомы, причину, принимаем решение о необходимости включения режима аварии.
4️⃣ Информирование клиентов — отражаем информацию о состоянии сервисов на сайте и отвечаем клиентам, которые обратились за помощью.
5️⃣ Восстановление доступности — зачастую авария происходит в связи со сбоем, которого никогда раньше не было, поэтому здесь все индивидуально.
6️⃣ Регулярная актуализация информации — вплоть до окончания нештатной ситуации.
7️⃣ Postmortem — анализируем, как отработали инцидент и как избежать повторения.
8️⃣ Меры, чтобы ситуация не повторилась — пересматриваем оценку угроз, расширяем мониторинг и так далее.

Надежность сервиса начинается не в момент аварии, а сильно раньше. Она складывается из рутинных вещей: мониторинга, профилактики, анализа и честного разбора того, что уже происходило ⏩.

#Ирина_поддержи
  • ❤ 9
  • 🔥 6
  • 👍 3
  • 💯 2
  • 😁 1
More from @oblakoteka
  1. Sep 29, 2026Добро пожаловать в реальную нагрузку А у нас свежий кейс! Партнер Облакотеки Виталий Сидор…
  2. Sep 25, 2026Резюме решает не всё: как работодатель оценивает ИТ-сотрудников при найме Что на самом дел…
  3. Sep 25, 2026А наша Оксана поделилась с каналом «Работа в IT» кусочком внутренней кухни. Кому интересно…
  4. Sep 22, 2026Облака сгущаются над ГИС Давно не было рубрики #максим_ерунды_не_скажет. Исправляемся: Мак…
  5. Sep 21, 2026Посторонним вход через криптошлюз О том, почему для ГИС нужно специально подготовленное об…
  6. Sep 16, 2026Бэкап на чекап Окей, бэкап у нас есть — а нужная точка восстановления? А отдельный файл из…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →