Хороший сервис — это незаметный сервис. Он просто функционирует, и за этим скрывается невидимая работа: профилактика, мониторинг и умение команды действовать без лишней суеты.
Сегодня Ирина Курбатова, директор техподдержки Облакотеки расскажет, на чем держится надежность сервиса. Спойлер: не на героизме, а на рутине.
⏪ В Облакотеке есть базовый принцип: «Вызов, возможности, вдохновение — при развитии. Системность, процесс, порядок — при эксплуатации». Клиенты и партнеры ждут от провайдера предсказуемую доступность, производительность и функциональность при управлении услугой.
«Предсказуемость» должна быть измерена и закреплена в SLA. Чаще всего провайдеров облаков сравнивают по доступности. Хорошим считается показатель в 99,9%. А вот каждая сотая доля сверх этого, например, до 99,95%, требует от компании кратно больших вложений в инфраструктуру и организационные процедуры.
За надежность отвечает отдельный процесс — управление непрерывностью услуг. Он включает в себя несколько направлений: автоматический мониторинг сервисов и инфраструктуры, плановые и профилактические работы, управление нештатными ситуациями и анализ результатов работы.
Чтобы и команда, и системы действовали отлажено и четко, помимо документации по сервису нам понадобится процессная документация. Именно в ней мы фиксируем:
➡️ цели, методику оценки достижения цели;
➡️ распределение ролей, их полномочия и взаимодействие;
➡️ порядок шагов для достижения результата и контроль сроков;
➡️ чек-листы, маршруты, правила, написанные кровью прошлого опыта;
➡️ алгоритмы и критерии принятия решений;
➡️ требуемые инструменты и ресурсы;
➡️ границы, исключения, риски;
➡️ регулярный анализ результатов и поиск возможностей улучшения.
Как это выглядит на практике? Скажем, перед нами стоит цель: минимизировать влияние нештатных ситуаций на доступность, безопасность, производительность и качество услуг.
Тогда мы будем измерять продолжительность, масштаб, существенность влияния и количество нештатных ситуаций за период. В главных ролях — дежурная линия поддержки, медиатор, ответственный за восстановление, инженерные команды и клиентский сервис.
Из инструментов нам потребуется мониторинг, чаты рабочих групп (группы восстановления, группы клиентского сервиса), инфраструктурные ресурсы и доступы, система Helpdesk, налаженные коммуникации с поставщиками, сайт публикации для клиентов актуальной информации о состоянии сервисов.
Что мы делаем по шагам:
1️⃣ Выявление — алерты от мониторинга, в редких случаях — обращения клиентов.
2️⃣ Первичный анализ и эскалация — подключаем экспертов к анализу выявленных симптомов.
3️⃣ Первичная информация — фиксируем симптомы, причину, принимаем решение о необходимости включения режима аварии.
4️⃣ Информирование клиентов — отражаем информацию о состоянии сервисов на сайте и отвечаем клиентам, которые обратились за помощью.
5️⃣ Восстановление доступности — зачастую авария происходит в связи со сбоем, которого никогда раньше не было, поэтому здесь все индивидуально.
6️⃣ Регулярная актуализация информации — вплоть до окончания нештатной ситуации.
7️⃣ Postmortem — анализируем, как отработали инцидент и как избежать повторения.
8️⃣ Меры, чтобы ситуация не повторилась — пересматриваем оценку угроз, расширяем мониторинг и так далее.
Надежность сервиса начинается не в момент аварии, а сильно раньше. Она складывается из рутинных вещей: мониторинга, профилактики, анализа и честного разбора того, что уже происходило ⏩.
#Ирина_поддержи
