План восстановления при катастрофе: DRP. Часть 2
Читать сначала : Часть 1: Что такое и зачем нужен DRP?
🔥Какие бывают DRP?
Существует несколько типов Disaster Recovery Plan'ов, которые различаются по техническим характеристикам, архитектурным решениям и уровню автоматизации. Иметь план Б — это необходимая база, но при выборе типа DRP мы всегда должны находить баланс между стоимостью решения и стоимостью отказа. Нет смысла создавать дорогого монстра безотказности, когда стоимость его обслуживания будет стоить 20 дней работы сервиса. Подбор решения всегда индивидуален и должен актуализироваться с ростом бизнеса.
⚪️Горячее резервирование (Hot Site DRP) - полноценная дублирующая площадка, которая принимает нагрузку в случае сбоя.
Плюсы: минимальное время простоя, высокая доступность, возможность переключения на резерв в случае небольшой аварии (например неудачного деплоя), возможность принимать часть трафика и работа в active-active режиме в случае поддержки со стороны приложения.
Минусы: высокая стоимость эксплуатации, простой вычислительных ресурсов
⚪️Холодное резервирование (Cold Site DRP) - площадка на которой есть данные (бекапы БД, кода, настроек и всего необходимого для развертывания) но нет инфраструктуры, ресурсы которой закупаются и разворачиваются при аварии, после чего площадка конфигурится и готова принимать нагрузку
Плюсы: в несколько раз дешевле горячего резервирования
Минусы: долгое время восстановления, часто требует ручного развёртывания
⚪️Гибридные решения (Hybrid DRP) - комбинация горячего и холодного резервирования, когда инфраструктура развернута в минимальном объеме, но для полноценного обслуживания пользовательского трафика требуется масштабирование ресурсов
Плюсы: стоимость меньше чем у полноценной площадки
Минусы: требует больше времени на развертывание, чем горячий резерв
🔥Давайте зафиксируем ключевые понятия при аварийном восстановлении, которые пригодятся нам при анализе ситуации:
RTO (Recovery Time Objective) - Максимальное время простоя после аварии
RPO (Recovery Point Objective) - Максимально допустимая потеря данных (например, данные за последние 15 минут, 1 час, 24 часа)
MTTR (Mean Time to Recovery) - Среднее время восстановления после сбоя
MTBF (Mean Time Between Failures) - Среднее время между сбоями
Читать дальше: Часть 3: DRP по шагам
#полезныематериалы #DRP @downtime_bar
Post #178
534

- 🔥 6
- 👌 1
- 💯 1