Все мы сталкивались с такой ситуацией: кластер «под завязку», на СХД нет свободных портов, SAN — point-to-point (без коммутаторов), любое изменение рискует вырубить прод. А бизнес и начальство требует 100% доступности. Особенно болезненно, когда документация скудная, а хосты могут внезапно «не увидеть» LUN.
Решаем за 5 шагов (универсально для VMware, oVirt, KVM и др.):
⚪️Аудит
Полная инвентаризация, метрики (реальное потребление CPU/RAM/IOPS), карта зависимостей, точки отказа, проверка бэкапов.
⚪️Проектирование целевой схемы
Вводим FC-коммутаторы, dual-fabric, зонинг по WWPN (best practice IBM), добавляем хосты для возврата N+1.
⚪️Создаём запас ёмкости
Временно переносим нагрузку или отключаем тестовые стенды, чтобы было место для живой миграции. Цель — 15–20% буфера + N+1.
⚪️«Одно изменение за раз»
- Разворачиваем и настраиваем FC-коммутаторы
- По одному хосту: переводим в сервисный режим → мигрируем ВМ → перекоммутируем SAN → проверяем пути и LUN → возвращаем в кластер
- Всё тестируем на пилотном хосте заранее
⚪️Фиксация
Обновляем схему, CMDB, алерты на «красную зону» заполнения.
Как результат — бесшовное масштабирование без даунтайма, отказоустойчивость и возможность планового обслуживания.
@DevOpsKaz 😛
