🥶 Как положить европейский ЦОД из-за 60 метров кабеля.
Ребята из FirstVDS выкатили эпичный постмортем по своей локации в Амстердаме (Qupra DC2). Хостер честно расписал, как их локация легла на 58 часов, и не стал прятаться за "виноват дата-центр".
Сначала на крыше выходит из строя основной чиллер. Привозят резервный, кидают его на внешний дизель-генератор. Вроде починили основной - дизель увозят. И тут восстановленный чиллер окончательно отваливается. Ребут с инженером не помогает. Чтобы запитать резервный чиллер от щитка, нужно 60 метров силового кабеля. А ЕГО НЕТ. Ждали сутки, пока привезут, сидя на фрикулинге без компрессоров. Итог - 58 часов общего простоя, и заявленный SLA 99,95% фактически перестает действовать 😵
Ирония в том, что выбирать особо не из чего - и на железе, и на аренде. Продвинутые GPU-серверы прибавили 30-50%. Средний чек GPU-серверы - 2,3 млн, память в стратосфере, с арендой негусто, особенно в Москве. Площадки битком, а на весь регион не больше 1,4 тыс. стойко-мест.
Из неочевидного нашлось вот что. У Московского кластера видеоигр и анимации есть свой ЦОД, и они сдают выделенные GPU. Звучит странно - площадка под геймдев, анимацию и медийку, не самое очевидное место для H100, но почему бы и да? Для ориентира... аренда выделенного сервера с картами уровня RTX Ada 5000 или топовыми H100 обходится в среднем от нескольких десятков до сотен тысяч рублей в месяц в зависимости от конфига. От 1 до 8 карт на сервер, не шаренный.
Инженерку, естественно, полез чекать с охлаждения)) Изоляция горячих и холодных коридоров, прецизионники суммарно свыше 1 млн BTU. Питание - два независимых ввода, умные PDU, ИБП. Площадка на 21 стойку, но зато могут налить до 20 кВт на шкаф, SLA 99,95%.
Если своё железо уже есть, там же колокейшн - от размещения отдельных юнитов до аренды стойки 42U по вполне стандартным для рынка ценам.
Типичный 🥸 Сисадмин
Post #29474
8.99K
- ✍ 49
- 🤔 19
- ❤ 10
- 🔥 3
- 😁 3
- 💊 2
- ⚡ 1
- 👌 1
- 🤨 1