🦾 Подключать, чинить и поддерживать серверы
Меня зовут Володя Аксёнов, я руковожу IT-поддержкой одного из дата-центров Яндекса. Дата-центры — это часть внутренней инфраструктуры Яндекса, Yandex Infrastructure. Я в компании уже 10 лет и хочу поделиться, как начинался мой путь (кстати, сюда я пришёл после работы сетевым администратором в лётном училище).
🅰️ Первая авария
Когда мой испытательный срок только-только закончился, в дата-центре сломалась важная железка, и московскому сетевому инженеру нужна была помощь с её ремонтом. Никто из коллег не смог выехать, и остался только я.
В два часа ночи мне позвонил руководитель, через 20 минут я был на месте — и до семи утра мы с сетевым инженером чинили коммутатор ядра. Перебрали все возможные варианты и в итоге... не починили. Пришлось решать вопрос с вендором.
Но знаете что? В процессе у меня возникло чувство, что я спасаю весь большой Яндекс. И после этого всё постепенно стало становиться мне родным и знакомым 😌
🅰️ Первая большая задача
В то время сети были не очень скоростные, поэтому у нас стояли два коммутатора агрегации, которые обслуживали весь дата-центр, но не соприкасались между собой. Мне нужно было поставить новый большой коммутатор и сделать сеть, которая проходила бы в каждый свитч и каждую стойку в дата-центре. В итоге я разработал схему, протянул провода из коммутационной в кластер и всё задокументировал.
Это поручение мне запомнилось и понравилось, потому что здесь у меня появилось первое творчество. И я мог сам решить, как это размножить на простые операции и в какой момент подключить коллег.
Дальше все мои задачи были связаны с изменением конфигураций: запускал всевозможные модули, ставил серверы, делал апгрейды. Также я часто оставался за руководителя в его отсутствие.
🅰️ Первые изменения
Мы начали развивать инцидент-менеджмент. У меня не было достаточных знаний в этой области, потому что моя сильная сторона — это не поломки, а планирование работы над большими задачами. В итоге мы сначала подготовили человека под эту должность, а потом перестроили структуру отдела.
Я предложил поделить команду на две группы. Теперь у нас есть инцидент-менеджеры и менеджеры по проектному планированию. И этот опыт переняли и в остальных дата-центрах Яндекса, поэтому у нас практически нет универсалов: смотрим на навыки и бэкграунд кандидата и распределяем его в одну из команд.
🅰️ Первый регламент
Я в своё время не знал, что такое фазные группы на колодках распределения питания. А когда понял, было уже поздно: отключился весь дата-центр. Причём по старой документации всё было правильно, нагрузку по фазам я распределил. Но не учёл, что в каждой фазе есть две фазные группы.
Так что потом я, как виновник торжества, разрабатывал регламент подключения оборудования на критической инфраструктуре.
⏩️ Читайте полную статью в блоге о работе в Яндексе. Там я также рассказал, чем на самом деле занимаются инженеры в дата-центрах, например как учат новичков, кто чинит все поломки и что такое Emergency team. И поделился парочкой забавных историй: про капсулу времени и сосиски для проверки дисковых полок.
Подписывайтесь:
💬 @Yandex4Developers
Post #1602
3.29K

- 🔥 11
- ❤ 7
- 👍 3