Как-то раз в общем трафике одной компании начался небольшой, но ощутимый процент ошибок и скачки латенси до 5 секунд. И мы отправились в чудесное плавание по инструментам observability, в попытках найти источник.
А он, сука, не ищется.
Разбираем цепочки вызовов, пытаемся выявить что-то общее, найти какую-то закономерность — логики никакой. Дебажили с утра до ночи, пошли поспать, и снова копать-ковырять.
Перекатывали сервисы из одного датацентра в другой, снимали дампы, выписывали списки откуда замечены ошибки — господи, да чего мы только ни пробовали!
Ни-Ху-Я. Вот прям Ни-Ху-Я не получается понять.
В сумме вовлекли, наверное, человек 30 разных технарей, под каждый камень залезли.
Пока в какой-то момент наугад вызванный инженер из датацентра не проверил стойку СХД. У одного из портов — физических таких, в которые провод вставляется — был “чуть неправильный уровень напряжения”. Выдернули шнурок из порта — ошибки ушли. Вставили обратно — ошибки вернулись.
Можно сколько угодно сидеть и править ямлики, но жизнь всегда оказывается богаче.
Post #451
4.2K
- 👍 42
- 🔥 27