14 июля Cloudflare случайно сделал изменение в настройках своей системы, из-за чего сервис 1.1.1.1 перестал работать на краевых серверах (тех, что ближе к пользователям).
Это привело к тому, что определенные пользователи не могли заходить в интернет примерно 62 минуты. Также были сбои в работе других услуг, таких как Gateway DNS. Снижение запросов заметили по всем протоколам (UDP, TCP, DNS over TLS).
➖ Причина:
6 июня в настройках системы появилась ошибка. Тогда это не повлияло на работу, потому что изменение касалось новой, ещё не запущенной функции (DLS). Но 14 июля, когда добавили тестовый центр данных в эту систему, старая ошибка "ожила". Из-за этого маршруты были переключены только на офлайн-центр, и сервис стал недоступен по всему миру. Это не было атакой или взломом, а просто человеческой ошибкой в настройках.
➖ Cloudflare пообещала:
1. Улучшить управление настройками, чтобы ошибки не оставались незамеченными.
2. Постепенно заменить старые системы на новые, более надёжные.
3. Добавить проверки, которые помогут избежать подобных ситуаций.
👉 Читайте подробнее
Этот случай показал, что даже маленькая ошибка в настройках может вызвать большой сбой. Cloudflare работает над тем, чтобы сделать интернет стабильнее, и этот урок поможет им лучше справляться с такими проблемами в будущем.
@DevOpsKaz 😛
