GitHub на неделе столкнулся с масштабным сбоем, который затронул разработчиков по всему миру и нарушил стандартные рабочие процессы. Ваши тоже, да? Разбираемся по порядку.
Все началось с проблемы с производительностью, которая переросла в глобальную деградацию большинства ключевых сервисов. Команда GitHub обнаружила источник и начала восстановление. Инженеры устраняли точечные проблемы с авторизацией, затрагивавшие Copilot и другие службы. Время сбоя составило почти 8 часов.
⚪️ Характер ошибок
В пиковые моменты сбоя проблемы наблюдались практически по всей экосистеме платформы:
- Веб-интерфейс и API: уровень ошибок (error rate) достиг примерно 20%.
- Скачивание файлов: загрузка архивов и необработанного контента репозиториев (raw repository content) столкнулась с 50% уровнем ошибок.
- Основные сервисы: сбои в работе Webhooks, API Requests, Issues, Pull Requests, а также систем автоматизации и тестирования GitHub Actions.
- AI-инструменты: нарушен доступ к GitHub Copilot.
- затронуты аутентификация SAML и OIDC, а также сервисы SCIM и Team Sync.
⚪️ Контекст и предпосылки
Официальные детали технической причины платформой пока не раскрыты, однако инцидент произошел на фоне следующих факторов:
- Взрывной рост AI-разработки: из-за нагрузки от AI-агентов и средств автонабора кода инфраструктура GitHub испытывает серьезное давление. В апреле CTO GitHub Владимир Федоров отмечал, что если осенью компания планировала 10-кратное расширение мощностей, то к февралю возникла необходимость проектировать масштабирование в 30 раз. Ранее 8 инцидентов с деградацией насчитали в июле, 6 —в июне.
- Переход в облака: Microsoft ускоряет перевод GitHub на Azure, а также использует мультиоблачную стратегию, аренда мощностей у AWS.
- Предположения экспертов: аналитики также указывали на сетевые инциденты на стороне AWS.
@DevOpsKaz 😛
