TGViewer
DevOps для ДевоПсов DevOps для ДевоПсов @devo_pes · 3.21K subscribers
Post #7999 140
Как построить надёжную платформу для распределённого обучения

В Kubernetes-задачах Atlassian неисправный RDMA-плагин оставался в CrashLoopBackOff на всех подходящих production-узлах 271 день. Задачи без явного запроса RDMA продолжали работать через сокеты без ошибок, поэтому деградацию обнаружили случайно. В тесте переход на RDMA сократил медианное время шага с 12,36 до 6,07 секунды.

Платформа объединила RDMA-сеть, Lustre через CSI и ReadWriteMany PVC, привязку задач к нужным пулам узлов и gang scheduling: распределённая задача получает всех исполнителей сразу либо ждёт. Узлы с непройденной проверкой готовности не допускаются к планированию.

Практический вывод из разбора Atlassian для Cloud Native Computing Foundation: проверяйте не только статус задачи. Запускайте синтетическую нагрузку и фиксируйте транспорт, путь к хранилищу и полное время обучения.
More from @devo_pes
  1. Sep 27, 2026Как связать синтетические проверки с ошибками реальных пользователей в Grafana Cloud Синте…
  2. Sep 27, 2026Как RFC 9234 защищает от утечек BGP-маршрутов Настройте BGP Role на каждой eBGP-сессии по…
  3. Sep 26, 2026Как подключить VM KubeVirt к Metal3 через KubeVirtBMC KubeVirtBMC даёт виртуальной машине…
  4. Sep 26, 2026Как проверить качество телеметрии сервисов в Grafana Cloud Метрики могут поступать исправн…
  5. Sep 26, 2026Как перенести метрики на OpenTelemetry без массовой переделки сервисов Atlassian сохранила…
  6. Sep 25, 2026✨ Как настроить PostgreSQL для продакшен-нагрузок При переходе к продакшен-нагрузкам важно…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →