TGViewer
Телекоммуналка Телекоммуналка @telecommunal · 43.4K subscribers
Post #9259 7.51K
▶️ КПД ИИ-инфраструктуры падает из-за плохой связности.

Натыкаемся на статьи, в которых говорится о том, что компании платят огромные средства на развитие вычислительной инфраструктуры, а эффект «не тот». Копая чуть глубже оказывается, что с одной стороны маркетинг снова победил инженеров, а с другой «на Феррари пытаются ездить по пробкам».

Компании вкладывают большие бюджеты в кластеры из тысяч ускорителей для обучения крупных моделей, но производительность такой системы нельзя получить простым сложением мощности отдельных чипов. Чем больше устройств участвует в одной задаче, тем важнее, насколько быстро они обмениваются данными и как долго ждут друг друга.

Во время обучения модель обрабатывает потоки токенов, преобразуя их в векторы, проводя через слои трансформера, после вычисляет ошибку и обновляет параметры. Чтобы распределить эту работу между ускорителями, можно разделить между ними данные, слои модели или вычисления внутри слоя. Эти подходы решают разные задачи, но каждый требует обмена результатами или синхронизации в определенные моменты расчета. Если модель не помещается в память одного устройства, распределение ее частей становится необходимостью.

Передача данных при этом не обязательно проходит через центральный процессор. Ускорители в одном узле могут обращаться к памяти друг друга напрямую через высокоскоростные соединения. Между узлами обмен организуют через сетевые адаптеры и сеть кластера. Однако неотлаженная связность замедляет процессы.

Потери возникают не только из-за скорости передачи. Одни устройства могут закончить свою часть работы раньше других и ждать результатов, необходимых для следующего шага. При разделении вычислений внутри слоя такие ожидания могут повторяться многократно. При обучении на разных наборах данных ускорителям требуется синхронизировать результаты обратного прохода. Чем хуже распределена нагрузка и чем больше обязательных обменов, тем труднее превратить дополнительные ускорители в пропорциональный прирост производительности.

Поэтому важна топология кластера. Связь между близко расположенными ускорителями обычно устроена иначе, чем обмен между удаленными узлами. На результат влияют пропускная способность соединений, задержки, перегрузка сети и то, можно ли передавать данные одновременно с вычислениями. Между стойками может использоваться как Ethernet, так и InfiniBand.

Обновление отдельного канала само по себе не гарантирует ускорения. Если узким местом останется синхронизация, размещение модели или неравномерная загрузка устройств, выигрыш окажется меньше ожидаемого. Поэтому эффективность кластера нужно оценивать на конкретной задаче, а не только по сумме пиковых показателей его ускорителей.

Прежде чем расширять кластер, стоит понять, что именно сдерживает его текущую производительность. Иногда потребуются более быстрые соединения, иногда другая топология или настройка программного стека.

☎️ Телекоммуналка в Telegram | в MAX
More from @telecommunal
  1. Sep 29, 2026▶️ В ракетах «Союз-5» начали использовать процессоры «Эльбрус». К слову, об уже упомянутом…
  2. Sep 29, 2026▶️ Cloud․ru анонсировал еще одни облигации. Похоже, коллегам из Cloud․ru очень понравился…
  3. Sep 29, 2026▶️ Доставка по орбите. Мы поднимали тему дата-центров в космосе и вычислительной инфрастру…
  4. Sep 28, 2026▶️ Умельцы смогли запустить 5G на iPhone в России. Пока Apple разбирается с дырами в iOS 2…
  5. Sep 28, 2026▶️ МегаФон покрыл 5G вокзалы. Речь идет о Киевском и Ленинградском вокзалах Москвы и Моско…
  6. Sep 28, 2026▶️ СДЭК уходит в облако МТС. МТС Web Services стала технологическим партнером СДЭК. Логист…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →