TGViewer
Дратути Антон Дратути Антон @blog_toxa · 4.33K subscribers
Post #548 2.41K
Tomahawk (Spectrum-X) + CPO = New Era of AI

На выходных познакомился с удивительными и дивными словами. Давайте и вам расскажу.

Вспоминал всевозможные виды параллелизмов при обучении модели. И каждый раз я прихожу к нагружающей сеть (не нейронку) операции All-to-All (например, в MoE, чтобы токены попали в своих экспертов). И решил я значит узнать, а чего вообще в мире происходит с инфраструктурой сети. И оказывается там такое ВАУ!

Давайте с вами представим, что мы прекрасные обладатели стоек NVIDIA GB200 NVL72. Для простоты их будет 3-4, но в реальности их сильно-сильно больше нужно. И внутри этой стойки всё хорошо (условно), карточки между собой общаются через NVLink Switch Tray, скорость вроде порядочная. Но если вдруг необходима стала связка из нескольких стоек, то тут беда.

Как это происходило долгое время: рядом с GPU в сервере стоит сетевая карта, к ней подключается оптический трансивер (Optical Transceiver), который переводит электрические сигналы в свет, дальше всё летит в свитчи и обратно. Бутылочные горлышки тут очевидны:
1. Лишние преобразования из электричества в свет (жрут кучу энергии, добавляют задержки, да и по железу стоят дорого);
2. Слабые свичи.

Со свичами, оказывается, проблем нет уже лет 5: последние версии Tomahawk от Broadcom умеют выдерживать 100+ Tbit/s. Ребята (не факт, что сами broadcom) придумали Co-Packaged Optics (CPO) — технологию размещения оптических элементов близко к кристаллу. Более того, последние варианты предполагают размещения прям под кристаллом, что позволяет достигать сумасшедших скоростей. Сейчас уже появился Spectrum-X от NVIDIA, можно его поставить, если деньги есть.

Вот с GPU давайте чуточку подробнее. На серверном стенде есть сетевая карта (что-то типа ConnectX-7), которая работает через Ethernet и InfiniBand. Чтобы обеспечить оптоволоконную связь, приобретается ещё приблуда — Optical Transceiver, которые обеспечивает преобразование электрического сигнала в оптический.

И вот сейчас приходят к тому, чтобы сетевая карта также была вместе с CPO. Тогда и приблуд покупать не нужно, и интегрировано надёжнее, работа быстрее. Если я правильно разобрался, именно к такому подходу пришли ребята в NVIDIA, когда разрабатывали Rubin.

НО! Можно пойти ещё дальше. А что если методом CPO мы интегрируем отдельные чиплеты прям на кристалл GPU? Этим занимаются, как минимум, ребята из Ayar Labs, в которых недавно вложились в т.ч. ребята из NVIDIA. Поговаривают в интернетах, что подобное решение уже появится в Rubin Ultra, посмотрим. Тогда вообще сетевая карта не нужна (насколько я понял) — всё уже происходит непосредственно на GPU чипе и невероятно быстро.

Итого, если деньги есть, главным фактором станет построение правильной топологии сети. И если всё будет классно, то обещается, что весь кластер можно будет рассматривать почти как одну большую единую GPUшку.

P.S. Если я тут набулшитил вообще неправильного, приходите исправлять!
  • 🔥 9
More from @blog_toxa
  1. Sep 19, 2026Post #580
  2. Sep 19, 2026Думал, хоть сегодня перестану следить за лимитами, а оно меня и здесь настигло 💀 Сегодня…
  3. Sep 18, 20264 года В рабочей суете совсем забыл, что недавно стукнуло 4 года, как я в Яндексе. А вспом…
  4. Sep 5, 2026photo post
  5. Sep 3, 2026MM Harness [1/x] Уже немало времени посвятил изучению мультимодальных харнесов. Если раньш…
  6. Aug 30, 2026Post #575
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →