Meta переписала транспорт RDMA с нуля под Ethernet и кластеры в миллион ускорителей
Коллективные операции вроде all-reduce синхронизируют тысячи ускорителей во время обучения, и темп всей задачи задаёт самая медленная передача. В инференсе задержка между шардами модели напрямую бьёт по времени ответа для сотен миллионов пользователей. Даже небольшое трение в сети замораживает заметные вычислительные мощности.
Проблема со стандартным RoCE в том, что он ожидает доставку каждого кадра по порядку, опирается на PFC и мешает распылению пакетов, которое как раз и даёт производительность в больших многоплоскостных сетях. MetaRoCE спроектирован с чистого листа под высокую пропускную способность, низкий хвост задержек и простоту эксплуатации по мере роста числа ускорителей и расстояний между ними.
Спецификацию, эталонную реализацию и набор тестов на соответствие выкладывают через Open Compute Project. Масштаб, на который это рассчитано: кластеры в сотни тысяч ускорителей, разнесённые по нескольким дата-центрам и регионам.
Post #2989
366