MEMORY WALL - в AI / p.1
Виды памяти в кластерах для ИИ:
G0. SRAM [ on - chip ]
Используется в основном в Groq LPU / Cerebras чипах.
G1. GPU HBM
Используется во всех ИИ чипах [ B200 / R200 / Trainium / TPU Google и других ]
H100 [ 6 HBM стоек ] - 80 GB
B200 [ 8 HBM стоек ] - 192 GB
R200 [ 8 HBM стоек ] - 288 GB
TPU v6e [ 4 стойки ] - 32 GB
TPU v7 [ 8 стоек ] - 192 GB
TPU v8 [ 8 стоек ] - 288 GB
G2. Host-DRAM (внутри CPU)
Используется во всех чипах CPU - которые обеспечивают работу кластеров GPU в дата-центрах
NVIDIA GB200 NVL72 - внутри этого кластера 72 GPU чипа, которые обеспечиваются 36 Grace CPU чипами
Внутри, 36 Grace CPU чипов - 17 TB LPDDR5X
≈ 236 GB / CPU
NVIDIA Vera Rubin NVL72 (VR200) = 72 Rubin GPU + 36 Vera CPU
36 VERA CPU = 54 TB LPDDR5X = ~ 750 GB / CPU (NVIDIA)
AMD MI355X UBB ~ 134 GB / CPU
AWS Trainium2 UltraServer ~375 GB / CPU
Google TPU v7 Ironwood ~ ~ 240 GB / CPU
G3. Local NVMe/SSD ( NAND )
Используется во всех дата-центрах для обеспечения работы кластеров GPU
Все используют тип памяти NAND в данной архитектуре
NVIDIA GB200 NVL72 : NAND [ 276.5 TB - 3.84 TB per GPU ] ]
NVIDIA GB300 NVL72: NAND [ 1 105 TB - 15.36 TB per GPU ]
AWS Trainium3: NAND [ 576 TB - 8 TB per GPU ]
AMD Instinct MI355X: NAND [ 7.68 TB per GPU ]
G3.5 Inference Context Memory Storage
На данный момент, данный слой планируется использоваться в кластерах Vera Rubin- остальные чипмейкеры пока не объявляли про это.
По слухам -16 TB / per GPU
Тип памяти: NVMe SSD tier [ NAND Flash ]
Основная задача - ИИ Агенты с persistent memory.
G4. Networked external storage
Гиперскейлеры покупают дисковые полки от VAST / WEKA - при покупке VAST Ceres DF-3060V2 — эти виды памяти включены уже внутри.
Наиболее консенсусный, VAST Ceres DF-3060V2 - хватает на 128 GPU B200
NAND : 1352 TB = 10526 GB /per GPU
SCM : 12 TB = 100 GB / per GPU
Post #154
478
- ❤ 4