Я очень жду NVIDIA Rubin.
Это следующее поколение GPU после Blackwell, и там главный апгрейд для LLM - не сколько compute, а скорость памяти.
Сейчас decode-инференс часто упирается в HBM bandwidth: на каждый новый токен надо снова читать веса модели из памяти. У Rubin заявлено около 22 TB/s на GPU против 3.35 TB/s у H100 и ~8 TB/s у B200.
То есть для memory-bound inference это может быть около 7× к H100.
Для обучения тоже большой скачок: NVIDIA обещает до 4× меньше GPU для MoE training vs Blackwell.
Плюс CMX - по сути SSD прямо на видеокарте с быстрым доступом для KV-cache/long context. Если это нормально заработает, LLM смогут стать быстрее, больше или дешевле в инференсе (или всё вместе) уже в этом году
Post #274
1.86K


- 🔥 16
- ❤ 6
- 👍 2