#железные_новости
🧠 Приехали... узкое место ИИ — уже не вычисления, а память 😳
Гонку за ИИ привыкли считать гонкой за GPU: у кого больше ускорителей, тот впереди. А тормозит все память — HBM. Ее мало, она дорогая, и производить ее умеют лишь пару краснокнижников.
💰 Обучение модели стоит как крыло самолета, но, к счастью, случается разово. Потом начинается инференс — и тут ускоритель зависит от того, как быстро данные приезжают к нему из памяти. Не успевает память — вычислительные блоки простаивают. GPU за миллионы сидит и ждет.
Купили большой кластер, а он половину времени раскладывает запросы по категориям — с этим справился бы кто попроще. Индустрия это заметила и вопрос (НАКОНЕЦ-ТО) сместился с «сколько докупить ускорителей» на «
почему уже купленные работают вполсилы».
🙂 Что делать вместо новых закупок:
• специализированные модели под конкретные задачи вместо одной гигантской;
• управление KV-кэшем и квантизация;
• планирование запросов и повторное использование вычисленного;
• системная память и локальное хранилище под инференс.
Короче говоря, времена, когда любую покупку железа оправдывали экспериментом, заканчиваются. Какие еще перемены грядут — читайте в
подробном материале.
📖
Сервер, сторадж & два свича💬
Мы в MAX 💙
VKontakte 📝
Дзен