🛠 Samsung утроила скорость Llama, перенеся вычисления в память
В тесте Llama 3.1 8B на контексте 320 токенов система с LPDDR5X-PIM выдавала 81,3 токена в секунду против 27 у обычной LPDDR5X. Samsung разместила вычислительные блоки в каждом из 16 банков памяти: матрично-векторные операции идут рядом с данными, и ускорителю нужно передавать меньше информации.
Внешний интерфейс LPDDR5X даёт 76,8 ГБ/с, а суммарная внутренняя пропускная способность PIM-блоков — около 614 ГБ/с. Но это не восьмикратное ускорение всей системы: дополнительные 614 ГБ/с доступны только самим PIM-блокам и для поддерживаемых операций в форматах FP8, INT8 и INT4. Подробности теста и устройства — по данным Habr.
LPDDR5X-PIM вмещает 16 ГБ, а её корпус на 561 контакт соответствует стандарту JEDEC. Однако пока это демонстрация технологии, а не серийный модуль, который можно заказать и поставить в прод.
Я бы оценивал PIM не по максимальной пропускной способности, а по доле операций, которую реально удастся оставить внутри памяти. Если модель упирается в другие узкие места, дополнительные вычислительные блоки останутся дорогой функцией на бумаге.
#Samsung #LPDDR5XPIM #Llama31 #PIM #Инференс
Post #328
4