TGViewer
КПД КПД @quant_prune_distill · 3.49K subscribers
Post #702 2.49K
Занятный блог (не первой свежести, но от этого не менее интересный) от Horace He про замеры скорости матричного умножения.

Естественно было бы ожидать, что скорость матричного умножения не зависит от элементов в матрицах ибо сам алгоритм может определяться размерами матриц, спецификой железа, но не от значений.

Однако, бенчмаркинг показывает, что умножение матриц из одних нулей / матриц из одних единиц работает заметно быстрее, чем в случае, когда элементы сэмплируются из равномерного или нормального распределения (процентов на 20%) 😱.

Оказывается, дело в троттлинге. Если элементы постоянно меняются, то транзисторы каждый раз переключаются при подгрузке элементов, и, чтобы вписаться в лимит по энергопотреблению, GPUшка автоматически снижает частоты. Для матриц из одних и те же элементов переключения транзисторов нет - соотвественно, и нет троттлинга.

Для дальнейшей верификации гипотезы автор пробует разные распределения - матрицы из одних чисел пи, бинарные, тернарные матрицы. Чем более случайное распределение - тем медленнее операция перемножения.

Эффект становится еще более выраженным при ручном снижении порога энергопотребления.

При этом заявленная производителем скорость операций на практике не достигается.
  • ❤ 21
  • 😱 10
  • 👍 5
More from @quant_prune_distill
  1. Oct 6, 2026Совпадение? Не думаю!
  2. Oct 5, 2026Теперь уже даже время прочтения блога это ориентир не для человека, а для LLMки. https://r…
  3. Oct 4, 2026"Горячие" эксперты
  4. Oct 4, 2026photo post
  5. Oct 1, 2026🛠 Метод Типичный scaling law имеет вид: L(N, D) = A N^α + B D^β + c 🔄 Скейлинг по рекурс…
  6. Oct 1, 2026Scaling Laws for Looped Mixture of Experts 📄 Статья Есть MoE, которые как-то скейлятся (п…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →