🔖 Архитектура GPU для тех, кто работает с LLM-инференсом
В руководстве разбирают, как современные GPU реально исполняют код и почему без этого сложно осмысленно оптимизировать ядра.
Основной фокус — NVIDIA и CUDA: execution model, occupancy, shared memory, конфликты банков и другие вещи, которые напрямую влияют на производительность инференса.
⛓ Ссылка на руководство
tags: #полезное
➡ Data Scientist | Чат
Post #1112
202

- ❤ 1
- 👍 1
- 🔥 1