Хочу рассказать про Groq (не путать с Grok от Маска).
Около года назад он жутко хайпавали, а месяц назад компанию оценили в $6 млрд — примерно как NVIDIA 10 лет назад, хотя прошлый год они произвели всего несколько тысяч чипов.
Groq делает Language Processing Unit - специализированные процессоры для быстрого инференса LLM.
На больших моделях они выдают сотни токенов в секунду. Для примера — перевод моего прошлого поста на английский OSS 120b сгенерил за ~300 мс. У ChatGPT на это время даже не успевает рассчитаться KV-кеш и выйти первый токен.
Главная особенность — веса и KV-cache хранятся в большой SRAM прямо на чипе (~230 МБ на LPU) плюс небольшой объём сверхбыстрой регистровой памяти.
Модель разбивается на много LPU, и данные идут по стриминговому пайплайну — без постоянных обращений к внешней памяти.
Почему это важно: основное узкое место LLM — это доступ к памяти, а не вычисления.
На GPU:
1.Загрузить Q для нового токена из HBM
2.Загрузить K,V cache из HBM
3.Вычислить attention scores
4.Загрузить выходные проекции из HBM
5.Сохранить результат в HBM
На Groq LPU:
1.Q уже в SRAM в предопределённом месте
2.KV-cache тоже в SRAM, адреса известны заранее
3.Вычисления идут через streaming pipeline
4.Результат сразу передаётся в следующий слой без записи в память
Chat gpt мне привела интересную аналогию
• CPU — ресторан с поваром-универсалом
• GPU — кухня с несколькими поварами
• LPU — конвейер по сборке бургеров в McDonald’s, где каждый знает свою операцию и делает её за доли секунды.
Что бы все это попробовать не обязательно покупать/арендовать чип, есть облако, продающее токены
https://groq.com/
Post #164
2.51K

- ❤ 19
- 🔥 15
- 🤩 4
- 👍 1