В последние сутки в Твиттере и на LocalLLaMA кажется нет ничего, кроме обсуждения groq (с q на конце). Все потому, что groq сервят Mixtral со скоростью вплоть до 500 токенов в секунду, пока конкуренты типа Together.ai не успевают за это время сгенерить 70
Секрет успеха тут в том, что groq уже много лет разрабатывали процессоры, которые должны составить конкуренцию NVIDIA, по крайней мере в области сервинга LLM. Собственно поэтому название для них затрейдмаркали как Language Processing Unit
Вот тут есть хороший разбор про то, как устроена архитектура их карточек. Я, как не самый большой эксперт в железе, почерпнула из него только идею, что эти процессоры оптимизированы именно для сервинга моделей, поскольку они гораздо реже перекладывают веса из RAM на сами чипы. А еще похоже их GroqCard уже продаются за 20 тысяч бачей. Если у вас нет таких денег, то их демо пока еще бесплатное – https://groq.com/
Хотя какой-то breakthrough у них случился только сейчас, groq как торговая марка был зарегистирован оказывается уже 7 лет назад (видимо в ту же секунду, как вышла Attention is all you need). А еще основали компанию те же люди, что разрабатывали TPU в Google 🤯
Post #1003
6.45K
- 🔥 38
- ❤ 8
- 🤯 5
- 👌 4
- 👍 2
- 🥴 1