Пробовали Groq или Cerebras для инференса?
Скорость генерации там такая, что привычный трейдофф "размер модели vs скорость ответа" исчезает. Обычно для быстрого инференса приходится брать модель поменьше. А тут берёшь большую и всё равно получаешь быстрые ответы.
Причём:
1. Можно взять модель побольше без потери в latency
2. Можно позволить себе test-time compute: chain-of-thought, best-of-n, больше токенов на ризонинг
Из минусов — моделей поддерживают совсем немного и цена чуть выше. Но попробовать однозначно стоит ⌨️
Post #151
1.45K
- 👍 6
- ❤ 3