Кстати, если вы когда-нибудь озадачивались подсчетом ресурсов для развертывания LLM локально или на сервере, то у меня для вас есть калькулятор https://smelukov.github.io/WeightRoom/
Позволяет понять "влезет или не влезет моделька на мое устройство и какой TPS я получу" или сравнить разные хостинги по цене и TPS (token per second) чтобы выбрать наиболее подходящий
Вот пример расчета для Google Gemma 4 31B с 4-битной квантизацией на Macbook Pro M1 Max (да, 11 tps не так уж и быстро, но работает, проверено)
Можно даже вот такие красивые картиночки и бейджики генерить 😁
Post #130
730

- 👍 3
- 🔥 3