Это просто должно быть тут 😁
Очередной анонс сближения локального инференса с миром задач фронтирных моделей. Qwen3.8-flash-next
Для понимания - эта модель всего на 125 миллиардов параметров. Да, цифры кажутся немаленькими, но ровно до тех пор пока не посмотришь на метрики, а там она подаёт уверенную заявочку в топ лидеров (см скриншот).
Модель в стоке весит 360GB, но это MoE модель c активными 6 млрд., что значит часть весов можно размазать на оперативе с инференсом на CPU/RAM. Сколько токенов в секунду будет это чудо отдавать на сетапе 4xRTX3090, я пока сказать не могу, т.к. оператива на рынке жуть как дорогая, да и Qwen3.8-27B покрывает почти 90% моих повседневных задач.
Отдельного экстаза заслуживает стоимость модели: вход за 0.16$/1M; выход за 0.47$/1M;
Кстати, в последнее время в личку стали поступать вопросы по моему серверу для работы с локальными моделями, накидайте лайков если актуально - напишу отдельную статью с подробным обзором на все железо!
Post #8
210

- 👍 6
- 🌭 2
- 💯 1