TGViewer
aitamus aitamus @aitamus · 101 subscribers
Post #8 210
Это просто должно быть тут 😁
Очередной анонс сближения локального инференса с миром задач фронтирных моделей. Qwen3.8-flash-next
Для понимания - эта модель всего на 125 миллиардов параметров. Да, цифры кажутся немаленькими, но ровно до тех пор пока не посмотришь на метрики, а там она подаёт уверенную заявочку в топ лидеров (см скриншот).
Модель в стоке весит 360GB, но это MoE модель c активными 6 млрд., что значит часть весов можно размазать на оперативе с инференсом на CPU/RAM. Сколько токенов в секунду будет это чудо отдавать на сетапе 4xRTX3090, я пока сказать не могу, т.к. оператива на рынке жуть как дорогая, да и Qwen3.8-27B покрывает почти 90% моих повседневных задач.
Отдельного экстаза заслуживает стоимость модели: вход за 0.16$/1M; выход за 0.47$/1M;
Кстати, в последнее время в личку стали поступать вопросы по моему серверу для работы с локальными моделями, накидайте лайков если актуально - напишу отдельную статью с подробным обзором на все железо!
  • 👍 6
  • 🌭 2
  • 💯 1
More from @aitamus
  1. Sep 19, 2026Kimi готовит к выпуску 3.1. Эх, а слот свой я отдал, придется стоять в очереди
  2. Sep 19, 2026Одно из направлений куда я люблю вкладывать свое время - это создание комфортных условий д…
  3. Sep 18, 2026Доехала до меня подписка ChatGPT Edu. Кто не в курсе, наше Министерство образования запарт…
  4. Sep 17, 2026Тут маленький пример, задал вопрос в стиле "Как будет работать, если ...?". Все другие аге…
  5. Sep 17, 2026Интересный факт про prime-agent, этот тип всегда пишет код, прям всегда. По началу для мен…
  6. Sep 16, 2026Нежданчиком аккурат между двумя лидерами локального инференса прошлого поколения залетела…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →