TGViewer
Data Science | Machinelearning [ru] Data Science | Machinelearning [ru] @devsp · 19.8K subscribers
Post #5846 1.92K
💡 753B на одной видеокарте: разбор FreeToken

FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang.

Главный инсайт: вопрос не в железе, а в софте. На ноутбучной RTX 4060 с 8 ГБ и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде.

Запустить AGI на слабом железе

👉 Читать разбор
  • 👍 3
  • 🔥 1
More from @devsp
  1. Sep 24, 2026Методология нейрослопа Нейронки прилипли к нам всерьёз и надолго. Снеси завтра OpenAI, Ant…
  2. Sep 24, 2026Ещё пачка бесплатных LLM API: кто врёт, а кто реально отдаёт токены Халявный доступ к LLM…
  3. Sep 23, 2026Код клепается в разы быстрее — а проекты как стояли. Куда утекло ускорение? Александр Саха…
  4. Sep 23, 2026Модель в курсе, что она не в курсе? Как психология 70-х прокачивает твой prompt engineerin…
  5. Sep 23, 2026Гига Писарь: что там за полторы недели после дебютной статьи Автор говорит: с момента выхо…
  6. Sep 22, 2026Китай в отпуске — DeepSeek дешевеет Прикинуть, во сколько реально встаёт использование Dee…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →