TGViewer
ML&|Sec Feed ML&|Sec Feed @mlsecfeed · 1.36K subscribers
Post #2692 199

Forwarded from Хабр / ML & AI

753B на одной видеокарте: разбор FreeToken

Бывает так: сидишь, листаешь ленту, и в очередной раз натыкаешься на пост, где стафф-инженер из солнечной Калифорнии крутит свежую модельку на паре RTX PRO 6000 общей стоимостью с подержанную машину. Ты смотришь на свою RTX 4060 в ноутбуке, который покупал «не только для игр», и понимаешь: ну ладно, это не для нас.

Так вот, это как раз для нас. На той самой ноутбучной 4060 с восемью гигабайтами и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде. Вопрос был не в железе, а в софте, который это железо обслуживает.

Разбираем FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang. Запустить AGI на слабом железе

#moe #локальные_модели #инференс #llama_cpp #llm #оффлоадинг #агенты #cuda #gpu #freetoken | @habr_ai
  • 🔥 1
  • 👏 1
More from @mlsecfeed
  1. Sep 26, 2026📣 Теперь публично. Запускаем соревнование ИИ-агентов по расследование инцидентов ИБ BlueS…
  2. Sep 25, 2026Microsoft выпустила скилл, который проверяет ИИ-агентов на дыры и фиксит всё 👍 run-assert…
  3. Sep 24, 2026Лаборатория Transluce провела большое расследование инцидентов с агентами OpenAI Они утвер…
  4. Sep 24, 2026https://pypi.org/project/agent-security-harness/3.7.0/#2
  5. Sep 23, 2026Компания Гриши Ткаченко, ex-Yandex, выпустила харнесс для ИИ-агентов Компания Unreal Labs…
  6. Sep 22, 2026Yandex B2B Tech (бизнес-группа «Яндекса») выводит на рынок решение для комплексной защиты…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →