TGViewer
Анализ данных (Data analysis) Анализ данных (Data analysis) @data_analysis_ml · 50.7K subscribers
Post #5597 4.4K

Forwarded from Python/ django

🔥 Kimi K3 на 2,78 ТРИЛЛИОНА параметров запустили на CPU с 8 ГБ RAM. Без GPU, BLAS и фреймворков

Проект kimi-k3-in-c реализует inference Kimi K3 практически с нуля на portable C99. Чекпоинт модели занимает 1,56 ТБ, но пик RAM при запуске составил всего 8,24 ГБ.

Фокус в MoE и стриминге весов. Из 896 экспертов на токен выбираются только 16, а остальные веса не обязаны постоянно лежать в оперативной памяти. Огромная часть модели читается прямо с диска, поверх этого работает LRU-кэш экспертов.

Цена такого трюка очевидна: скорость. При 8 ГБ RAM автор получил около 26,5 секунды на токен, при 64 ГБ уже 19,8 секунды, а на машине с 128+ ГБ, где нужные данные помещаются в память, около 5,6 секунды.

Получается любопытная смена ограничения: гигантскую MoE уже можно заставить работать без серверной фермы. Вопрос теперь скорее в том, сколько диска и времени на токен вы готовы отдать за такой inference.

github.com/FareedKhan-dev/kimi-k3-in-c

#AI #Kimi #LLM #C #LocalAI
  • ❤ 18
  • 🤣 14
  • 👏 11
  • 🥰 2
  • 🤔 2
  • 🤯 2
More from @data_analysis_ml
  1. Sep 24, 2026📊 Когда один аналитический вопрос превращается в квест по нескольким системам Продажи — в…
  2. Sep 24, 2026✔️ Halo ускоряет обучение LLM до 2,8 раза Halo это open-source фреймворк для обучения язык…
  3. Sep 24, 202630 сентября — AI Native People: вечер для тех, кто в реальном времени строит AI! 😉 Сбер п…
  4. Sep 24, 2026⚡️ Claude помог ускорить собственный интерфейс втрое за две недели Anthropic рассказала, к…
  5. Sep 23, 2026✔️ Alibaba предложила производителям смартфонов агентную платформу Команда Qwen представил…
  6. Sep 23, 2026photo post
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →