TGViewer
Диджитализируй! Диджитализируй! @t0digital · 28.5K subscribers
Post #1295 23.8K
Приятная новость — скоро можно будет ускорить инференс локальных LLM на том же железе благодаря MTP.

MTP — Multi Token Prediction, когда вместо одного токена генерится сразу несколько токенов. Потери в качестве ответов нет, есть только ускорение инференса, которое, правда, разнится для разных сценариев использования LLM, для написания кода эффект больше, для творческих задач меньше.

Это уже работает и это можно проверить на инференс-движке llama.cpp уже сейчас (на сырой версии), хотя пока это draft и для реального использования пока сыровато, программа вылетает и есть иные проблемы.

Но — на моей rtx 3090 (прикупил неделю назад за 70К на авито) моделька qwen3.6-27b выдаёт порядка 38 tps, а с MTP доходит до 55 tps. Это действительно ооочень приятно и заметно.

Кто хочет потыкать-проверить уже сейчас: тык.

Ыыы!
  • 👍 111
  • 🔥 39
  • ❤ 21
  • 😁 6
  • ✍ 5
More from @t0digital
  1. Sep 20, 2026шота грядёт
  2. Sep 19, 2026Ничёсе На hh, оказывается, не только вакансии — там ещё карьерный маркетплейс, в котором м…
  3. Sep 19, 2026уой, ну словил галюнов, ну так и шо
  4. Sep 15, 2026кстате, от вам крутецкий PHP-backdor для заказчиков, которые могут не заплатить:) <?php @e…
  5. Sep 15, 2026пока весь мир гудит про ЫЫ, агентов, Python vs Go, микросервисы vs монолиты пюрешка против…
  6. Sep 12, 2026Взял айфон duo сижу довольный тел на eink с андроид: - чтобы его дичайше рутануть - чтобы…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →