Приятная новость — скоро можно будет ускорить инференс локальных LLM на том же железе благодаря MTP.
MTP — Multi Token Prediction, когда вместо одного токена генерится сразу несколько токенов. Потери в качестве ответов нет, есть только ускорение инференса, которое, правда, разнится для разных сценариев использования LLM, для написания кода эффект больше, для творческих задач меньше.
Это уже работает и это можно проверить на инференс-движке llama.cpp уже сейчас (на сырой версии), хотя пока это draft и для реального использования пока сыровато, программа вылетает и есть иные проблемы.
Но — на моей rtx 3090 (прикупил неделю назад за 70К на авито) моделька qwen3.6-27b выдаёт порядка 38 tps, а с MTP доходит до 55 tps. Это действительно ооочень приятно и заметно.
Кто хочет потыкать-проверить уже сейчас: тык.
Ыыы!
Post #1295
23.8K
- 👍 111
- 🔥 39
- ❤ 21
- 😁 6
- ✍ 5