MTP или Multi-Token Prediction - это сейчас обсуждают все любители локальных LLM.
Проще говоря это ускоритель для вашей локальной модели, в моем случае Qwen 3.6 - 27b Q6_K_XL. Было 45 т/с - стало 75-80 т/с.
В этом видео я протестировал новинку:
https://youtu.be/IMOXiSjXKHo
Пишите свое мнение в комметарии. А также подписывайтесь на НАШ ЧАТ, где народ делится интересными промтами.
Приятной генерации и быстрых токенов!
Post #100
2.51K