Google выпустили MTP-драфтеры для своей модели, которые позволяют ускорить генерацию токенов до 3x раз без потери качества.
Работает это так: рядом с основной моделью запускается маленькая вспомогательная, которая быстро угадывает несколько следующих слов. Большая модель проверяет их за один проход — если угадала верно, принимает всё сразу.
Поддерживаются все размеры Gemma 4: от мобильных E2B/E4B до 31B для локального запуска.
Веса уже на Hugging Face и Kaggle, лицензия Apache 2.0.
@ai_for_devs
