MTP спекулятивный декодинг в Gemma 4: ускоряемся в два раза без потери качества 🥳
В нашу дорогую гемму наконец завезли спекулятивный декодинг, когда более маленькая модель предсказывает токены, которые могут верифицироваться большой моделью параллельно, существенно ускоряя инференс для локальных юзкейзов.
Попробовать можно через HuggingFace transformers, остальные движки тоже скоро будут поддерживать. Поглубже почитать как реализовано можно в твиттер-посте.
блогпост
Post #344
8.94K

- 🔥 49
- ❤ 11
- 👍 1