ИИ Speculative decoding: зачем большой модели черновик от маленькой?
Наруто пишет вперёд четыре токена, Саске проверяет их все сразу и отбрасывает всё после первой ошибки. Так большая модель делает меньше дорогих проходов, а ответ получается точно таким же, как без ускорения. На этом трюке держится быстрый инференс у многих современных LLM.
https://www.youtube.com/shorts/rmWJggFfco0
Post #2018
425