Recurrent Drafter for Fast Speculative Decoding in Large Language Models
мы упоминали медузу, которая нехило ускоряет инференс ллм. а авторы из эпл решили пересмотреть парадигмы, которые внесли предыдущие авторы и получили ReDrafter
- драфтер от эпл авторов с одной головой (рнн), в отличие от параллельной медузы с несколькими головами
- у редрафтера рекурретная природа, что позволяет напрямую использовать бим серч, и это кстати позволяет использовать и другие техники, как rejection sampling & дефолт акцептование
- меняют статический разреженный tree attention на динамический, который работает чуть по-другому
а вот работает он красиво - из-за рекуррентной составляющей авторы так же сохраняют компьют тех токенов, которые уже были сгенерены, сделали свои фунцкии префиксного матча для этого, а уже потом идет процедура дерева аттеншна вместе с beam search
по скорости превосходит медузу, правда нету экспериментов с моделью размером 33b
код кстати очень даже хороший
👀LINK
Post #316
366



- ❤ 1