Пока на праздниках отдыхаю периодически заглядываю на Хабр, и читаю интересные для себя статьи.
Одна из них вышла буквально вчера, где представлен краткий дайджест спекулятивного декодинга LLM.
Очень интересное направление развития генерации, которое сам разделяю, и о чем размышляю уже долгое время.
Если коротко говорить, при спекулятивном декодинге модель генерирует не по одному токену, а сразу последовательность.
Обычно контекст и так уже представлен в модели, поэтому разумно сразу выдать, например, «очень интересная статья», вместо «очень»-«интересная»-«статья». Что уже ускорит примерно в 3 раза выдачу.
Конечно, представленные в статье методы далеко не финальная точка в этом вопросе, но перспектива интересная и приятная.
Post #821
626
- ❤ 3