Один из способов ускорить инференс LLM — это использовать спекулятивное декодирование (Speculative Decoding), чтобы оптимизировать генерацию ответа. Маленькая модель генерирует черновые токены, а большая — их валидирует. Причём чем длиннее принятый фрагмент, тем больше прирост к скорости работы.
В то же время, узкое место классического SD — фиксированный размер чернового окна. При разношёрстных запросах часть проверок проходит впустую, потому что где‑то черновики совпадают почти полностью, а где‑то ломаются уже на первом токене.
В эту пятницу специалист ML-команды Екатерина Синькова разберёт статью «TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding». Ее авторы предлагают способ динамически выбирать число генерируемых черновых токенов на основе батча запросов, чтобы максимизировать число принятых токенов.
Катя расскажет:
🛑как работает спекулятивное декодирование,
🛑как авторы «TETRIS» обошли проблему фиксированного чернового окна,
🛑как размер батча и запросы в нём влияют на количество генерируемых черновых токенов,
🛑как это влияет на инференс LLM на практике.
📅 Ждём всех в Толке в пятницу, 17 октября, в 15:00 (GMT+3).
🔗 Ссылка для подключения: Ктолк
#reading_group #llm #deployment
Post #41
2.51K

- ❤ 6
- 👍 3
- 🔥 2
- ✍ 1