Perplexity выложили в open source свой Unigram tokenizer, который снижает нагрузку на CPU в 5-6 раз.
Почему это важно: маленькие reranker- и embedding-модели уже работают на GPU за единицы миллисекунд. На этом фоне токенизация на CPU внезапно становится заметной частью общей задержки.
То есть модель может быть быстрой, GPU может простаивать минимально, но пайплайн всё равно тормозит на подготовке текста.
Что сделали:
• переписали Unigram tokenizer
• снизили CPU utilization в 5-6 раз
• ускорили инференс-пайплайны для rerankers и embedders
• выложили код в open source
GitHub: github.com/perplexityai/pplx-garden
Post #2774
4.26K

- ❤ 19
- 👍 14
- 🔥 10