TGViewer
Machine learning Interview Machine learning Interview @machinelearning_interview · 30.3K subscribers
Post #2774 4.26K
Perplexity выложили в open source свой Unigram tokenizer, который снижает нагрузку на CPU в 5-6 раз.

Почему это важно: маленькие reranker- и embedding-модели уже работают на GPU за единицы миллисекунд. На этом фоне токенизация на CPU внезапно становится заметной частью общей задержки.

То есть модель может быть быстрой, GPU может простаивать минимально, но пайплайн всё равно тормозит на подготовке текста.

Что сделали:

• переписали Unigram tokenizer
• снизили CPU utilization в 5-6 раз
• ускорили инференс-пайплайны для rerankers и embedders
• выложили код в open source

GitHub: github.com/perplexityai/pplx-garden
  • ❤ 19
  • 👍 14
  • 🔥 10
More from @machinelearning_interview
  1. Sep 23, 2026⚡️ Агенты научились улучшать собственную обвязку RRSI оптимизирует не веса модели, а всю с…
  2. Sep 22, 2026Сразу три новых флагмана в гонке ИИ За несколько недель рынок получил GPT-6 Astra, Grok 4.…
  3. Sep 22, 2026🌟 Samsone: открытые аудиоязыковые модели для смартфонов Samsung опубликовали Samsone - се…
  4. Sep 22, 2026🚀 Claude Opus 5.5 — новый флагман Anthropic Anthropic обновила свою самую мощную модель.…
  5. Sep 22, 2026В субботу, 17 октября, Москва станет точкой притяжения для всех специалистов в области Rec…
  6. Sep 22, 2026Теренс Тао: «ИИ катком проходит по всей математике. Нам нужно замедлиться. Темп безумный».…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →