TGViewer
Анализ данных (Data analysis) Анализ данных (Data analysis) @data_analysis_ml · 51.1K subscribers
Post #4999 4.79K
⚡️ Prefill-as-a-Service предлагает пересобрать инференс

В статье (авторы Kimi.ai) разбирают, почему держать Prefill и Decode в одном процессе невыгодно, и как это разнести без потерь.

Любой ответ модели начинается с Prefill. Модель читает весь вход и строит внутреннее состояние. Дальше идёт Decode. Пошаговая генерация токенов.

Эти этапы ведут себя по-разному. Prefill короткий, но тяжёлый по вычислениям. Decode долгий и чувствительный к задержкам. Когда они сидят на одном GPU, часть ресурсов простаивает.

В статье предлагают вынести Prefill в отдельный сервис. Его можно крутить на других узлах или в другом дата-центре. Decode оставить ближе к пользователю, где важна задержка на токен.

Авторы упирались в KV cache. Он слишком большой, чтобы гонять его по сети без ощутимых накладных расходов. Но в статье показывают, что при оптимизации представления KV это становится практичным.

На практике это даёт более быстрый первый токен и лучший throughput. Появляется возможность подбирать железо под конкретный этап, а не под весь пайплайн сразу.

Инференс перестаёт быть привязанным к одному месту. Его можно разнести, как обычный сервис. И дальше оптимизировать уже не только модель, но и архитектуру вокруг неё.

Проверено на модели Kimi Linear, увеличенной в 20 раз:

• пропускная способность модели выросла в 1.54 раза
• P90 TTFT ниже на 64%.
• На выходе это напрямую конвертируется в более дешёвый токен.

https://arxiv.org/html/2604.15039v1
  • 👍 8
  • ❤ 4
  • 🔥 4
  • 🤔 1
More from @data_analysis_ml
  1. Oct 7, 2026🏦 ИИ-агенты могут лишить банки США преимущества стоимостью $500 млрд Механизм простой: аг…
  2. Oct 7, 2026🧮 Три часа вычислений на математический результат: самая неожиданная цифра в релизе OpenA…
  3. Oct 7, 2026📌 OpenAI выложила 722 математические работы своей внутренней модели Все статьи написала в…
  4. Oct 7, 2026🔎 Looped-модели научились экономить память: качество 12 блоков при KV-кэше на 4 Looped-мо…
  5. Oct 6, 2026⚛️ Google заключила атомную сделку на 20 лет Соглашение с Constellation позволит добавить…
  6. Oct 6, 2026🏅 Нобелевская премия по физике 2026 года присуждена Фрэнсису Хальцену За решающий вклад в…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →