TGViewer
КПД КПД @quant_prune_distill · 3.49K subscribers
Post #803 2.16K
Некий стартап LithosAI предлагает сверхбыстрый инференс моделек у себя.

Обещают 800 токенов в секунду (на одного юзера) против 150 у другого стирального порошка других провайдеров.

При этом это все гоняется не на специализированных чипах Cerebras, а на какой-то обычной стойке из 8 B300.

В чем секрет такой выдающей скорости, не раскрывают, утверждают, что все дело в мегаэффективном движке инференса. По всей видимости основной фактор, определяющий latency, здесь - low-batch serving. И, само собой, удовольствие не дешевое, и чтобы не травмировать психику потенциальных юзеров, цену за мильон токенов не разглашают.
  • 👀 8
  • 😁 4
More from @quant_prune_distill
  1. Oct 4, 2026"Горячие" эксперты
  2. Oct 4, 2026photo post
  3. Oct 1, 2026🛠 Метод Типичный scaling law имеет вид: L(N, D) = A N^α + B D^β + c 🔄 Скейлинг по рекурс…
  4. Oct 1, 2026Scaling Laws for Looped Mixture of Experts 📄 Статья Есть MoE, которые как-то скейлятся (п…
  5. Sep 29, 2026⚙️ Метод На префилле имеем дело с тяжёлыми матричными умножениями, поэтому для ускорения ц…
  6. Sep 29, 2026🧩 Disaggregated Quantization: Specializing LLM Prefill and Decode 📄 Статья Обычно для пр…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →