TGViewer
КПД КПД @quant_prune_distill · 3.49K subscribers
Post #759 1.47K
🔬 Метод и эксперименты

📚 В качестве бенчей берут стандартную выборку задач на математику (AIME, LiveMath), программирование, знания (MMLU-Pro) и агентские бенчи (GAIA, CyBench).

🤖 Сравнивают Claude, GPT, Gemini, Kimi и Minimax.

💰 Замечают, что конечная стоимость включает в себя обработку промпта, генерацию, а также кэширование.

📈 Причина обнаруженного явления довольно проста — более слабые модели часто генерируют больше токенов. Особенно заметен эффект на MMLU-Pro, где крупные фронтирные модели выдают ответ почти сразу, а маленькие запускают цепочки рассуждений на десятки тысяч токенов.

⚡ На ArenaHard явление выражено слабее всего.

🧠 Вероятность price reversal (ожидаемо) зависит от сложности задачи. Простые задачи даже слабые модели решают быстро, а с ростом сложности «малютки» закапываются в многошаговые рассуждения и совершают много лишних действий.

📌 Выводы

Мораль такова: не всегда более дешёвая по API модель оказывается дешевле в итоге, даже если корректно решает задачу.

Впрочем, рекомендация давать простые задачи более слабым моделям, а более сложные — сильным, очевидна и без этой работы. Вопрос лишь в том, как нащупать эту грань.
  • ❤ 6
  • 👍 3
  • 🤝 2
More from @quant_prune_distill
  1. Oct 5, 2026Теперь уже даже время прочтения блога это ориентир не для человека, а для LLMки. https://r…
  2. Oct 4, 2026"Горячие" эксперты
  3. Oct 4, 2026photo post
  4. Oct 1, 2026🛠 Метод Типичный scaling law имеет вид: L(N, D) = A N^α + B D^β + c 🔄 Скейлинг по рекурс…
  5. Oct 1, 2026Scaling Laws for Looped Mixture of Experts 📄 Статья Есть MoE, которые как-то скейлятся (п…
  6. Sep 29, 2026⚙️ Метод На префилле имеем дело с тяжёлыми матричными умножениями, поэтому для ускорения ц…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →