🔬 Метод и эксперименты
📚 В качестве бенчей берут стандартную выборку задач на математику (AIME, LiveMath), программирование, знания (MMLU-Pro) и агентские бенчи (GAIA, CyBench).
🤖 Сравнивают Claude, GPT, Gemini, Kimi и Minimax.
💰 Замечают, что конечная стоимость включает в себя обработку промпта, генерацию, а также кэширование.
📈 Причина обнаруженного явления довольно проста — более слабые модели часто генерируют больше токенов. Особенно заметен эффект на MMLU-Pro, где крупные фронтирные модели выдают ответ почти сразу, а маленькие запускают цепочки рассуждений на десятки тысяч токенов.
⚡ На ArenaHard явление выражено слабее всего.
🧠 Вероятность price reversal (ожидаемо) зависит от сложности задачи. Простые задачи даже слабые модели решают быстро, а с ростом сложности «малютки» закапываются в многошаговые рассуждения и совершают много лишних действий.
📌 Выводы
Мораль такова: не всегда более дешёвая по API модель оказывается дешевле в итоге, даже если корректно решает задачу.
Впрочем, рекомендация давать простые задачи более слабым моделям, а более сложные — сильным, очевидна и без этой работы. Вопрос лишь в том, как нащупать эту грань.
Post #759
1.47K
- ❤ 6
- 👍 3
- 🤝 2