Токен перестал быть нормальной единицей сравнения моделей.
Две модели могут решить одну и ту же задачу, но одной понадобится 5 000 токенов, а другой - 50 000+. Добавьте разные токенизаторы, скрытые reasoning-токены, tool calls и повторные попытки — и метрика
$ / 1M tokens уже почти ничего не говорит о стоимости реальной работы.Для AI-агентов проблема ещё заметнее.
Если первый шаг сгенерировал слишком много текста, этот результат часто становится входом для второго шага, затем попадает в третий, четвёртый и дальше.
Поэтому модель, которая использует в 2 раза больше токенов, может обойтись значительно дороже, чем просто ×2:
- растёт контекст;
- увеличивается latency;
- дорожают следующие reasoning-шаги;
- растут расходы на tool calls и retries.
Чем длиннее агентный workflow, тем важнее token efficiency.
Гораздо полезнее считать:
полная стоимость модели + reasoning + tools + retries / число успешно выполненных задачТо есть сравнивать модели не по цене токена, а по стоимости успешно выполненной задачи при нужном качестве.
https://x.com/Machinelearrn/status/2095817451699130868
