🤭 Claude Code стал использовать в 3 раза меньше токенов после одного изменения:
Было: 10.4M токенов · 10 ошибок · $9.21
Стало: 3.7M токенов · 0 ошибок · $2.81
Причина не в модели.
Проблема в том, как бэкенд отдает информацию агенту. Когда контекст неполный, более сильная модель не игнорирует этот пробел.
Она тратит больше токенов на рассуждения о недостающем контексте, запускает больше исследовательских запросов и чаще уходит в ретраи. Поэтому нехватка контекста не исчезает с переходом на более сильную модель — она просто начинает обходиться дороже.
Вот разбор, почему бэкенды становятся поглотителем токенов для агентов, как выглядит альтернативная архитектура и какая разница по стоимости получается на реальном проекте.
*В качестве слоя контекстной инженерии использовались Insforge Skills + CLI (open-source, локально)
Post #3043
12K