На что стоит обратить внимание:
При переходе на новую модель старые промпты тоже нужно пересматривать.
Инструкции, которые когда-то добавлялись как костыли для старых моделей, могут мешать новым. Например, требование отвечать максимально подробно приводило к тому, что модель делала десятки лишних поисков по базе знаний. А принудительное требование писать черновик рассуждений в некоторых случаях приводило к тому, что вызовы инструментов попадали в рассуждения, но фактически не выполнялись.
В одном из тестов на задачах поддержки после очистки таких инструкций средняя стоимость снизилась на 14,6%, а точность выросла на 5,3%.
Максимальный уровень рассуждений может давать совсем небольшой прирост.
На HLE у Fable 5.1 переход на последний уровень
max увеличил стоимость на 46%, а результат вырос всего на 0,5%. И то, это улучшение укладывалось в пределы погрешности теста.При этом на CursorBench 3.2 Fable 5.1 с уровнем
low смогла показать результат на уровне Fable 5 с high, но при стоимости примерно в три раза ниже. Более сильной модели иногда выгоднее дать меньше времени на рассуждения, чем заставлять более слабую модель думать на максимуме.Промах кэша может происходить просто из-за того, что вы добавили временную метку.
Для работы кэша префикс должен совпадать полностью. Постоянно меняющееся время, ID в системном промпте или даже изменение порядка описаний инструментов могут сбросить весь последующий кэш. Если выполнение инструментов в агенте занимает слишком много времени, можно также выйти за срок жизни кэша.
Anthropic уже встроила такие проверки в
claude-api skill для Claude Code. Команда /claude-api prompt-audit позволяет проверить промпты, а /claude-api cost-optimize — найти места, где можно снизить расходы на API.Так что при переходе на новую модель стоит заново проверять старые
CLAUDE.md, скиллы и настройки effort. Некоторые правила действительно были полезны раньше, а сейчас могут просто тратить токены.