Главная мысль: оптимизировать нужно не цену токена, а стоимость успешно выполненной задачи. Более дорогая модель иногда оказывается дешевле, если решает задачу за меньшее число шагов.
Anthropic предлагает такой порядок:
- сначала включить prompt caching - для агентных циклов это один из самых сильных способов экономии;
- убрать лишние входные и выходные токены;
- сокращать ненужные итерации агента;
- для фоновых задач использовать Batch API, где стоимость токенов снижается на 50%;
- только после этого экспериментировать с
effort и более дешевыми моделями.Интересный вывод: переход на более дешевую модель - далеко не первый шаг оптимизации. Сначала стоит выжать максимум из архитектуры запросов и кеширования.
Гайд: https://github.com/anthropics/skills/blob/main/skills/claude-api/shared/cost-optimization.md