Счёт за токены растёт незаметно и всегда по одним и тем же причинам. Разберём основные:
1. Не гоняйте фронтиры по мелочам. Простая вёрстка, замена названия переменной — с этим справится и бюджетная модель (или даже вы сами). Флагман нужен там, где нужно глубокое исследование — в архитектуре, массовом деплое через Jenkins, веб-поиске свежей документации по вашему кейсу.
2. Включите кеш. Если у вас длинный системный промпт или большой справочный контекст, который повторяется от запроса к запросу, — кешированный ввод стоит в разы меньше обычного. Цены по кешу у нас приведены по каждой модели, посчитайте свой случай. Пример: Claude Sonnet Latest.
3. Ограничьте токены вывода (параметр max_tokens). Модель охотно генерирует ответ на три экрана, если ей явно не запретить. Выход всегда дороже входа. 😶🌫️
4. Чистите контекст. Тащить всю историю диалога в каждый запрос, даже мелочный — роскошь даже на бюджетных моделях. Оставляйте то, что действительно нужно для ответа.
5. Ставьте лимиты на ключи. Ключ, выданный стажёру или тестовому скрипту, легко может за неделю съесть больше команды разработки.
6. Периодически смотрите аналитику. Расход по моделям и членам команды, средняя стоимость запроса, процент ошибок. Обычно два-три сценария впитывают в себя ощутимую долю счёта — и на них можно легко сэкономить без замедления процесса.
7. Настройте фолбэки. При сбое провайдера запрос уедет на резервную модель.
Наценка у нас фиксированная — +10% к цене провайдера. Опробуйте сейчас — здесь. 😇
P.S.: пост частично пересекается с советами по экономии в Kodik IDE (в реплае).
