Давайте немного поясню в очередной раз про "расход токенов на первый вызов".
Прекратите уже его выдрачивать
Просто на примере:
PonyTail и Caveman - если подключены - потратят свои токены на первом вызове. Последующие вызовы будут в разы экономнее. Попадут в КЭШ сразу. После подгрузки будут использоваться и экономить токены и улучшать код и вывод. Если не подгрузить - на круг потратите больше. Если подгрузить динамически - есть шанс игнора, до подгрузки сжатия не будет и в момент подгрузки дропнется кэш, в него попадут не сразу.
Поэтому:
👉 20-30 тыс контекста занятого на старте - более чем нормально
👉 Отложенная загрузка она не во имя экономии а во имя фокуса
👉 Агрегаторы скорее размывают фокус модели и заставляют её вызывать tool хуже и реже. Жесткие агрегаторы убирающие всё - зло (если не расписаны в правилах, а это по сути та же схема)
👉 в курсе командной разработки я разбирал как это правильно организовано в LiteLLM, но там преследуются не только цели экономии конечно
👉 все тулы заворачивать в агрегаторы потому что "LLM трудно разобраться описаниях тулов" почему то предлагают те же люди у которых "дайте LLM grep она сама в репозитории разберётся". Я за баланс :)
👉 Смотрите затраты на круг. Если у вас сессия кодинга потратила меньше 300-400 тыс токенов - значит задачи надо разбивать побольше. А в масштабах нормальной задачи первый запуск - это копейки.
👉 Ну и важно соотношение кэшированных и некэшрованных токенов. На него у меня даже hook стоит. В КЭШ должно попадать почти что всё. А ваши изыскание с экономией могут снижать cache hit и качество разработки в итоге просто будете тратить больше.
👉 Над экономией контекста в правилах и MCP работаю постоянно и буду продолжать. Процесс итерационный. Иногда после внедрения мер экономии становится хуже. Но хуже это не про первый запус это про большую задачу.
⚠️ Самое главное:
1) Тот расход токенов который вам напишет модель по чату вообще может быть не равен фактическому расходу токенов!!!
2) Расход токенов никак не коррелирует со стоимостью и фактическими лимитами. Кэш вообще учитывается по-другому, а 99% того что вы модели отправили - это КЭШ.
3) Стоимость исходящих токенов и входящих сильно разная (раз в 10). Поэтому важно больше не то что вы отправили а то что вам пришло...
Post #2292
831

- 👍 2
- 🤷♂ 1
- 🥰 1
- 👏 1
- 🐳 1