TGViewer
IT Does Matter IT Does Matter @comol_it_does_matter · 4.64K subscribers
Post #2292 831
Давайте немного поясню в очередной раз про "расход токенов на первый вызов".
Прекратите уже его выдрачивать

Просто на примере:
PonyTail и Caveman - если подключены - потратят свои токены на первом вызове. Последующие вызовы будут в разы экономнее. Попадут в КЭШ сразу. После подгрузки будут использоваться и экономить токены и улучшать код и вывод. Если не подгрузить - на круг потратите больше. Если подгрузить динамически - есть шанс игнора, до подгрузки сжатия не будет и в момент подгрузки дропнется кэш, в него попадут не сразу.

Поэтому:
👉 20-30 тыс контекста занятого на старте - более чем нормально
👉 Отложенная загрузка она не во имя экономии а во имя фокуса
👉 Агрегаторы скорее размывают фокус модели и заставляют её вызывать tool хуже и реже. Жесткие агрегаторы убирающие всё - зло (если не расписаны в правилах, а это по сути та же схема)
👉 в курсе командной разработки я разбирал как это правильно организовано в LiteLLM, но там преследуются не только цели экономии конечно
👉 все тулы заворачивать в агрегаторы потому что "LLM трудно разобраться описаниях тулов" почему то предлагают те же люди у которых "дайте LLM grep она сама в репозитории разберётся". Я за баланс :)
👉 Смотрите затраты на круг. Если у вас сессия кодинга потратила меньше 300-400 тыс токенов - значит задачи надо разбивать побольше. А в масштабах нормальной задачи первый запуск - это копейки.
👉 Ну и важно соотношение кэшированных и некэшрованных токенов. На него у меня даже hook стоит. В КЭШ должно попадать почти что всё. А ваши изыскание с экономией могут снижать cache hit и качество разработки в итоге просто будете тратить больше.
👉 Над экономией контекста в правилах и MCP работаю постоянно и буду продолжать. Процесс итерационный. Иногда после внедрения мер экономии становится хуже. Но хуже это не про первый запус это про большую задачу.

⚠️ Самое главное:
1) Тот расход токенов который вам напишет модель по чату вообще может быть не равен фактическому расходу токенов!!!
2) Расход токенов никак не коррелирует со стоимостью и фактическими лимитами. Кэш вообще учитывается по-другому, а 99% того что вы модели отправили - это КЭШ.
3) Стоимость исходящих токенов и входящих сильно разная (раз в 10). Поэтому важно больше не то что вы отправили а то что вам пришло...
  • 👍 2
  • 🤷‍♂ 1
  • 🥰 1
  • 👏 1
  • 🐳 1
More from @comol_it_does_matter
  1. Oct 6, 2026Всем кто поюзал Pi и DSH для 1С огромное спасибо. Очень тщательно и внимательно вычленял в…
  2. Oct 6, 2026Ну очень интересная картинка: 👉 Стоимость подписки в пересчете на API 👉 Сравнение Anthro…
  3. Oct 6, 2026❗️❗️❗️❗️ ОСТОРОЖНО МОШЕННИКИ ❗️❗️❗️❗️ Коллеги, я никому не пишу ничего в личку тем более о…
  4. Oct 6, 2026Уловили же все веяния с Jev\clef\Julia? https://typesafe.ai/blog/introducing-system-one-mo…
  5. Oct 6, 2026Оказывается в 🇰🇿🇺🇿🇰🇬🇦🇿🇬🇪🇦🇲 1C тоже весьма популярна. У меня вал неотвеченных п…
  6. Oct 5, 2026🆕 https://vibecoding1c.ru/harnesses - всё написал уже выше. Harness (агенты) для разработ…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →