TGViewer
DrMax SEO DrMax SEO @drmaxseo · 9.57K subscribers
Post #1703 2.61K
💸 Как экономить токены LLM

Сегодня посчитал стоимость работы с несколькими старшими LLM и малость загрустил. Токены старших моделей стоят прилично и при массовой работе (а в SEO это обычное дело) это кушает бюджет крайне быстро.

Есть несколько наработанных приёмов снижающих расход токенов без потери качества.

1. Режем промпты на статичную и динамическую часть и никогда не трогаем порядок и текст статичной. Практически все LLM имеют кэширование префикса промпта, и повторяющийся неизменный блок обходится в разы дешевле при каждом следующем вызове (работа с кэшем в разы дешевле). Но ежели вы залезете в промпт и что то допишете, то кэш сбрасывается.

2. Маршрутизируем задачи по сложности, а не гоняем всё через старшую модель. Классификация запроса, извлечение сущностей, форматирование и т.д. это работа для младшей модели, и разница в цене может быть десятикратной. Старшую модель оставляйте только там, где реально нужно её рассуждение.

3. Используем batch API для всего, что не требует ответа в реальном времени. У основных провайдеров пакетная обработка стоит заметно дешевле обычных синхронных запросов, а массовая генерация контента почти никогда не требует немедленного ответа.

4. Задаем выходной контракт явной схемой. Как известно, output-токен обходится раза в три дороже input-токена, а размытая инструкция к выводу провоцирует модель отвечать многословнее, чем нужно.

5. Безжалостно рубим из контекста RAG-документы и tool-описания, не относящиеся к конкретному запросу, вместо "на всякий случай прикрепить всё". Лишний документ отъедает токены и размывает внимание модели.

6. И последнее, самое системное - компрессия самого промпта.

По компрессии промптов накоплен приличный пул исследований. По сути это целое направление исследований:

➡️Обзорная работа Prompt Compression for LLMs: A Survey раскладывает область на hard-подходы, которые режут обычный читаемый текст, и soft-подходы, кодирующие контекст в нечитаемые векторы.

➡️LLMLingua отбирает информативные токены и защищает числа от удаления, а LLMLingua-2 превращает тот же отбор в задачу классификации через дистилляцию и обгоняет первую версию по скорости и качеству.

➡️RECOMP показывает, что для RAG выгоднее сжимать документы в текст под конкретную задачу, а не делать общий пересказ.

➡️А работа Relevant but Incomplete поймала неприятный эффект: агрессивное сжатие часто оставляет факт, но вырезает его определение или условие, и такой обрубленный контекст выглядит релевантным, но реально бесполезен для модели.

Отдельного внимания стоит работа Compression Method Matters: при коэффициенте сжатия 0,3 средняя длина ответа на одном наборе задач выросла в 56 раз, потому что сжатие повредило центральную часть инструкции. Экономия на входе обернулась взрывным ростом на выходе, а с учётом того, что выходной токен дороже входного, итоговый счёт получился хуже исходного.

С последним мириться было нельзя, и за дело принялся знающий человек - наш военком.

Отсюда и родился PromptSculptor - хитрый и ловкий промпт для сжатия других промптов!!!!

У него два рабочих режима:

➡️COMPRESS сжимает промпт на одном из трёх уровней риска, от точечной нормализации до агрессивного переписывания, и никогда не трогает soft-пожелания без явного разрешения.

➡️AUDIT сравнивает оригинал и сжатую версию по конкретным проверяемым пунктам: не потерялось ли ограничение, не сломалась ли схема вывода, не осталась ли в тексте ссылка на определение, которое вырезали при сжатии. Там, где промпт слишком рискованно жать на запрошенном уровне, встроенный механизм сам понижает уровень сжатия.

Промпт PromptSculptor и хэлп к нему выложил на канал со спецпромптами.

Изучайте и тестируйте.



🔔 Узнайте как поддержать развитие канала.

📔 DrMax: Доказательное SEO 2026 + Введение в Промптоведение

📚 25 PRO промптов + Pocketbook DrMax: Промптоведение для SEO-стратегов 2026

❄️Всяческая SEO халява



#DrMax #SEO #LLM #промпты
  • 👍 13
  • ❤ 6
  • 🔥 3
  • 🗿 1
More from @drmaxseo
  1. Sep 21, 2026У тебя 10 секунд. Узнать, что нового в iGaming. Или потратить 10 минут на чужой лонгрид. i…
  2. Sep 20, 2026🛡 Абузоустойчивый хостинг для SEO, арбитража и high-risk проектов ⚡️ Без KYC • Оплата кри…
  3. Sep 20, 2026☄️ COCOON CHAINSMITH v3: конструктор маршрутов для Cocoon Engine X4 ➡️ Решает 99% всех зад…
  4. Sep 18, 2026✍️ Как я коконы на WordPress вертел Вчера выпала мне нужда прилепить коконы к WordPress са…
  5. Sep 17, 2026Brand Safe для iGaming: кейс Германии и Австрии Недавно завершили один из этапов Brand Saf…
  6. Sep 17, 2026🕸Google признался в пессимизации сайтов за генеренку Всеми нами любимый Мюллер, говорящая…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →