TGViewer
Гриненко про ИИ, бизнес и образование Гриненко про ИИ, бизнес и образование @devspotting · 3.12K subscribers
Post #102 3.08K
Говорить мало. Экономить токен.

Сегодня в рубрике #ЭкономимТокены хочу поговорить про завирусившийся скилл caveman.

Он заставляет модель отвечать как пещерный человек: без вводных конструкций и прочей воды, сохраняя техническую суть. По бенчмаркам самого проекта экономия на выходных токенах составляет 22–87% в зависимости от типа запроса (важно: это именно ответы модели, не входящий контекст).

Из примера в README:

🗣️ Клод по умолчанию (69 токенов):
The reason your React component is re-rendering is likely because you're creating a new object reference on each render cycle...


🪨 Caveman-Клод (19 токенов):
New object ref each render. Inline object prop = new ref = re-render. Wrap in useMemo.


Ответ тот же. Слов в 3,5 раза меньше.

Есть три уровня краткости (`lite` / full / ultra`) и неожиданный режим `文言文 — сжатие на классическом китайском. Отдельные скиллы: /caveman-commit (коммиты в духе «fix: null user L42») и /caveman-review (ревью одной строкой). Ещё есть caveman-compress — утилита для сжатия самого CLAUDE.md, чтобы меньше тратить уже на входе.

Установка
npx skills add JuliusBrussee/caveman

А еще @veged сделал форк с поддержкой русского языка. Серега, не хочешь для еще большей экономии удалить англоязычную часть и переименовать скилл в «Чехов» или «Ильяхов»? :)

Что говорит наука
Авторы ссылаются на мартовскую статью с arxiv «Brevity Constraints Reverse Performance Hierarchies in Language Models».

Исследователи проверили 31 модель (от 0.5B до 405B параметров) на 1485 задачах из пяти разных бенчмарков. Обнаружили странный эффект: на ~8% задач большие модели стабильно проигрывали маленьким — причём с разрывом в 28 процентных пунктов.

Причина оказалась структурной: крупные модели при подробных ответах начинают «переобъяснять» — дообрабатывают правильный промежуточный результат и в итоге приходят к неверному финальному. Мозг большой, но болтает лишнее.

Когда тем же большим моделям добавили ограничение «отвечай кратко» — точность выросла на 26 процентных пунктов, а разрыв с маленькими сократился до двух третей. На математике и точных науках иерархия перевернулась полностью: большие модели получили преимущество в 8–16 пунктов там, где раньше проигрывали.

Иными словами: brevity constraint — это не просто «меньше токенов», это потенциально «более правильный ответ».

Но есть нюанс

На мой взгляд, нет смысла ради краткости тащить целый отдельный скилл с кучей режимов вместо того, чтобы добавить одну строку прямо в AGENTS.md:

Отвечай максимально сжато, но без потери смысла. Никогда не сокращай код, сообщения о безопасности или необратимых действиях, или если я запутался.


С точки зрения механики это ровно то же самое — brevity constraint через системный промпт.

@devspotting
  • 👍 16
  • 🔥 5
  • ❤ 1
  • 🙏 1
More from @devspotting
  1. Sep 22, 2026Обсуждаем Jev в седьмом выпуске «ИИ — не новостей» с Сергеем @veged_and_code Бережным Кром…
  2. Sep 17, 2026#ГриненкоПро №25 с Анастасией Бианко, руководителем отдела подбора персонала в Циан https:…
  3. Sep 17, 2026Аркадий, а что мы ускорили? Помните Аркадия, которого мы просили убрать руки с клавиатуры?…
  4. Sep 16, 2026На OpenRouter очередная бесплатная стелс-модель — Union Alpha. UPD: лавочка закрылась, мод…
  5. Sep 15, 2026Шестой выпуск «ИИ — не новостей» уже на Ютубе (или на ваших любимых стримингах). На этот р…
  6. Sep 15, 2026But I'm likely human after all I'm likely human after all Don't put your blame on me Don't…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →