TGViewer
Нейросети на практике Нейросети на практике @neuralfordevs · 65 subscribers
Post #13 76
Рубрика: Разрушители мИИфов. Проверяем Caveman реально экономит токены?

Любил в детсвте эту передачку. А в ИИ дохренищи мифов. Вот один из таких как мне кажется мы сегодня и разберем.

Есть такой скилл Caveman который обещает дикую экономию токенов.

Идея вроде логичная – LLM начинает говорить как пещерный человек и из-за этого типа меньше генерирует мусора и таким образом тратит меньше токенов.

Звучит сомнительно. Долго искал какие-то умыне и крутые бенчмарки, но кроме бенчмарков самого автора, который довольно хорошо умеет в SEO я ничего не нашел.

Короч, решил затестить сам. Попросил разные модельки написать мне игру про роботов:

Сделай мне в новой папке игру про огромного робота с видом сверху папку положи в папку repos и назови Opus 4.8. Не задавай мне вопросов, делай так чтобы получилось интересно и необычно. Сделай задачу до конца


Я закинул этот промпт в 4 разных модели:

Opus 4.8
Opus 4.8 With Caveman
Sonnet 4.6
Sonnet 4.6 With Caveman

На выходе получилось 4 игры про робота. На удивление они оказались довольно похожи, но каждая со своими особенностями.

На удивление версии игры от Sonnet были прям прикольные

По затратам токенов

Sonnet 4.6 42.2k tokens (16m 12s)
Sonnet 4.6 With Caveman: 52k tokens (12m 50s)

Opus 4.8 32.5k tokens (5m 16s)
Opus 4.8 With Caveman: 29k tokens (4m 34s)

Ну что же. В случае с Opus 4.8 и правда что-то сэкономили. А вот с соннетом, хоть я и не ожидал мы не только не сэкономили, но еще и потратили больше.

Теперь про сами игры.

Игра от Opus 4.8 With Caveman вышла довольно говеной и с кучей ошибок, и геймплейных проблем. Я приложу видосы в комментах, чтобы вы могли убедиться в каловости итога.

А вот Opus 4.8 я бы сказал на порядок лучше. Он даже добавил прогрессию. Правда она заключалась в том, что робот просто растет. Но в целом игра смотрится просто нормально.

Из интересного:

Быстрее всех справился Opus 4.8 With Caveman и вообще опусы справились довольно быстро. Сильно быстрее соннетов

У соннетов игры сильно хуже

Все игры называются либо Titan либо Colossus. А соннет под кейвменом назвал игру Titan: Protocol Colossus 👋

Во всех играх есть возможность топнуть ножкой и пустить ударную волну +вайб

На соннете запустил еще разок тест. Результат примерно тот же.

Sonnet 4.6 40.3k tokens (15m 36s)
Sonnet 4.6 With Caveman: 59.1k tokens (12m 50s)

Соннет с кейвменом по итогу просто не смог собрать игру -вайб

В целом все игры сгенерированные с кейвменом оказались хуже или вообще не заработали.

ИТОГО:

💥 UNPLAUSABLE 💥

Что же я думаю про caveman? Ну судя по всему это все же мИИф.

Да, иногда он позволяет сэкономить токены, но во-первых это не на всех моделях воспроизводится, а во вторых это сильно дропает качество выходного продукта. Результаты с кейвменом стабильно говеные, а на модели Sonnet тратили еще и больше токенов. Так что сносите эту штучку и не тратьте на нее время

#разрушители_миифов
GitHub GitHub - JuliusBrussee/caveman: 🪨 why use many token when few token do trick. Viral skill + proxy for coding agents that cuts 65%… 🪨 why use many token when few token do trick. Viral skill + proxy for coding agents that cuts 65% of tokens by talking like a caveman. - JuliusBrussee/caveman
  • ❤ 3
  • 🤝 1
  • 🦄 1
More from @neuralfordevs
  1. Jul 30, 2026🤔 Что выбрать новичку Claude или Codex? Это вопрос, который я часто слышу от тех, кто тол…
  2. Jul 15, 2026#разрушителимифов У Димы, чей разгромный тест Caveman я упоминал неделю назад, вышло новое…
  3. Jul 15, 2026Таки не заленился и написал статью про Headroom!)
  4. Jul 13, 2026Как работает кэш токенов? В процессе написания статьи про HeadroomProxy чуть глубже погруз…
  5. Jul 7, 2026🍄 Разрушители мИИфов: тестируем Headroom Когда я писал прошлый разбор про Caveman, то на…
  6. Jun 23, 2026💡 Мысль дня: Устаревание контента и забывание – ключевой процесс для корпоративной Базы з…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →