Нашумевший скилл Caveman обещает экономить 70% ваших токенов, заставляя агента говорить как пещерный человек. Суть проста: убирая из текста приветствия, вежливости, длинные переходы, определения для чайников и прочие вводные фразы, он оставляет только очень сухую выжимку.
Я когда увидел, что творится, аж позавидовал автору: примитивная, как дубина 🪄, идея - и в итоге десятки тысяч звёзд и восторженные посты про то, как "его теперь используют в OpenAI и Nvidia". Но когда пошел тестить, то обнаружил, что не все йогурты одинаково полезны , было написано на одинокой заброшенной могилке.
Что показала проверка:
🦍 Первый маленький тест от JetBrains выдал -29,5%. На 86 задачах сошлось к -8,5%.
🦍🦍 Независимый тест на Хабре оказался ещё жёстче: на части задач Caveman токены УВЕЛИЧИЛ (42k > 52k на Sonnet), а качество уронил.
🦍🦍🦍 Когда я прогнал Пещерника по собственным тестам, то оказалось, что прямая выгода видна только на прозе, но при использовании в агентах ценный контекст между ними теряется. Это происходит потому, что вывод агента - это код, диффы, вызовы инструментов, Caveman их не трогает (и правильно делает). Сжимается только болтовня между ними, но её как раз очень мало.
Как вы понимаете, для документации и объяснения решений такой подход тоже не работает. Другими словами для кодинга более-менее ок, для анализа - противопоказано.
В довесок оказалось, что вирусная история про "техдиректор OpenAI лично законтрибьютил" - фейк🤡. У OpenAI вообще нет CTO с сентября 2024-го с тех пор, как ушла Мира Мурати.
Какие выводы, сэр?
1. Заявления в README - маркетинг, пока их не проверил кто-то независимый.
2. Один прогон - не бенчмарк.
3. Чем виральнее пересказ, тем больше в нём выдуманных деталей. Проверяйте первоисточник.
4. Строка
"Be brief" в системном промпте даёт почти тот же эффект бесплатно.И, слава Фейбл, вы теперь можете проверить это сами на симуляторе caveman-not.sergeydolgov.ai
Короче, не ведитесь на хайп. Даже со звёздами.
