Caveman экономит токены. Но не 65%
Меня периодически спрашивают про скилл Caveman. Он заставляет агента отвечать короче и обещает экономить в среднем 65% output-токенов. Стоит ли его использовать?
Мне тут нравится аналогия с гомеопатией и доказательной медициной: всё, что в гомеопатии доказанно помогает, перестает быть гомеопатией и становится частью доказательной медицины. Со скиллами для агентов примерно так же – если какой-то приём действительно стабильно улучшает работу агента, он, скорее всего, окажется внутри популярных агентов.
И вот ребята из JetBrains проверили, сколько Caveman экономит на реальных агентных задачах. Они сравнили Claude Code со скиллом и без него на SkillsBench.
Коротко результат такой:
– экономия output-токенов составила 8,5% против заявленных 65%, а ожидаемая экономия стоимости – около 10%. Это объясняется тем, что в реальных задачах большую часть output составляют код, дифы, вызовы тулов и тексты ошибок – всё то, что Caveman не трогает.
– С точки зрения качества ребята выяснили, что просадки нет.
Поэтому в целом пользоваться можно, но не стоит ожидать бешеной экономии.
#ai
Post #640
1.52K