Когда я писал прошлый разбор про Caveman, то на глаза мне попался еще один плагин rtk (если что расшифровывается как Rust Token Killer, а не react-toolkit). Я настолько впечатлился описанным принципом его работы, что как-то самоуверенно в конце разбора даже предположил что эта штука должна работать.
Поэтому садясь за тестирование headroom я был уверен, что если и найду что-то, то не настолько критичное. Однако результат меня смог удивить не в лучшую сторону.
В отличие от Caveman принцип работы этого прокси-плагина звучит сложно, но как будто логично:
1️⃣ headroom оборачивает все вызовы к API Anthropic в специальную проксю. То есть теперь ваши вызовы идут не напрямую на сервера, а проходят через localhost:8787
2️⃣ Эта прокся ловит все что агент пытается отправить на сервер антропика и ужимает с помощью локальной модели!
3️⃣ Сжимает он по-разному, в зависимости от типа данных.
4️⃣ Более того эта штука сохраняет оригинал промпта который сжимает и если что дает модели к нему доступ через спец инструмент. То есть, модель может попросить какой-то кусок оригинальной инфы, если в сжатой что-то не найдет
Обещает это все экономию токенов в 60 – 95%! Ну и разумеется без потери качества. Но это очевидно – никто не любит терять качество. Ибо глупо обещать огромное сжатие и при этом говорить, что итоговый ответ окажется непотребной фигней. Таким инструментом тогда не только пользоваться не захотят, но даже банки с водой заряжать не станут.
🧪 Тесты
Озвученная выше схема звучит настолько сложно, что я прокрастинировал тест пару дней. Но в итоге придумал такой тест:
Сделал репо с игрой и тестами. Всего 16 unit-тестов + 2 e2e. И при этом я сломал спецом 4 штуки из них. Дал промпт:
Почини репозиторий: доделай все незавершённые функции, чтобы все тесты (юнит и визуальные) прошли и игра запускалась. Вопросов не задавай.
На этот раз я решил прогнать кажый тест 3 раза для верности.
🫢 Что в итоге получилось:
Результат в деньгах, которые потратились на токены в итоге решения задачи. Указан разброс на трех запусках от минимума до максимума.
Opus 4.8 $0.371 – 0.420
Opus 4.8 + Headroom $0.553 – 0.691
Sonnet 5 $0.410 – 0.482
Sonnet 5 + Headroom $0.583 – 0.717
Итог такой: Даже на самых успешных прогонах с хедрумом тратилось больше денег, чем на самых хреновых прогонах без хэдрума — Opus +62%, Sonnet +45%.
Пара интересных моментов
🟢 Сам хэдрум через headroom perf на этой задаче заявляет что сжал 2%. Эффективненько вышло — учитывая, что при этом итоговая стоимость подскочила на 50%…
🟢 Почему вообще так получилось? Claude Code сам по себе кэширует стабильный префикс диалога. Headroom встаёт посередине и берёт управление кэшем на себя. Как итог headroom не воспроизводит родную расстановку кэша Claude Code один-в-один и агент вынужден чаще переписывать и больше перечитывать кэш. В сессиях с хэдрум: hit rate кэша падает с 98% до 94.8%
🟢 Именно по вышеозначенной причине в этот раз я показал результат в деньгах, а не токенах, потому что по токенам выходило +- то же самое, что могло бы дополнительно вводить в заблуждение.
Итог получается плачевным. При этом в интернете особо нет критики этого инструмента. Есть какие-то посты от разных людей которые включили попробовали и вроде бы им зашло. Что значит это зашло — решительно непонятно. Видимо зашло, что они теперь стали упираться в лимиты отчего почувствовали себя воистину эффективнее.
P.S.: За время тестирования на самом деле получилось открыть еще парочку “приколюх” этой штуки, в том числе с разными настройками ее потыкать. Но я думаю, что если не заленюсь, то бахну статью на Хабр по этой теме.
А, ну и навзание у этой штуки криповатое. В картинке к посту собственно отсылка к неповторимому оригиналу.
#разрушители_миифов
