Итог на графике. Расход на одну решённую задачу у Fable с RTK ниже на 3%, у DeepSeek выше на 7%. Почти вся экономия Fable пришла из одной задачи, где агент уложился вдвое меньшим числом ходов, по остальным меньше процента. У DeepSeek та же задача пошла наоборот, а если считать среднее по задачам, он стал дороже на 17%, Fable на 1%. Доля решённых упала на 1–2 пункта у обоих.
Счётчик
rtk gain, которым хвастаются в постах, показывает байты вырезанного вывода, делённые на четыре, к оплаченным токенам это отношения не имеет. В одной задаче модель дважды запросила head -1 от файла, а RTK записал себе 120 млн сэкономленных токенов за каждый вызов, сравнив одну строку с целым файлом. Ещё поймали баг: rtk find не знал флаг из команды агента, плагин переписывал команду снова и снова, и агент накопил 339 ошибок подряд. Починили в 0.46.0, уже после замеров.@neuro_channel
