Когда основной агент ждёт subagent дольше пяти минут, кеш контекста может истечь. После возвращения Claude приходится заново кодировать всю историю диалога по повышенному тарифу. В длинных сессиях это могут быть сотни тысяч токенов.
claude-thermos запускает Claude Code через локальный прокси и периодически отправляет минимальный запрос с max_tokens: 1.Он не генерирует полезный ответ, а просто обновляет TTL кеша. Когда subagent заканчивает работу, основной агент читает дешёвый кеш вместо полной перезаписи контекста.
Запуск:
uvx claude-thermos
Инструмент поддерживает обычный CLI, несколько терминалов и расширение VS Code через daemon-режим. Требуются Python 3.11+ и установленный claude CLI.
По локальным измерениям автора на 185 сессиях, повторное создание кеша составляло около 22% расходов. Это не универсальный бенчмарк, но для тяжёлых агентных задач экономия может быть заметной.
Простой open-source инструмент, который исправляет дорогую особенность долгих сессий Claude Code.
GitHub:
https://github.com/izeigerman/claude-thermos
