Рекомендую глянуть, автор придумал подход Context Mode, чтобы экономить токены контекста.
Когда дергаешь MCP, вызов инструмента жрет контекст с двух сторон: и вход, и выход тратят токены.
Решение автора: Context Mode.
Он добавляет прослойку между Claude Code и выводом внешних инструментов. Главная цель: не пускать сырые большие куски данных в контекстное окно. За счет этого можно получить до 98% экономии контекста.
Как это работает:
1. Песочница и изоляция выполнения. Каждый вызов инструмента крутится в отдельном подпроцессе, есть поддержка 10 рантаймов (JS, Python и т.д.). В контекст возвращается только результат из
stdout, а исходный объемный вывод остается внутри песочницы и не попадает в контекст.2. База знаний + сжатый вывод. Markdown-контент индексируется через SQLite FTS5 virtual table + BM25 ranking + Porter stemming. Когда модели нужно, она точечно вытягивает нужные блоки кода, вместо того чтобы пихать в контекст резюме или весь текст целиком.
Данные из тестов автора:
➡️Playwright snapshot: 56 KB -> 299 B
➡️20 GitHub Issue: 59 KB -> 1.1 KB
➡️500 access logs: 45 KB -> 155 B
➡️Анализ CSV на 500 строк: 85 KB -> 222 B
➡️153 git commit logs: 11.6 KB -> 107 B
По идее очень похоже на то, что Cloudflare раньше выпускали как Code Mode.
100% опенсорс 👋