Кратко: следить за контекстом.
Предыстория:
Начал работать с версткой нового проекта, первые часа 2 все было окей, а потом Codex внезапно выжрал 50% недельного лимита Pro x5 за $100. Я такой 👀. А это между прочим 2.5 обычных Плюс лимита.
Я же автокомпакцию использую — должно быть все ок.
Установил ссоадж - полез разбираться. Оказалось, что ссосадж показывает затраты только по каждому агенту ежедневно, без особой детализации, что именно жрет, пришлось писать свой скрипт разбора файлов сессий - они хранятся в JSON.
Ну я пока писал анализатор себе всякого понакручивал:
1. Исходящие токены, которые самые дорогие по $30 за 1М — они жрут только 15% всего расхода, конечно, сэкономить тут можно... но сложно.
2. Основной расход идет на чтение кэша (!), а конретно на function_call_output - т.е. результаты деятельности тулов.
3. Особенно доставил автоклассификатор - он тупо выжрал 22% на какихи-то кэшах разрешений.
4. Скриншоты в чате тоже выжрали прилично, но как я понял основную массу выжрали скриншоты, которые генерале тулы, а не я вставлял руками.
При этом чтение\запись из кэша делится на новый ввод 34% против повторного перечтения всякого мусора 51% <- вот куда ушли все лимиты.
Выводы:
1. Конечно, почаще читайте в Телеграме вопли деятелей у которых "какая-то особенная очень большая кодовая база которая жрет много токенов" и никаких доказательств, что именно жрет токены - они не приводят.
2. Создавайте новую сессию под каждую задачу - автокомпакция не помогает от замуссоривания контекста, как минимум куча мусора скапливается в автоклассификаторе.
3. OpenAI списывают лимиты не в реальном времени, а с небольшой задержкой, т.к. что когда у вас останется 90% от лимита, и вы откроете новую сессию - это уже не поможет. Лимиты они как бы вас нагонят и будете ждать сброса лимита.
4. Используйте Оркестратор - он автоматически создает воркеров под каждую задачу, что экономит контекст.
5. Прекращайте использовать Codex App до тех пор пока они не починят контекст.
Ну и отдельный привет, тем ребятам, которые юзают АПИ без кэширования — там конечно тарифы необоснованно дорогие.
Что еще можно сделать?
• Требовать от OpenAI разработку такого инструмента как /context в СС который подробно показывает использование контекста.
• Разрабатывать/устанавливать свои собственные тулы для редактирования контекста во время использования агентов кодирования.
Например: те же самые скриншоты, он полезны — но нужно контролировать потребление агентом этих самых скриншотов, он их делает по поводу и без повода.
В Claude Code все может быть ну соврешенно по другому, т.к. Антропики за контекстом куда более пристальнее следят, чем разгильдяи из OpenAI.
