В очередной раз решил посчитать, куда у меня там уходят токены.
Токены – ау-ау-ау-ау, вы где?!
Нашлись. За один рабочий день было 45 сессий и 5,93 млн некэшированных input-токенов. 92% из них ушли на две самые дорогие модели, потому что для своих агентов мне ничего не жалко, а ещё 38% я щедро вложил в одну задачу.
В этой задаче один раздел три раза сходил на ревью и обошёлся в 1,44 млн токенов. Третий круг ревью при этом оказался дороже, чем первоначальная реализация этого раздела. То есть проверять вышло дороже, чем делать, и это, кажется, моё личное достижение, которое хочется повесить в рамочку, но лучше не надо.
Очень хотелось свалить всё на модель, я даже начал подбирать слова, но не получилось, потому что организовал всё я сам. Каждую доработку я запускал новой сессией, и агент каждый раз заново поднимал весь контекст, как будто видит проект впервые, а я за это ещё и платил. Ревью тоже заходило с нуля и расширяло область, хотя мне нужно было всего лишь проверить, закрыты ли прошлые находки, о чём я, конечно, никому не сказал. А модель я не указывал, и воркеры молча брали самый дорогой дефолт. Всё строго по брифу, просто бриф писал я.
И это при том, что я больше пяти лет работаю проджект-менеджером и вроде как умею ставить задачи. Людям умею, а вот себе и агентам, как выяснилось, по настроению.
Пришлось (да-да, уже который раз пришлось) собрать себе комплект, чтобы не повторять этот опыт: инструкцию агенту-координатору, три шаблона брифов и статью с разбором. Работает с Codex + Orca, есть вариант, когда координирует Claude Code.
https://github.com/Fessan/codex-orchestration-kit
Вывод получился неприятный, но полезный: дешёвая модель нормально тянет задачу, если та хорошо поставлена, даже когда задача непростая. Так что счёт за токены – это во многом счёт за качество постановки задач. Мой в этот раз вышел очень подробным, с приложениями.
Post #930
160