Вот какие результаты спустя день работы в таком режиме:
* Модель стала намного чаще меня спрашивать о решениях и развилках
Это не удивительно и не уникально - цикл ревью разными моделями по разному обученными поднимает больше вопросов и эйджкейсов
* Кодекс стал впитывать большую часть нагрузки (токенов).
А вот эта часть интереснее. Изначально мне показалось что расход токенов существенно уменьшился, но это не совсем так.
Просто недельный лимит кодекса заполняетя медлнее 5ти часового лимита клода, и визуально на дешборде это стало выглядить как будто токены стали сгорять медленее.
Но теперь я вижу что просто нагрузка сместилась на кодекс, но это именно то что мне и надо было, ведь он в любом случае выходит мне дешевле (недельный лимит сбрасывает раньше, и еще ручной сброс подкидывают).
* Токены сгорают быстрее если контекст забит
Вот здесь выглядит так что я токены сэкономил, хотя у меня нет цифр на руках так как я так и не придумал как доказать это эмперически.
Поэтому дальше только мои наблюдения и мысли
Но сначала надо немножечко углубится в то как порезан мой эпик:
На верхнем уровне идут фазы (A, B, C, D и тд)
В них вложены слайсы у которых могут быть подслайсы (A1, B2, D41)
Раньше я двигался просто по-порядку создавая нового агента на фазу и держал его до конца фазы, делая только compact между слайсами
Практика показала что слишком частые компакты делают только хуже - агент все равно все перечитывает и переуточняет если текущие задачи все еще требуют старого контекста, поэтому не чаще чем между слайсами
Чтобы основной агнет не забивал свой контекст я просил его максимально делегировать все сабагентам, но все-равно под конец слайса миллионый контекст опуса обычно забаивался на 60-70%
Теперь же под конец слайса контекст рутового опуса забивается на 35-55% и в целом он жгет меньше токенов, даже не смотря на то что ему теперь приходится несколько раундов править свой изначальный план на слайс.
Я думаю это связано с тем что в середине процесса появился sol.
Хотя изначально я дал ему очень ограниченную роль - критиковать план на слайс и запускать сабагента по вотчу - я вижу что он взял на себя и другие роли:
- на стадии ревью - роль фактчекера. План составляется опусом в основном на данных собранных грепами, а сол при критике реально просматривает интересубщие его файлы. Это быстро забивает его контекст, но дает ему возмоджность предвитеть ошбики в плане. Интересно что соннет сам отмечае что "стратегия опрадывает себя полностью и каждый рах находит серьязные недочеты в плане вот уже 5ый раз слайс подряд"
- роль "няньки" за кодящим терра - вся проверка написанного кода и его подгонка легла на него, а опус просто финально прогоняет тесты и "одим глазком" смотрит что все ок. Такого чтобы он что-то дописывал сам или возращал работу не было не разу (а раньше бывало через раз не смотря на то что сабагнетом был соннет, и каждый раз ему приходилось погружатся глубже в написанный код)
- он же определяет где работу можно распаралелить на несокльких агентов (что тоже требует проверки и размышлений)
Интересно что уже на третьем слайсе терра стал жрать токены как не в себя из-за чего я делаю вывод - чем больше заполнился контекст тем больше расход токенов.
Хорошая новость - что промежуточный sol я могу полностью переосоздавать после каждого слайса, ему ничего не нужно знать о том что было до и что будет после - за это уже отвечает соннет.
👉 трехуровневая иерархия ненароком дала мне четкую границу по которой я могу сбрасывать ненужнй контекст не рискуя затереть нужный.
Получилась оптимальная для меня система архитектор - тимлид - кодер
Post #632
565
Work & Beer Balance Почитав вчера как агенты огранизовали форум из файлов и папок для взлома hugging face (если вы еще не читали то обязательно прочитайте) я подумал: Это что же, никаких обвязок и "харнессов" не нужно? И решил повторить эксперимент у себя: Клоде (Opus xhigh)…