TGViewer
Корм для моделей Корм для моделей @korm_model · 66 subscribers
Post #20 99
Самая дорогая модель нужна реже, чем кажется

Одна сборка задач в моем конвейере разработки разворачивает 40-80 AI-агентов. Поставь на каждое место флагманскую модель, и разоришься раньше, чем доедешь до релиза.

Вечерами у меня работает команда AI-агентов: оркестратор раздает задачи, дев пишет код, остальные собирают данные, проверяют факты, готовят сводки. Конвейеров накопилось несколько: сводки, извлечение знаний из заметок, полный цикл разработки. И в каждом один и тот же вопрос: внутри агента крутится языковая модель, а модели стоят по-разному, между флагманом и самой дешевой разница в десятки раз. Вопрос «кому какую дать» из технического стал управленческим.

Самый свежий конвейер: разработка в Claude Code. Десять этапов: проверка требований, дизайн, пользовательские сценарии, план, сборка, тесты, документация, ревью, исправления, релиз. Распределял модели так же, как распределял бы людей:
🧠 Fable, самая дорогая, стоит только там, где ошибка дороже всего: планирование и ядро системы
🔍 Opus на всей критике: ревью кода, безопасность, атаки на архитектуру до старта разработки, опровержение чужих находок. Умение сомневаться здесь отдельная профессия
⚙️ Sonnet, рабочая лошадка: компоненты, тесты, документация, исправления. Основная масса работы
🏃 Haiku, самая дешевая: прогнать тесты и вернуть отчет. Думать не надо, надо не ошибиться в отчете

В конвейере сводок тот же вопрос решал перебором: гонял шесть связок «сборщик → валидатор → редактор» на одних и тех же данных и мерил результат. Победила связка DeepSeek → GPT-5.6 → DeepSeek: 90% точности, ноль выдумок, ноль пропусков. Выбор сделали цифры.

Из обоих конвейеров вывелось одно правило: на каждую роль ставится самая дешевая модель, которая проходит проверку. Ключевое слово «проверка». Правило работает, только когда контроль встроен в сам конвейер: у меня каждую находку ревью пытается опровергнуть отдельный агент, спорные решения сводит агент-судья, находка без попытки опровержения не считается подтвержденной. Без этого экономия превращается в лотерею.

Индустрия приходит туда же. liteLLM опубликовали эксперимент: роутинг моделей по фазам задачи дал то же качество и минус 46% стоимости. В свежем бенчмарке проверяемого кода средний Sonnet обошел дорогой Opus: 96.4% против 89.3%. А в рекомендациях для автономных агентов флагману отводят 5% вызовов, тогда как 70% работы отдают самым дешевым моделям.

В человеческих командах это очевидно: никто не сажает архитектора разгребать типовые тикеты. С агентами то, что раньше было штатным расписанием и оргвыводами, впервые стало настройкой: роль → модель → цена.

Следующий вопрос, который меня зацепил: влияет ли на качество работы сама личность агента, характер и границы, прописанные в инструкции. Эксперимент уже идет, скоро покажу цифры.
  • 👍 3
  • 🔥 3
More from @korm_model
  1. Sep 11, 2026🧠 Из чего состоит память AI-агента Полгода назад завёл первого агента и быстро понял: пам…
  2. Aug 26, 2026К посту про скиллы — где брать готовые. Есть открытый каталог skills.sh от Vercel: больше…
  3. Aug 26, 2026Скилл — это как научить агента, а не написать код В прошлых постах я выложил два архива pi…
  4. Aug 19, 2026document post
  5. Aug 19, 2026📦 Примеры к посту выше — забирайте и щупайте Два рабочих примера. Не идеальные, но это то…
  6. Aug 19, 2026🔒 Как скормить модели данные с персухой и не спалиться Любая задача, где в тексте ФИО, те…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →