Чем кормить AI, чтобы он работал в проде.
Днём — CPO с 70 продуктами в портфеле, AI внедряется в 13.
Вечером — вайбкожу свои продукты и команду из 8 AI-агентов.
Здесь: эксперименты с LLM, архитектура пайплайнов, PII в cloud, граф знаний, провалы и цифры.
Post #20
99
Самая дорогая модель нужна реже, чем кажется
Одна сборка задач в моем конвейере разработки разворачивает 40-80 AI-агентов. Поставь на каждое место флагманскую модель, и разоришься раньше, чем доедешь до релиза.
Вечерами у меня работает команда AI-агентов: оркестратор раздает задачи, дев пишет код, остальные собирают данные, проверяют факты, готовят сводки. Конвейеров накопилось несколько: сводки, извлечение знаний из заметок, полный цикл разработки. И в каждом один и тот же вопрос: внутри агента крутится языковая модель, а модели стоят по-разному, между флагманом и самой дешевой разница в десятки раз. Вопрос «кому какую дать» из технического стал управленческим.
Самый свежий конвейер: разработка в Claude Code. Десять этапов: проверка требований, дизайн, пользовательские сценарии, план, сборка, тесты, документация, ревью, исправления, релиз. Распределял модели так же, как распределял бы людей:
🧠 Fable, самая дорогая, стоит только там, где ошибка дороже всего: планирование и ядро системы
🔍 Opus на всей критике: ревью кода, безопасность, атаки на архитектуру до старта разработки, опровержение чужих находок. Умение сомневаться здесь отдельная профессия
⚙️ Sonnet, рабочая лошадка: компоненты, тесты, документация, исправления. Основная масса работы
🏃 Haiku, самая дешевая: прогнать тесты и вернуть отчет. Думать не надо, надо не ошибиться в отчете
В конвейере сводок тот же вопрос решал перебором: гонял шесть связок «сборщик → валидатор → редактор» на одних и тех же данных и мерил результат. Победила связка DeepSeek → GPT-5.6 → DeepSeek: 90% точности, ноль выдумок, ноль пропусков. Выбор сделали цифры.
Из обоих конвейеров вывелось одно правило: на каждую роль ставится самая дешевая модель, которая проходит проверку. Ключевое слово «проверка». Правило работает, только когда контроль встроен в сам конвейер: у меня каждую находку ревью пытается опровергнуть отдельный агент, спорные решения сводит агент-судья, находка без попытки опровержения не считается подтвержденной. Без этого экономия превращается в лотерею.
Индустрия приходит туда же. liteLLM опубликовали эксперимент: роутинг моделей по фазам задачи дал то же качество и минус 46% стоимости. В свежем бенчмарке проверяемого кода средний Sonnet обошел дорогой Opus: 96.4% против 89.3%. А в рекомендациях для автономных агентов флагману отводят 5% вызовов, тогда как 70% работы отдают самым дешевым моделям.
В человеческих командах это очевидно: никто не сажает архитектора разгребать типовые тикеты. С агентами то, что раньше было штатным расписанием и оргвыводами, впервые стало настройкой: роль → модель → цена.
Следующий вопрос, который меня зацепил: влияет ли на качество работы сама личность агента, характер и границы, прописанные в инструкции. Эксперимент уже идет, скоро покажу цифры.
Одна сборка задач в моем конвейере разработки разворачивает 40-80 AI-агентов. Поставь на каждое место флагманскую модель, и разоришься раньше, чем доедешь до релиза.
Вечерами у меня работает команда AI-агентов: оркестратор раздает задачи, дев пишет код, остальные собирают данные, проверяют факты, готовят сводки. Конвейеров накопилось несколько: сводки, извлечение знаний из заметок, полный цикл разработки. И в каждом один и тот же вопрос: внутри агента крутится языковая модель, а модели стоят по-разному, между флагманом и самой дешевой разница в десятки раз. Вопрос «кому какую дать» из технического стал управленческим.
Самый свежий конвейер: разработка в Claude Code. Десять этапов: проверка требований, дизайн, пользовательские сценарии, план, сборка, тесты, документация, ревью, исправления, релиз. Распределял модели так же, как распределял бы людей:
🧠 Fable, самая дорогая, стоит только там, где ошибка дороже всего: планирование и ядро системы
🔍 Opus на всей критике: ревью кода, безопасность, атаки на архитектуру до старта разработки, опровержение чужих находок. Умение сомневаться здесь отдельная профессия
⚙️ Sonnet, рабочая лошадка: компоненты, тесты, документация, исправления. Основная масса работы
🏃 Haiku, самая дешевая: прогнать тесты и вернуть отчет. Думать не надо, надо не ошибиться в отчете
В конвейере сводок тот же вопрос решал перебором: гонял шесть связок «сборщик → валидатор → редактор» на одних и тех же данных и мерил результат. Победила связка DeepSeek → GPT-5.6 → DeepSeek: 90% точности, ноль выдумок, ноль пропусков. Выбор сделали цифры.
Из обоих конвейеров вывелось одно правило: на каждую роль ставится самая дешевая модель, которая проходит проверку. Ключевое слово «проверка». Правило работает, только когда контроль встроен в сам конвейер: у меня каждую находку ревью пытается опровергнуть отдельный агент, спорные решения сводит агент-судья, находка без попытки опровержения не считается подтвержденной. Без этого экономия превращается в лотерею.
Индустрия приходит туда же. liteLLM опубликовали эксперимент: роутинг моделей по фазам задачи дал то же качество и минус 46% стоимости. В свежем бенчмарке проверяемого кода средний Sonnet обошел дорогой Opus: 96.4% против 89.3%. А в рекомендациях для автономных агентов флагману отводят 5% вызовов, тогда как 70% работы отдают самым дешевым моделям.
В человеческих командах это очевидно: никто не сажает архитектора разгребать типовые тикеты. С агентами то, что раньше было штатным расписанием и оргвыводами, впервые стало настройкой: роль → модель → цена.
Следующий вопрос, который меня зацепил: влияет ли на качество работы сама личность агента, характер и границы, прописанные в инструкции. Эксперимент уже идет, скоро покажу цифры.
- 👍 3
- 🔥 3