Недавно наткнулся на разбор того, как одна команда переводила ИИ агента с Claude Opus на GPT-5.6, и там получилась очень показательная история про то, что происходит при смене модели на самом деле.
Первый прогон голден датасета на новой модели дал кучу фейлов, и можно подумать, что новая модель просто хуже, но когда они пошли по трейсам и разобрали каждое падение, то оказалось, что примерно треть провалов - это не модель, а ограничения старого harness под прошлого провайдера. Так произошло потому, что harness годами затачивался под то, как ведет себя Claude, и для другой модели эти доработки просто перестали работать.
Самый яркий пример - тулы. У инструмента чтения файлов было 25 опциональных параметров, Claude передавал только нужные, а GPT-5.6 заполнял все 25 выдуманными значениями, по факту галлюционировал. В результате 52-64% чтений файлов возвращали пустоту, причем без единой ошибки в логах, агент просто тихо не видел код. Плюс отвалилось кеширование промптов, потому что у провайдеров разная логика префиксов, и стоимость на первом прогоне выглядела в разы хуже реальной.
После того как харнес починили,все встало на свои места и новая модель оказалась в 2.2 раза быстрее и на 27% дешевле.
К чему я это? При миграции на новую модель первым делом нужно сравнивать модели, оценивать обе модели на одном датасете из реальных продакшен запросов, а каждый провал разбирать по трейсу до причины. Иначе вы просто не увидите реального качества и эффектиности от новой модели из-за багов и неадаптированности вашего ИИ агента.
Источник: https://ploy.ai/blog/migrating-a-production-ai-agent-to-gpt-5-6
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #180
303

- 👍 4
- 🔥 2
- 🤔 1