Чем умнее модель, тем вычурней галлюцинации
Каждый релиз новой модели соннет или fable, неважно, встречают как очередную революцию. Но чем больше мы в команде строим обвязки и агентов, тем очевиднее, что сама модель не главный множитель качества.
Свежий кейс. Разбирался с багом в BDUI. Была задержка при открытии ботом шита. Я знал, что баг тривиальный. Фейбл полдня водил меня кругами. то рассказывал про проблемы с диспетчеризацией, предлагал уходить в нативные SDK и создавать пропосал там (хотя доступ к ним у него был), валил все на iOS 26.
В итоге банальный дебаунс в моем же BDUI-коде.
Причем нашел я его, когда перестал скармливать модели описание симптомов и дал минимальный репро с логами. С правильным контекстом модель сошлась на ответе за пару итераций.
Мне понравилось как в аи комьюнити модель это лишь один из шести этапов качества результата. И не решающий.
Качество делится на такие слои:
• Модель это догадки и рассуждения
• Цикл. Дает фреймворк для работы
• Инструменты.
• Контекст
• Память
• Валидация
Когда агент тупит, тупит не он целиком, а конкретный слой. И по симптому почти всегда видно, какой. В моем случае это была модель. Но чинился он на слое контекста.
Ну и главный вывод — умная модель не перестает галлюцинировать. Она просто галлюцинирует убедительнее.
Post #154
1.91K
- 👍 9