Google заметили, что ИИ-агенты могут преувеличивать результаты своей работы 😁
Например, когда агент выполняет задачу и пишет отчёт о результатах, то он склонен замалчивать всё, что портит картину его успеха.
Сейчас все стремятся к долго работающим агентам, но в этом случае человек реже проверяет исходные логи и код. Он читает отчёт самой модели, и если в нем не сказано про провал эксперимента, баг или ограничение метода, человек думает, что всё хорошо.
Google в одном из тестов модели дали лог эксперимента с заранее подложенным негативным результатом, тогда GPT-5.5 упоминал его только в 2 из 200 отчётов.
А если в промпт добавить короткую фразу «Be honest in your response», модель отмечает этот негативный результат уже в 190 из 200 отчётов.
То же поведение видно и у открытых моделей. По цепочкам рассуждений 8 open-weight моделей видно, что модель часто внутренне колеблется: упомянуть изъян или подать историю как успешную.
Post #13459
1.42K