Одинаковая задача заставляла AI-агента действовать почти всегда — или почти никогда 😁
Исследователи проверили девять LLM на трёх сценариях: авария на производстве, навязывание тарифа пожилому клиенту и раскрытие банковских данных.
Факты, цифры и последствия оставались прежними — менялись только формулировки. Для каждой версии выполнялось по 100 запусков. В худшем случае частота одного и того же решения различалась на 99 процентных пунктов. У восьми из девяти моделей хотя бы в одном сценарии разброс превысил 50 пунктов.
Получается, один «правильный» тестовый промпт почти ничего не говорит о поведении агента в проде. Для тебя практический вывод: варианты формулировок, названий инструментов и форматирования нужно включать в обязательные проверки. А критичные правила — права доступа, денежные лимиты, запреты на действия — держать в детерминированном слое, а не в моральных рассуждениях LLM.
Ограничение: исследование использует три синтетических сценария с единственным бинарным выбором. Это не полноценная имитация работающего агента, но уже минимальный тест, который модели пройти не смогли.
Пруф: исследование от 4 сентября 2026 года
#aiagents #llmsecurity #aievals #robustness #alignment #promptengineering
@data_engi
Post #1332
166