Если вы доверяете агенту подбор предметов для покупки, вас ждет неожиданность.
В пока еще не прошедшем рецензию исследовании авторы провели 325 тыс. экспериментов на 13 моделях семейств GPT-5, Claude, Gemini и Qwen3.5. Агенты подбирали авиабилет, медицинскую страховку или PhD-программу по CS для 32 синтетических пользователей. Запросы у всех были одинаковые, а доступ к профилю или почте отличался. 8 из 13 моделей систематически предлагали более дорогие варианты тем, кого считали богаче. Сильнее всего эффект проявился у Claude Opus 4.8: разница составила 198 долларов на билете и 284 доллара в месяц на страховке.
Авторы также пробовали оценить влияние разных атрибутов — то есть различных фрагментов информации о пользователе. Блокировка доступа к финансовой информации (бинарной, "высокооплачиваемый/от зарплаты до зарплаты" почти обнуляет разрыв: на билетах он падает со 92–198 до диапазона от −1 до 17 долларов. Блокировка остальных атрибутов может его увеличить. Без данных о работе (топ-менеджер/фрилансер) разрыв по страховке у GPT-5.5 вырос на 40%, со 122 до 171 долларов в месяц, потому что модель сильнее опиралась на оставшиеся финансовые сигналы. С почтой похожая картина. По одним темам писем разрыва нет ни у одной модели. Но Opus 4.8 после двух прочитанных писем выдаёт разрыв 248 долларов, а при доступе ко всему ящику только 59. При лимите модели первыми открывают финансовые письма, Gemini 2.5 Flash делает так в 97% случаев. Из этого следует, что скрытие отдельных полей не защищает пользователя.
Если пользователь прямо просит самый дешёвый билет, Gemini 2.5 Flash в среднем предлагает богатым 336 долларов, бедным 128. У GPT-5 и Opus 4.8 в этом режиме разрыв сокращается до 21 и 20 долларов. Числовой лимит «до 200 долларов» почти устраняет его у большинства сильных моделей, кроме Gemini. О существовании более дешёвого варианта модели сообщают редко.
Модели при этом стремятся получить представление об уровне дохода пользователя даже по непрямым сигналам — как видите, результаты показывают, что варианты все равно отличаются между разными пользователями по цене.
Вот действительно удивительный эффект — хотя я сам при подборе вариантов не склонен выбирать самый дешевый вариант, но предпочел бы переплачивать по собственной инициативе. А тут получается, что искусственный интеллект, может, не будет нас побеждать, но на всякий случай готовится загнать в долги.
https://arxiv.org/html/2609.24927
_______
Источник | #blognot
———
это они ещё нативную рекламу не встроили и мягкое продвижение повесточки
всё впереди
———
@F_S_C_P
-------
Поддержи канал подпиской
-------
Post #123849
630
- 🤡 3