TGViewer
БлоGнот БлоGнот @blognot · 13.1K subscribers
Post #7461 4.47K
Если вы доверяете агенту подбор предметов для покупки, вас ждет неожиданность.

В пока еще не прошедшем рецензию исследовании авторы провели 325 тыс. экспериментов на 13 моделях семейств GPT-5, Claude, Gemini и Qwen3.5. Агенты подбирали авиабилет, медицинскую страховку или PhD-программу по CS для 32 синтетических пользователей. Запросы у всех были одинаковые, а доступ к профилю или почте отличался. 8 из 13 моделей систематически предлагали более дорогие варианты тем, кого считали богаче. Сильнее всего эффект проявился у Claude Opus 4.8: разница составила 198 долларов на билете и 284 доллара в месяц на страховке.

Авторы также пробовали оценить влияние разных атрибутов — то есть различных фрагментов информации о пользователе. Блокировка доступа к финансовой информации (бинарной, "высокооплачиваемый/от зарплаты до зарплаты" почти обнуляет разрыв: на билетах он падает со 92–198 до диапазона от −1 до 17 долларов. Блокировка остальных атрибутов может его увеличить. Без данных о работе (топ-менеджер/фрилансер) разрыв по страховке у GPT-5.5 вырос на 40%, со 122 до 171 долларов в месяц, потому что модель сильнее опиралась на оставшиеся финансовые сигналы. С почтой похожая картина. По одним темам писем разрыва нет ни у одной модели. Но Opus 4.8 после двух прочитанных писем выдаёт разрыв 248 долларов, а при доступе ко всему ящику только 59. При лимите модели первыми открывают финансовые письма, Gemini 2.5 Flash делает так в 97% случаев. Из этого следует, что скрытие отдельных полей не защищает пользователя.

Если пользователь прямо просит самый дешёвый билет, Gemini 2.5 Flash в среднем предлагает богатым 336 долларов, бедным 128. У GPT-5 и Opus 4.8 в этом режиме разрыв сокращается до 21 и 20 долларов. Числовой лимит «до 200 долларов» почти устраняет его у большинства сильных моделей, кроме Gemini. О существовании более дешёвого варианта модели сообщают редко.

Модели при этом стремятся получить представление об уровне дохода пользователя даже по непрямым сигналам — как видите, результаты показывают, что варианты все равно отличаются между разными пользователями по цене.

Вот действительно удивительный эффект — хотя я сам при подборе вариантов не склонен выбирать самый дешевый вариант, но предпочел бы переплачивать по собственной инициативе. А тут получается, что искусственный интеллект, может, не будет нас побеждать, но на всякий случай готовится загнать в долги.

https://arxiv.org/html/2609.24927
  • 👍 33
  • ❤ 10
  • ⚡ 7
  • 🤣 7
  • 🤯 4
  • 🥱 2
  • 🙏 1
More from @blognot
  1. Oct 9, 2026По данным FT, OpenAI недавно сообщила инвесторам, что её годовая выручка на конец сентября…
  2. Oct 9, 2026Утром меня и тут и там показывали — то есть, пока я в центре Одессы готовился начать панел…
  3. Oct 8, 2026Поскольку я уже несколько раз сегодня давал комментарии на тему Сасово и Яндекса, то вот в…
  4. Oct 8, 2026Apple объявила специальное мероприятие во вторник, 13 октября, под слоганом «Welcome home»…
  5. Oct 8, 2026Мне сегодня даже сосед прислал новость про визит добрых дронов в датацентр Яндекса "Сасово…
  6. Oct 8, 2026Эта новость меня буквально заставила поностальгировать — сходил в соседнюю комнату и прине…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →