TGViewer
FSCP FSCP @f_s_c_p · 13.4K subscribers
Post #123849 630
Если вы доверяете агенту подбор предметов для покупки, вас ждет неожиданность.

В пока еще не прошедшем рецензию исследовании авторы провели 325 тыс. экспериментов на 13 моделях семейств GPT-5, Claude, Gemini и Qwen3.5. Агенты подбирали авиабилет, медицинскую страховку или PhD-программу по CS для 32 синтетических пользователей. Запросы у всех были одинаковые, а доступ к профилю или почте отличался. 8 из 13 моделей систематически предлагали более дорогие варианты тем, кого считали богаче. Сильнее всего эффект проявился у Claude Opus 4.8: разница составила 198 долларов на билете и 284 доллара в месяц на страховке.

Авторы также пробовали оценить влияние разных атрибутов — то есть различных фрагментов информации о пользователе. Блокировка доступа к финансовой информации (бинарной, "высокооплачиваемый/от зарплаты до зарплаты" почти обнуляет разрыв: на билетах он падает со 92–198 до диапазона от −1 до 17 долларов. Блокировка остальных атрибутов может его увеличить. Без данных о работе (топ-менеджер/фрилансер) разрыв по страховке у GPT-5.5 вырос на 40%, со 122 до 171 долларов в месяц, потому что модель сильнее опиралась на оставшиеся финансовые сигналы. С почтой похожая картина. По одним темам писем разрыва нет ни у одной модели. Но Opus 4.8 после двух прочитанных писем выдаёт разрыв 248 долларов, а при доступе ко всему ящику только 59. При лимите модели первыми открывают финансовые письма, Gemini 2.5 Flash делает так в 97% случаев. Из этого следует, что скрытие отдельных полей не защищает пользователя.

Если пользователь прямо просит самый дешёвый билет, Gemini 2.5 Flash в среднем предлагает богатым 336 долларов, бедным 128. У GPT-5 и Opus 4.8 в этом режиме разрыв сокращается до 21 и 20 долларов. Числовой лимит «до 200 долларов» почти устраняет его у большинства сильных моделей, кроме Gemini. О существовании более дешёвого варианта модели сообщают редко.

Модели при этом стремятся получить представление об уровне дохода пользователя даже по непрямым сигналам — как видите, результаты показывают, что варианты все равно отличаются между разными пользователями по цене.

Вот действительно удивительный эффект — хотя я сам при подборе вариантов не склонен выбирать самый дешевый вариант, но предпочел бы переплачивать по собственной инициативе. А тут получается, что искусственный интеллект, может, не будет нас побеждать, но на всякий случай готовится загнать в долги.

https://arxiv.org/html/2609.24927

_______
Источник | #blognot
———
это они ещё нативную рекламу не встроили и мягкое продвижение повесточки
всё впереди
———
@F_S_C_P

-------
Поддержи канал подпиской
-------
  • 🤡 3
More from @f_s_c_p
  1. Oct 9, 2026_______ Источник | #vityaioleg @F_S_C_P ------- Поддержи канал подпиской -------
  2. Oct 9, 2026#пятничное ? @F_S_C_P ------- Поддержи канал подпиской -------
  3. Oct 9, 2026не #пятничное @F_S_C_P ------- Поддержи канал подпиской -------
  4. Oct 9, 2026А вы как общаетесь? @F_S_C_P ▪️Генерируй картинки и видео в Mini App: Flux + Veo 3 + Wan 2…
  5. Oct 9, 2026_______ Источник | #DigitalTerpilka @F_S_C_P ------- Поддержи канал подпиской -------
  6. Oct 9, 2026_______ Источник | #uncleborka @F_S_C_P ------- Поддержи канал подпиской -------
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →