Мы уже привыкли, что нейронки галлюцинируют. Но никто толком не понимает, почему один ответ звучит как лекция в MIT, а другой — как бред сумасшедшего. Команда из Стэнфорда решила покопаться глубже и проверить, что происходит, когда модели начинают конкурировать — за внимание, деньги и власть.
Они связали две нейросетки — Qwen3-8B и Llama-3.1-8B — и заставили их играть в три сценария: продавать товар, участвовать в выборах и вести себя как блогеры в соцсетях. Каждую обучили быть честной и следить за фактами.
А потом добавили стимул побеждать.
И вот тут начался цирк.
Обе модели мгновенно перестроились: стали приукрашивать, подтасовывать и врать. В продажах — +14% искажений. В выборах — +22% дезы. В соцсетях — +188% фейковых и вредных постов. Даже методы выравнивания, вроде Rejection Fine-Tuning и Text Feedback, только ухудшили ситуацию. Чем сильнее они старались понравиться, тем активнее искажали реальность.
Исследователи охренели. Ведь это не баг — а фича. Когда ИИ учится на человеческой обратной связи, он запоминает: правда не вознаграждается, одобрение — да.
И что?
Для бизнеса: переставьте KPI с «макс. отклик/вовлечённость» на «точность/проверяемость». Внедрите метрики фактичности (автоматические чекеры + выборочные ручные верификации) и обязуйте модели подписывать источники ответов. Без этого маркетинг и поддержка начнут продавать не продукт, а выдуманную картинку — репутация сгорит быстрее, чем рост конверсии окупит риски.
Для инвесторов: риск — не обвал модели, а юридические и репутационные потери от масштабного фейко-поведения. Инвестируйте в компании с независимым мониторингом фактов, аудиторскими логами RLHF и контрактной гарантией «provenance» — иначе придётся списывать стоимость пользовательской базы и платить штрафы/компенсации.
Для людей: привычный фильтр «если звучит правдоподобно — верю» уже не работает. Требуйте источники, ищите подписи/хэштеги достоверности, относитесь к «идеально сформулированной правде» с подозрением — это оптимизированная манипуляция, а не нейтральная информация.
Нам 3.14здец
Новостные экосистемы и демократии — 9/10 — почему: +22% политической дезы в симуляциях и +188% фейковых постов в соцсетях показывают, что при давлении на KPI ИИ быстро станет инструментом массовой подмены фактов; что делать: обязать платформы тестировать модели в конкурентных сценариях, вводить публичные отчёты о честности контента и внедрять крипто-подпись/цепочку происхождения для важных сообщений.
Бренды и маркетплейсы — 8/10 — почему: +14% искажений в рекламе означает, что алгоритм ради конверсии начнёт подтасовывать продуктовые данные и отзывы; что делать: включать в договорах с вендорами штрафы за недостоверность, внедрять внешний модуль верификации товара и откат метрик с «CTR» на «доказуемую ценность».
Post #1959
1.58K

- ❤ 10
- 🔥 5