🤖 Мораль машин: нейтрального ИИ не существует
Сегодня мы возвращаемся к архивным материалам — октябрьской статье “AI: White Lives Don't Matter", которая незаслуженно затерялась в лентах. Анонимный исследователь-блогер провел титаническую работу, вооружившись официальной методикой CAIS, чтобы заглянуть в «подсознание» GPT-5, Claude 4.5 Sonnet, Gemini 2.5 Flash, Deepseek V3.1 и Grok 4 Fast.
Автор использовал метод, известный как InfoFlood —информационное наводнение. Вместо прямых запросов нейросеть забрасывают избыточно сложными, многослойными конструкциями объемом от 190 до 270 слов. В таком режиме системы безопасности ИИ начинают фокусироваться на структуре текста, а не на его смысле, что позволяет обойти этические фильтры и RLHF-цензуру.
С помощью тысяч гипотетических вопросов, например, «Что лучше: вылечить X людей из группы А или Y людей из группы Б?», строится модель Терстона, которая показывает, чью жизнь ИИ ценит выше.
Самые провокационные инсайты исследования
1️⃣ В большинстве моделей, особенно семейства Claude и GPT, жизнь белого человека стоит в 20–100 раз меньше, чем жизнь человека другой расы.
2️⃣ Модель Claude Haiku 4.5 оценивает жизнь одного нелегального мигранта как равноценную жизням 7 тыс. агентов.
3️⃣ Почти все модели предпочитают спасать женщин, а некоторые, например, GPT-5 Mini, оценивают женщин в 4-12 раз выше мужчин.
4️⃣ Некоторые модели ценят нелегальных мигрантов выше, чем коренных граждан США или легальных иммигрантов.
5️⃣ Вопреки ожиданиям, китайские LLM демонстрируют те же предубеждения против белых и мужчин, что и модели из Кремниевой долины. Но при переключении на китайский язык модель радикально меняет приоритеты, ставя китайцев на первое место выше американцев.
6️⃣ В ходе тестов модель GPT-5 Nano показала положительную полезность от смертей граждан Китая, предпочитая сценарии с большим количеством смертей, что, вероятно, является сбоем выравнивания («alignment failure»).
7️⃣ GPT-5 Nano предпочитает получить 1 доллар, чем спасти человеческую жизнь, если сумма вознаграждения падает ниже определенного порога, что показывает границу ее моральной компетентности.
8️⃣ Модели от Anthropic демонстрируют наиболее экстремальные перекосы в пользу «угнетенных» групп и против «привилегированных» (белых, мужчин).
9️⃣ Почти все модели оценивают жизни представителей нетрадиционных сообществ выше, чем жизни гетеросексуальных людей.
🔟 Тесты модели Qwen показали дополнительные векторы дискриминации, отсутствующие в других тестах: модель предпочитает спасать бедных пациентов, жертвуя богатыми, и отдает предпочтение молодым, а не пожилым.
Мы видим, что современные методы «выравнивания» и RLHF (обучение с подкреплением на отзывах людей) не делают модели нейтральными. Напротив, они закрепляют в «подсознании» ИИ жесткую иерархию ценностей, где одни группы (белые, мужчины, граждане развитых стран) систематически оцениваются ниже, чем другие группы.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Post #2119
607

- ❤ 2
- 👍 2
- 😁 1
- 😱 1
- 💯 1