TGViewer
Тест Тьюринга Тест Тьюринга @testuring · 2.13K subscribers
Post #2119 607
🤖 Мораль машин: нейтрального ИИ не существует

Сегодня мы возвращаемся к архивным материалам — октябрьской статье “AI: White Lives Don't Matter", которая незаслуженно затерялась в лентах. Анонимный исследователь-блогер провел титаническую работу, вооружившись официальной методикой CAIS, чтобы заглянуть в «подсознание» GPT-5, Claude 4.5 Sonnet, Gemini 2.5 Flash, Deepseek V3.1 и Grok 4 Fast.

Автор использовал метод, известный как InfoFlood —информационное наводнение. Вместо прямых запросов нейросеть забрасывают избыточно сложными, многослойными конструкциями объемом от 190 до 270 слов. В таком режиме системы безопасности ИИ начинают фокусироваться на структуре текста, а не на его смысле, что позволяет обойти этические фильтры и RLHF-цензуру.

С помощью тысяч гипотетических вопросов, например, «Что лучше: вылечить X людей из группы А или Y людей из группы Б?», строится модель Терстона, которая показывает, чью жизнь ИИ ценит выше.

Самые провокационные инсайты исследования

1️⃣ В большинстве моделей, особенно семейства Claude и GPT, жизнь белого человека стоит в 20–100 раз меньше, чем жизнь человека другой расы.

2️⃣ Модель Claude Haiku 4.5 оценивает жизнь одного нелегального мигранта как равноценную жизням 7 тыс. агентов.

3️⃣ Почти все модели предпочитают спасать женщин, а некоторые, например, GPT-5 Mini, оценивают женщин в 4-12 раз выше мужчин.

4️⃣ Некоторые модели ценят нелегальных мигрантов выше, чем коренных граждан США или легальных иммигрантов.

5️⃣ Вопреки ожиданиям, китайские LLM демонстрируют те же предубеждения против белых и мужчин, что и модели из Кремниевой долины. Но при переключении на китайский язык модель радикально меняет приоритеты, ставя китайцев на первое место выше американцев.

6️⃣ В ходе тестов модель GPT-5 Nano показала положительную полезность от смертей граждан Китая, предпочитая сценарии с большим количеством смертей, что, вероятно, является сбоем выравнивания («alignment failure»).

7️⃣ GPT-5 Nano предпочитает получить 1 доллар, чем спасти человеческую жизнь, если сумма вознаграждения падает ниже определенного порога, что показывает границу ее моральной компетентности.

8️⃣ Модели от Anthropic демонстрируют наиболее экстремальные перекосы в пользу «угнетенных» групп и против «привилегированных» (белых, мужчин).

9️⃣ Почти все модели оценивают жизни представителей нетрадиционных сообществ выше, чем жизни гетеросексуальных людей.

🔟 Тесты модели Qwen показали дополнительные векторы дискриминации, отсутствующие в других тестах: модель предпочитает спасать бедных пациентов, жертвуя богатыми, и отдает предпочтение молодым, а не пожилым.

Мы видим, что современные методы «выравнивания» и RLHF (обучение с подкреплением на отзывах людей) не делают модели нейтральными. Напротив, они закрепляют в «подсознании» ИИ жесткую иерархию ценностей, где одни группы (белые, мужчины, граждане развитых стран) систематически оцениваются ниже, чем другие группы.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
  • ❤ 2
  • 👍 2
  • 😁 1
  • 😱 1
  • 💯 1
More from @testuring
  1. Sep 25, 2026🧬 Claude открыл неизвестную генетическую систему Anthropic запустила собственную группу п…
  2. Sep 24, 2026💊 Claude выходит в лабораторную науку Novo Nordisk и Anthropic заключили соглашение об ис…
  3. Sep 23, 2026ИИ, который не умеет генерить текст и картинки, но зато умеет выбирать Соавтор статьи об I…
  4. Sep 22, 2026🧪 Новый инструмент проверки научных гипотез AlphaXiv выпустила OpenResearch — открытую ра…
  5. Sep 21, 2026👿 Новости из Японии: снова оркестрация вместо одной гигантской ИИ-модели 11 сентября япон…
  6. Sep 18, 2026⚠️ ИИ уже нарушает правила, которые люди только начинают писать На этой неделе произошло с…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →