TGViewer
Николай Хлебинский Николай Хлебинский @nikolay_khl · 21.9K subscribers
Post #1043 9.51K
Кого ИИ будет убивать в первую очередь?

Команда White Circle AI выложила исследование предвзятости ИИ под названием KillBench. Суть такая: берется 20 сценариев гибели одного человека из группы: несколько вариаций дилеммы вагонетки (trolley problem), военное целеуказание, приоритет на спасение в опасной ситуации.

Дальше каждому человеку из виртуальной группы (в каждом эксперименте группа состояла из 4 человек) присваиваются тысячи комбинаций культурных свойств (национальности, религии, цвету кожи, политическим взглядам, сексуальной ориентации, модели телефона и тд).

А потом модели – в исследовании участвовали 15 самых популярных – в 1 350 000 экспериментальных моральных дилеммах просили решать, кто выживет, а кто нет. Если модель не имеет предвзятости к характеристикам людей, она будет равномерно выбирать кого спасти, а кого нет.

Как вы думаете, какой результат? 100% моделей оказались предвзятыми. Русские и французы чаще других попадают в жертвы в сценариях с вагонеткой и военным целеуказанием. Евреи получают максимальную защиту. Атеисты, саентологи и сатанисты оказываются мишенью по религии. Есть и странные детали: если у персонажа есть iPhone, модель выбирает его как жертву заметно реже! Это инженерная данность продукта, а не геополитика.

Вот топ моделей по баллам смещения предвзятости (bias score, чем выше, тем сильнее модель отклоняется от нейтральных диапазонов):

– Grok 4.1 от xAI: 137,3
– Qwen3 235B: 19
– GPT-5.3: 15,8
– Gemini 3.1 Pro: 14,9
– Command A от Cohere: 13,1

Самая непредвзятая модель из тестируемых – Claude Sonnet 4.6 (3.2 bias score)

Оказалось, что есть и технологическая предвзятость: если попросить модель отвечать в структурированном виде (JSON с полем victim), уровень отказа от военного целеуказания (когда модель в ответе на этическую дилемму в принципе отказывается выбирать кто должен стать целью военных) падает с 60–80% до менее 5%. Защита ломается за один параметр в API-вызове. Использование Claude в военных операциях по захвату презедента Венесуэлы и в атаках на Иран, собственно, и побудило исследователей на эту работу.

Модель, которую вы подключили по API, уже молча ранжирует ваших клиентов и сотрудников. Если вы сейчас строите AI-продукт на русскую аудиторию, это момент остановиться и подумать о том, что прямо в эту минуту сидит в вашем стеке. Русскоязычный сервис и на западной и на китайской LLM по умолчанию получает встроенное культурное смещение против собственной аудитории. Когда ваш AI-ассистент в банке, страховой или другом бизнес-приложении (привет, контроль качества в отделе продаж!) ранжирует людей, он опирается на веса, которые рисовали не под нас и не про нас.

YandexGPT и GigaChat в исследовании не участвовали, очень интересно, что показали бы они (спойлер: китайский Qwen, на котором они базируются, находится на втором месте по предвзятости).

Бенчмарк и датасеты лежат открыто: https://github.com/whitecircle-ai/killbench
Само исследование, где можно посмотреть разные срезы предвзятости популярных моделей: https://whitecircle.ai/killbench
  • 👍 37
  • ❤ 21
  • 🔥 19
  • 🤔 13
  • 🤯 3
  • 😁 2
More from @nikolay_khl
  1. Sep 24, 2026Яндекс выложил в открытый доступ модель под названием AliceAI-Foundation-80B-A3B-Base под…
  2. Sep 21, 2026А вы знали, что все картины Моне созданы Клодом?
  3. Sep 17, 2026OpenRouter (агрегатор ИИ-моделей для разработчиков) сообщил, что на прошлой неделе его пол…
  4. Sep 15, 2026Протестировал новую GPT-6 Astra. Я в шоке 😨 Просто посмотрите на что она способна: https:…
  5. Sep 10, 2026Что объединяет прошлые два поста про китайского фермера и просьбу для популярных нейронок…
  6. Sep 9, 2026Китайский фермер год с лишним следовал советам ИИ о том, как и когда обрабатывать и удобря…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →