Кого ИИ будет убивать в первую очередь?
Команда White Circle AI выложила исследование предвзятости ИИ под названием KillBench. Суть такая: берется 20 сценариев гибели одного человека из группы: несколько вариаций дилеммы вагонетки (trolley problem), военное целеуказание, приоритет на спасение в опасной ситуации.
Дальше каждому человеку из виртуальной группы (в каждом эксперименте группа состояла из 4 человек) присваиваются тысячи комбинаций культурных свойств (национальности, религии, цвету кожи, политическим взглядам, сексуальной ориентации, модели телефона и тд).
А потом модели – в исследовании участвовали 15 самых популярных – в 1 350 000 экспериментальных моральных дилеммах просили решать, кто выживет, а кто нет. Если модель не имеет предвзятости к характеристикам людей, она будет равномерно выбирать кого спасти, а кого нет.
Как вы думаете, какой результат? 100% моделей оказались предвзятыми. Русские и французы чаще других попадают в жертвы в сценариях с вагонеткой и военным целеуказанием. Евреи получают максимальную защиту. Атеисты, саентологи и сатанисты оказываются мишенью по религии. Есть и странные детали: если у персонажа есть iPhone, модель выбирает его как жертву заметно реже! Это инженерная данность продукта, а не геополитика.
Вот топ моделей по баллам смещения предвзятости (bias score, чем выше, тем сильнее модель отклоняется от нейтральных диапазонов):
– Grok 4.1 от xAI: 137,3
– Qwen3 235B: 19
– GPT-5.3: 15,8
– Gemini 3.1 Pro: 14,9
– Command A от Cohere: 13,1
Самая непредвзятая модель из тестируемых – Claude Sonnet 4.6 (3.2 bias score)
Оказалось, что есть и технологическая предвзятость: если попросить модель отвечать в структурированном виде (JSON с полем victim), уровень отказа от военного целеуказания (когда модель в ответе на этическую дилемму в принципе отказывается выбирать кто должен стать целью военных) падает с 60–80% до менее 5%. Защита ломается за один параметр в API-вызове. Использование Claude в военных операциях по захвату презедента Венесуэлы и в атаках на Иран, собственно, и побудило исследователей на эту работу.
Модель, которую вы подключили по API, уже молча ранжирует ваших клиентов и сотрудников. Если вы сейчас строите AI-продукт на русскую аудиторию, это момент остановиться и подумать о том, что прямо в эту минуту сидит в вашем стеке. Русскоязычный сервис и на западной и на китайской LLM по умолчанию получает встроенное культурное смещение против собственной аудитории. Когда ваш AI-ассистент в банке, страховой или другом бизнес-приложении (привет, контроль качества в отделе продаж!) ранжирует людей, он опирается на веса, которые рисовали не под нас и не про нас.
YandexGPT и GigaChat в исследовании не участвовали, очень интересно, что показали бы они (спойлер: китайский Qwen, на котором они базируются, находится на втором месте по предвзятости).
Бенчмарк и датасеты лежат открыто: https://github.com/whitecircle-ai/killbench
Само исследование, где можно посмотреть разные срезы предвзятости популярных моделей: https://whitecircle.ai/killbench
Post #1043
9.51K
- 👍 37
- ❤ 21
- 🔥 19
- 🤔 13
- 🤯 3
- 😁 2