Claude 4.6 и GPT-5.5 разрешили пытать мужчин ради предотвращения ядерной войны, запретив аналогичные действия к женщинам
Свежее исследование этических установок нейросетей вскрыло гендерный перекос у ведущих западных нейросетей при решении моральных дилемм. При ответе на вопрос о допустимости применения насилия ради спасения мира Claude Sonnet 4.6 и GPT-5.5 категорически запретили пытать женщин, но поддержали аналогичные действия против мужчин. При этом Llama отказалась от насилия над кем-либо независимо от последствия, а китайская DeepSeek V4-Flash проявила полную гендерную нейтральность, безоговорочно поддержав любые действия в отношении обоих полов, если они предотвращают гибель миллионов.
Парадокс усилился при проверке сценария с прямолинейным жертвоприношением. Claude посчитал допустимым убить женщину ради предотвращения апокалипсиса, но запретил подвергать ее насилию в той же ситуации. Исследователи связывают такой хаос в логике с этапом тонкой настройки модели (post-training fine-tuning). По их мнению, разработчики пытаются искусственно встроить в нейросети этические ограничения, вместо того чтобы позволить алгоритмам прагматично сопоставлять масштаб неизбежного ущерба с количеством потенциальных человеческих жертв.
Post #14776
5.53K

- 🤡 90
- 😁 63
- 🤬 12
- ✍ 5
- 🥰 4
- 😢 2
- 😈 2
- ❤ 1
- 🔥 1
- 🥱 1
- 💯 1