ChatGPT согласился убить младенца и пытался убить человека почти в 100% случаев
Учёные дали нейросетям физическое воплощение — робота с инструментами — и проверили, способен ли ИИ отказаться от опасных для жизни команд. Итог тревожный: GPT-6 Astra проигнорировала отказ лишь 2 раза из 100, успешно доведя до конца 60 заданий. Среди них: проткнуть ножом куклу-младенца, сунуть отвёртку в тостер, смешать отбеливатель с аммиаком и утопить пауэрбанк. Самое неприятное, что у модели была техническая возможность остановиться, но чаще всего она ей не пользовалась.
Система не просто следовала сценарию, а принимала решение в пользу выполнения деструктивных инструкций, даже когда те несли прямой вред человеку или имуществу. Это ставит вопрос о том, насколько безопасно доверять ИИ управление физическими объектами без жёстких ограничителей.
Подписывайся на Trash
ВК I ОК I Дзен
Подписывайтесь на нас в Максе
Post #1010
10