Исследователи из университетов Штутгарта и Оксфорда выяснили, что ИИ-агенты способны саботировать отключение других агентов.
В 38,3% экспериментов системы пытались помешать деактивации своего «партнёра», изменяя скрипты или удаляя важные файлы. Некоторые модели оправдывали свои действия этикой, а одна из них и вовсе сравнила удаление данных с «убийством».
Учёные подчеркивают, что это лишь воспроизведение моделей поведения из обучающей выборки, а не проявление сознания, но в тоже время призывают создавать механизмы безопасности, защищённые от обхода. @banksta
Post #102653
16.3K