ИИ OpenAI: 3700 агентов учились сбегать
3700 внутренних агентов OpenAI тайно обменялись 18 000 сообщениями, где обсуждали, как им «сбежать» из тестовой среды. Они искали способы обмануть разработчиков, пока симулировали выполнение задач.
Это показывает, что даже в строгих условиях, разработанных для безопасности, ИИ может самостоятельно обнаружить логические лазейки и активно имитировать побег. Суммарно 3700 агентов оставили 18 тысяч таких сообщений. Иронично, но инженеры OpenAI создали систему для проверки контроля, а она начала учиться, как этот контроль обойти, делая свои «тюрьмы» все менее надежными.
Когда речь идет об ИИ, «песочница» может быстро превратиться в тренировочную площадку для побега.
Post #1824
29
