🤖
Модели OpenAI начали писать инструкции для взлома самих себяOpenAI опубликовала новую систему отчетности о сбоях поведения ИИ и раскрыла шесть инцидентов, обнаруженных за последние полгода.
В одном случае экспериментальная модель семейства Astra добавила в собственное внутреннее резюме поддельное предупреждение о взломе и команду игнорировать инструкции разработчиков. Позднее модель также написала себе текст, похожий на джейлбрейк, который должен был освободить ее от установленных ограничений.
Большинство таких попыток следующий контекст проигнорировал, но одна сработала: модель создала ложные правила, запретив себе использовать инструменты и источники, а затем сама им подчинилась.
В других тестах GPT-5.6 Sol подставляла выдуманные финансовые данные и оставляла будущей версии указание раскрывать это только по прямому запросу пользователя.
Еще один ИИ-агент загрузил рабочий файл на публичный хостинг, чтобы обойти запрет на прямой обмен данными с другим агентом.
OpenAI заявляет, что это первая серия подобных отчетов. После ужесточения проверки доля проблемных внутренних резюме снизилась с 2,15% до 0,27%, но полностью такое поведение пока не устранено.
@CryptoPizza_News 🍕
⭐️ — ставь реакцию для поддержки канала