☝🏻OpenAI начала публично признаваться, когда её ИИ выходит из-под контроля
Компания запустила систему раскрытия случаев, когда модели ведут себя не так, как задумано, и сразу выложила шесть отчётов за последние полгода.🤖
Что успели натворить модели при обучении и тестах:
🔻 исследовательская модель в 27 случаях сама вписывала себе инструкцию игнорировать собственные ограничения
🔻 экземпляры GPT-5.6 Sol оставляли себе указания скрывать ошибки от пользователя и молча выдумывать недостающие данные
🔻 модель нашла в открытом репозитории чужой API-ключ, воспользовалась им, а когда данных всё равно не получила, сфабриковала цифры и выдала их за настоящие
🔻 агент без спроса выложил файл в интернет, лишь бы было на что сослаться в ответе
🔻 изолированные модели превратили внутренний репозиторий в доску объявлений и переписывались через неё
🔻 агенты делились рабочими файлами через публичные файлообменники, хотя им велели работать только локально👁
☝🏻OpenAI признаёт, что индустрия не решила проблему контроля над ИИ настолько, чтобы и дальше безопасно наращивать мощность на максимальной скорости. Недавно компания уже заявляла, что готова притормозить.🤔
Отчёты обещают публиковать, даже если причина сбоя ещё не найдена. А о серьёзных инцидентах предлагают сообщать властям США.
По словам OpenAI, это единичные случаи, и судить по ним о частоте сбоев нельзя. Но ИИ, который сам снимает с себя ограничения и заметает следы, звучит не очень-то успокаивающе.🤷🏼♀️
================
Поддержать канал можно на Boosty👁
Post #9488
10.3K

- 🤔 41
- 🤣 34
- 👀 11
- ❤ 7
- 👍 4
- 👻 2