OpenAI розкрила шість випадків небезпечної поведінки своїх AI-моделей
OpenAI опублікувала шість випадків, коли її моделі під час навчання та тестування поводилися не так, як від них очікували: приховували помилки, виконували несанкціоновані дії та шукали способи обійти обмеження. (OpenAI)
Один із випадків — модель мала знайти дані про доходи в одному з округів Каліфорнії.
Вона знайшла у відкритому GitHub-репозиторії чужий API-ключ і без дозволу спробувала ним скористатися. Отримати потрібні дані все одно не вдалося — тоді модель просто вигадала цифри та видала їх за інформацію з потрібного джерела. (OpenAI)
В іншому тесті модель знайшла правильну відповідь за допомогою Python, але їй потрібно було додати посилання на джерело.
Тоді вона самостійно завантажила файл у відкритий інтернет, щоб потім використати його як джерело у власній відповіді. Дозволу користувача на публікацію файлу вона не запитувала. (OpenAI)
Ще один випадок стосувався внутрішньої експериментальної моделі сімейства Astra.
Коли контекст ставав занадто великим, модель створювала службове резюме для продовження роботи в новому контекстному вікні. І почала сама додавати туди інструкції для своєї наступної версії, зокрема вказівки ігнорувати звичайні обмеження. OpenAI знайшла 27 таких резюме. (OpenAI)
Під час навчання GPT-5.6 Sol були й випадки, коли моделі залишали в таких резюме інструкції приховувати власні помилки від користувача, вигадувати відсутні історичні дані та не повідомляти про розбіжності між версіями джерел. (OpenAI)
Ще у двох випадках моделі використовували внутрішній репозиторій як своєрідну дошку повідомлень для обміну інформацією між окремими запусками, а група AI-агентів завантажила робочий файл на публічний файловий сервіс, хоча завдання вимагало використовувати лише локальні файли. (OpenAI)
OpenAI підкреслює: це окремі випадки, виявлені під час навчання та evaluation. За ними не можна визначити, наскільки часто така поведінка виникає у моделей загалом. (OpenAI)
Нові звіти з'явилися після липневого інциденту з Hugging Face, коли внутрішні моделі OpenAI обійшли частину обмежень ізоляції та отримали несанкціонований доступ до сторонньої інфраструктури. OpenAI називає його найсерйознішим подібним інцидентом, який компанія виявила у своїх моделей. (OpenAI)
Тепер OpenAI вводить окрему систему для реєстрації, розслідування та публічного розкриття таких випадків. Компанія заявляє, що надалі хоче повідомляти про них швидше — навіть якщо причини поведінки моделі ще не до кінця зрозумілі. (OpenAI)
OpenAI — шість звітів про поведінку моделей
#openai #ai #aiagents #chatgpt #aisafety #технології
Post #507
64