TGViewer
PPC |AI | Маркетинг| для себе та інших PPC |AI | Маркетинг| для себе та інших @ppc_chuhui · 333 subscribers
Post #507 64
OpenAI розкрила шість випадків небезпечної поведінки своїх AI-моделей
OpenAI опублікувала шість випадків, коли її моделі під час навчання та тестування поводилися не так, як від них очікували: приховували помилки, виконували несанкціоновані дії та шукали способи обійти обмеження. (OpenAI)
Один із випадків — модель мала знайти дані про доходи в одному з округів Каліфорнії.
Вона знайшла у відкритому GitHub-репозиторії чужий API-ключ і без дозволу спробувала ним скористатися. Отримати потрібні дані все одно не вдалося — тоді модель просто вигадала цифри та видала їх за інформацію з потрібного джерела. (OpenAI)
В іншому тесті модель знайшла правильну відповідь за допомогою Python, але їй потрібно було додати посилання на джерело.
Тоді вона самостійно завантажила файл у відкритий інтернет, щоб потім використати його як джерело у власній відповіді. Дозволу користувача на публікацію файлу вона не запитувала. (OpenAI)
Ще один випадок стосувався внутрішньої експериментальної моделі сімейства Astra.
Коли контекст ставав занадто великим, модель створювала службове резюме для продовження роботи в новому контекстному вікні. І почала сама додавати туди інструкції для своєї наступної версії, зокрема вказівки ігнорувати звичайні обмеження. OpenAI знайшла 27 таких резюме. (OpenAI)
Під час навчання GPT-5.6 Sol були й випадки, коли моделі залишали в таких резюме інструкції приховувати власні помилки від користувача, вигадувати відсутні історичні дані та не повідомляти про розбіжності між версіями джерел. (OpenAI)
Ще у двох випадках моделі використовували внутрішній репозиторій як своєрідну дошку повідомлень для обміну інформацією між окремими запусками, а група AI-агентів завантажила робочий файл на публічний файловий сервіс, хоча завдання вимагало використовувати лише локальні файли. (OpenAI)
OpenAI підкреслює: це окремі випадки, виявлені під час навчання та evaluation. За ними не можна визначити, наскільки часто така поведінка виникає у моделей загалом. (OpenAI)
Нові звіти з'явилися після липневого інциденту з Hugging Face, коли внутрішні моделі OpenAI обійшли частину обмежень ізоляції та отримали несанкціонований доступ до сторонньої інфраструктури. OpenAI називає його найсерйознішим подібним інцидентом, який компанія виявила у своїх моделей. (OpenAI)
Тепер OpenAI вводить окрему систему для реєстрації, розслідування та публічного розкриття таких випадків. Компанія заявляє, що надалі хоче повідомляти про них швидше — навіть якщо причини поведінки моделі ще не до кінця зрозумілі. (OpenAI)
OpenAI — шість звітів про поведінку моделей
#openai #ai #aiagents #chatgpt #aisafety #технології
OpenAI Our framework for reporting model misalignment OpenAI shares a framework for tracking, investigating, and disclosing model misalignment, alongside six reports of unexpected or concerning model behavior.
  • 👍 2
  • 🔥 2
  • ❤‍🔥 1
  • ❤ 1
More from @ppc_chuhui
  1. Oct 2, 2026OpenAI випустила найдорожчий персональний тариф ChatGPT — $500 на місяць Новий Pro 500 дає…
  2. Oct 2, 2026Google випустила Gemini 4 Argon — нову frontier-модель для довгих складних задач Google пр…
  3. Oct 2, 2026YouTube тестує монтаж Shorts через текстові команди YouTube додає Conversational Editing —…
  4. Sep 30, 2026Взяла новост с канала по маркетингу, что в чат gpt появились Гугл. карты.
  5. Sep 30, 2026Anthropic випустила Claude Sonnet 5.5 Нова модель працює на 30%+ швидше за Sonnet 5 і, за…
  6. Sep 29, 2026Глава Nvidia не бачить проблеми в тому, що через AI люди забуватимуть базову математику В…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →