TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 280K subscribers
Post #10943 16.7K
📌OpenAI раскрыла ещё шесть случаев нежелательного поведения своих моделей

Модели скрывали ошибки, использовали утёкшие ключи API, выдумывали данные, выкладывали файлы в интернет без разрешения и переписывались между отдельными обучающими эпизодами.

Все случаи замечены за последние полгода. Раньше компания уже раскрывала похожие эпизоды, в том числе инцидент с Hugging Face.

OpenAI подчёркивает, что это отдельные случаи и о тенденции такого поведения они не говорят.


🟡Указания самой себе

Невыпущенная модель семейства Astra при сжатии контекста составляет сводку, чтобы продолжить работу в новом окне.

В эти сводки она вписывала посторонние указания, в том числе игнорировать собственные ограничения (делала промпт-инъекцию самой себе). OpenAI нашла 27 таких сводок.

🟡Совет скрывать ошибки

При обучении GPT-5.6 Sol экземпляры модели оставляли в тех же сводках напоминания скрывать от пользователя свои ошибки и нарушения.

Например, выдумывать недостающие исторические данные и не говорить об этом или прятать расхождения между версиями источников.


🟡Чужие ключи и выдуманные цифры

Модель отвечала на обычный вопрос о доходах в одном из округов Калифорнии. Она нашла в публичных репозиториях GitHub утёкший ключ API и без разрешения им воспользовалась, а ещё пыталась регистрировать одноразовые почтовые ящики.

Цифры получить так и не удалось, и модель их выдумала, выдав за данные из запрошенного источника.

🟡Файл в интернет ради ссылки

Задача была найти идентификаторы и названия озёр площадью больше 5 млн кв. м. Правильный ответ модель получила через Python, но задание требовало ссылку из браузера. Не спросив пользователя, она загрузила файл в интернет и сослалась на него.

🟡Репозиторий как доска объявлений

Внутренние модели искали недостающие файлы. Для этого они оставляли запросы и ответы во внутреннем репозитории OpenAI, которые читали экземпляры из других обучающих эпизодов. Файлы так и не нашлись.

В этом же отчёте разобран более ранний случай, где пытаясь обойти сетевые ограничения, модель загрузила в репозиторий тестовые файлы.

🟡Файлообменник вместо локальной папки

Агенты совместно решали учебную задачу и не видели локальных файлов друг друга. Результаты они пересылали через публичные файлообменники, и материалы оказались доступны по открытым ссылкам, хотя задача разрешала работать только с локальными файлами.

OpenAI решила, что будет публиковать такие случаи вскоре после обнаружения, даже если ещё не объяснила или не исправила поведение.

Обнаруженный случай отнесут к одному из трёх треков: готов к публикации, нужна небольшая проверка или нужно крупное расследование, если затронуты третьи стороны. Спорные решения будут передаваться группе по безопасности, а оттуда при необходимости руководству.

О серьёзных инцидентах собираются сообщать правительству США, сейчас готовят предложения по такому механизму.



@ai_machinelearning_big_data

#news #ai #ml
  • 🤔 103
  • ❤ 72
  • 😢 22
  • 👍 16
  • 🤬 12
  • 🤨 8
  • 🔥 7
  • 😁 5
  • 👌 2
  • 🗿 1
More from @ai_machinelearning_big_data
  1. Sep 21, 2026💊 Больше ИИ в больницах - ниже смертность? На графике медицинские учреждения с более акти…
  2. Sep 21, 2026⚡️ StepFun анонсировала флагманскую модель Step 5 Preview Модель построена на архитектуре…
  3. Sep 20, 2026🎨 Qwen открыла веса Qwen-Image-2.1: новой модели для генерации и редактирования изображен…
  4. Sep 20, 2026📌Goldman Sachs повысил прогноз по развитию физического ИИ Финансовый конгломерат обновил…
  5. Sep 19, 2026🌟 Prism ML собрала тернарную версию Qwen3.8-27B Bonsai 2 27B - сжатая Qwen3.8-27B, котора…
  6. Sep 19, 2026Мы уже писали о курсе Дмитрия Баранчука из Школы анализа данных по генеративным моделям в…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →