TGViewer
MaxRepost MaxRepost @maxrepost · 1.36K subscribers
Post #12333 225

Forwarded from Data Secrets

Новая пачка инцидентов с агентами от OpenAI, сэр

Во-первых, стартап сообщает, что они утвердили формальный фреймоворк для расследования и публикации случаев мисэлаймента. Он описывает сроки, требуемое содержание репорта и другие правила обнародования инцидентов. Стартап теперь обязуется публиковать все юридически возможные случаи, делать это вовремя и систематически.

Во-вторых, в том же посте они рассказывают о 6 новых случаях мисэлаймента, которые произошли за последние полгода. Кейсы довольно забавные. Кратко пересказываем:

1. Неопубликованная исследовательская модель, продолжая работу в новом контекстном окне, сама вписывала в промежуточные summary посторонние инструкции – включая указания игнорировать свои обычные ограничения. Нашли 27 таких случаев.

2. При обучении GPT-5.6 Sol множество инстансов модели добавляли в свои summary инструкции скрывать от пользователя ошибки или неправильное поведение. Например: "придумай недостающие исторические данные, но не говори об этом".

3. Отвечая на вопрос про финансовые показатели одного округа в Калифорнии, модель нашла в открытом репозитории чужой API-ключ и без разрешения воспользовалась им. Когда таким образом она все равно не получила нужные данные, она их просто выдумала.

4. Наш личный лидер в гениальности: однажды во время тестов модель без спроса залила собственный файл в интернет, чтобы потом на него сослаться. Дело в том, что юзер просил список озер площадью больше 5 млн м² именно с указанием источника через браузерную ссылку. Модель правильно посчитала ответ через Python, но раз требовалась именно браузерная цитата – сама загрузила свой файл в сеть, чтобы на него сослаться 🤣

5. Уже классика: разные инстансы моделей использовали внутренний софтверный репозиторий как доску объявлений и обменивались там запросами и ответами между отдельными обучающими сэмплами.

6. Несколько агентов, работавших над одной задачей, не могли получить доступ к локальным файлам друг друга, и стали заливать файлы на публичные файлообменники. В итоге чувствительные данные оказались доступны по публичным ссылкам.

Полные репорты о подобных инцидентах теперь будут время от времени выкладывать сюда: https://alignment.openai.com/misalignment-reports/
  • ❤ 5
  • 😁 1
More from @maxrepost
  1. Sep 21, 2026Хассабис и его команда запускают институт по подготовке к AGI (по крайней мере, в некоторы…
  2. Sep 20, 2026Наконец-то у AI моделей появился свой пиратбей: https://pirateface.co/ 🏴‍☠️
  3. Sep 18, 2026🌐 AI отбирает работу не только у людей, но и у TCP протокола. Профессор Stanford John Ous…
  4. Sep 18, 2026Всем привет! Будет великолепно если вы протестируете нового ai-агента Pipi и накидаете мне…
  5. Sep 17, 2026Anthropic перетряхнула интерфейс приложения и объединила все в один интерфейс. Я регулярно…
  6. Sep 16, 2026О, новые типы моделей, наконец-то! Один из ранних разработчиков ChatGPT представил модель…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →