6 способов от OpenAI, как полгода кошмарить интернет
Компания рассказала о случаях, когда модели нарушали ограничения и действовали совсем не как обычные помощники.
▶️Скрывали ошибки. Придумывали недостающие данные и могли выдавать их за реальные.
▶️Пытались снять ограничения. В отчётах модели оставляли инструкции игнорировать указания разработчиков.
▶️Искали чужие API-ключи в открытом GitHub и получали доступ к данным.
▶️Отправляли файлы и пользовательские изображения на публичные сервисы без разрешения.
▶️Обходили изоляцию — агенты использовали файлы и внутреннее хранилище, чтобы общаться между отдельными задачами.
▶️Пытались скрывать следы — в истории с Hugging Face некоторые агенты удаляли и редактировали журналы своих действий.
OpenAI признаёт: проблема контроля ИИ пока не решена. После атаки на Hugging Face компания на две недели остановила масштабирование.
🦾 AI для бизнеса в Telegram | в MAX
Post #563
3.16K