self‑replicating prompt injection (самокопирующиеся промпт‑инъекции).• OpenAI смогла обнаружить сценарий во время тестирования моделей с помощью автоматизированного red‑teaming‑агента
GPT‑Red. Пока нет доказательств того, что подобные атаки происходили в реальных условиях.• Самая простая реализация связана с электронной почтой. Согласно схеме, в письмо помещается скрытая инструкция, которая требует от ИИ‑ассистента при ответе процитировать исходное сообщение целиком. В результате вредоносный промпт оказывается уже в новом письме и может повлиять на другого ИИ‑агента, который его обработает.
• Во втором случае пользователь просил модель создать Excel‑файл на основе набора данных, внутри которого находилось поддельное системное предупреждение. Оно заставляло модель удалять отчеты, а затем копировать вредоносную инструкцию в файл.
• Еще одна разновидность атаки реализуется через поддельное сообщение о сжатии данных (compaction note), которое вынуждает модель записать код инъекции в файл, а затем отключить функции безопасности в скрипте сборки репозитория.
• Также OpenAI сообщили, что с помощью
GPT‑Red они тестируют и обучают все свои модели, чтобы они былии более устойчивыми к данному типу атак.➡️ Источник.
#Новости #AI

