TGViewer
infosecurity infosecurity @tg_infosec · 26.8K subscribers
Post #4737 1.04K

Forwarded from infosec

• OpenAI опубликовали информацию о новом типе атак на ИИ‑агентов. Атака представляет собой использование промт-инъекции, с помощью которой заставляет модель не только выполнить команды атакующего, но и перенести промт в другие сообщения или файлы для дальнейшего распространения. Атака получила название self‑replicating prompt injection (самокопирующиеся промпт‑инъекции).

• OpenAI смогла обнаружить сценарий во время тестирования моделей с помощью автоматизированного red‑teaming‑агента GPT‑Red. Пока нет доказательств того, что подобные атаки происходили в реальных условиях.

• Самая простая реализация связана с электронной почтой. Согласно схеме, в письмо помещается скрытая инструкция, которая требует от ИИ‑ассистента при ответе процитировать исходное сообщение целиком. В результате вредоносный промпт оказывается уже в новом письме и может повлиять на другого ИИ‑агента, который его обработает.

• Во втором случае пользователь просил модель создать Excel‑файл на основе набора данных, внутри которого находилось поддельное системное предупреждение. Оно заставляло модель удалять отчеты, а затем копировать вредоносную инструкцию в файл.

• Еще одна разновидность атаки реализуется через поддельное сообщение о сжатии данных (compaction note), которое вынуждает модель записать код инъекции в файл, а затем отключить функции безопасности в скрипте сборки репозитория.

• Также OpenAI сообщили, что с помощью GPT‑Red они тестируют и обучают все свои модели, чтобы они былии более устойчивыми к данному типу атак.

➡️ Источник.

#Новости #AI
  • 🤔 4
More from @tg_infosec
  1. Oct 2, 2026• Немного оффтопа: на хабре есть очень крутая статья, автор которой выяснил, почему обесто…
  2. Oct 1, 2026• На этом фото, между прочим, прародитель жёсткого диска - магнитный барабан. А емкость эт…
  3. Oct 1, 2026#Юмор
  4. Sep 30, 2026• В даркнете случилась настоящая драма: администратор форума Prime Market опубликовал объя…
  5. Sep 30, 2026👩‍💻 How To Secure A Linux Server. • Очень объемное руководство по обеспечению безопаснос…
  6. Sep 30, 2026• Текущие реалии... #Юмор
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →