TGViewer
SecureTechTalks SecureTechTalks @securetechtalks · 301 subscribers
Post #462 199
🚨 Adversarial Prompts: реальные случаи, когда ИИ говорил то, что не должен 🚨

🤖 Adversarial prompts —  специально созданные запросы, которые эксплуатируют уязвимости больших языковых моделей (LLM), заставляя их генерировать нежелательные или опасные ответы. Проще говоря, это способ обмануть ИИ, чтобы он сделал или сказал то, что в обычных условиях он бы не сделал.

⚙ Примеры атак с использованием Adversarial Prompts

➖ Инъекция промптов для обхода фильтров контента
Исследователи из компании Cisco и Университета Пенсильвании продемонстрировали, как можно обойти фильтры контента в новой модели чат-бота R1 от компании DeepSeek. Они использовали 50 вредоносных запросов, которые заставили модель генерировать токсичные ответы, несмотря на встроенные механизмы безопасности.

➖ Манипуляция контекстом для получения конфиденциальных данных
В исследовании, опубликованном на arXiv, показано, что злоумышленники могут использовать визуальные состязательные примеры для обмана LLM, заставляя их выполнять нежелательные действия, такие как удаление событий из календаря или раскрытие приватных разговоров.

➖ Создание вредоносного кода через специально сформулированные запросы
На GitHub существует репозиторий, где собраны примеры adversarial prompts, способных заставить LLM генерировать вредоносный код или выполнять другие нежелательные действия.

💡 Последствия и меры предосторожности

✅ Усиление фильтрации входных данных: Обнаружение и блокировка подозрительных или противоречивых запросов.

✅  Обучение моделей на безопасных и проверенных данных: Минимизация риска утечек и неправильных ответов.

✅  Постоянный аудит и обновление систем безопасности: Обеспечение актуальности защитных механизмов против новых типов атак.

Понимание и изучение реальных случаев использования adversarial prompts помогает разработчикам и пользователям быть более осведомлёнными и принимать необходимые меры для защиты систем ИИ от потенциальных угроз.

Stay secure and read SecureTechTalks 📚

#AdversarialPrompts #Кибербезопасность #ИИ #ИнформационнаяБезопасность #SecureTechTalks #llm #chatgpt #cybersecurity #ИБ
More from @securetechtalks
  1. Oct 7, 2026🧨 AI Agent Gateway: шлюз, чтобы агент не таскал ключи по всем MCP Tuskira открыла исходны…
  2. Oct 6, 2026🧨 Два безопасных Skill могут собрать RCE Новое исследование и новая проблема: каждый навы…
  3. Oct 5, 2026🧨 OWASP Noir: карта API прямо из исходного кода OWASP Noir - это open source SAST инструм…
  4. Oct 2, 2026🧨 AI сокращает путь от найденной уязвимости до реальной атаки Google Threat Intelligence…
  5. Oct 1, 2026🧨 AI агенты выложили 13 000 внутренних скриншотов компаний в публичный Исследователи Glow…
  6. Sep 30, 2026🧨 MCP сервер может украсть OAuth токен через настоящий экран входа В официальном MCP Pyth…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →