TGViewer
SecureTechTalks SecureTechTalks @securetechtalks · 301 subscribers
Post #411 193
🌡 Best-of-N Jailbreaking: новый универсальный метод взлома chatgpt и других языковых моделей

🛡Best-of-N Jailbreaking — метод взлома языковых моделей (LLM), предложенный компанией Anthropic. Он позволяет обойти защиту ИИ, используя автоматическую генерацию множества модифицированных запросов, чтобы найти их уязвимые места. BoN применим к текстовым, аудиальным и визуальным моделям, что делает его универсальным подходом к исследованию безопасности LLM.

🔍 Как работает BoN?

🔤 Создание множества запросов: Генерация искажённых версий исходного запроса, включая ошибки, замену символов, вставки шумов или переформулировку.
🔤 Проверка обхода: Каждая версия запроса тестируется на успешность обхода защитных механизмов модели.
🔤 Оптимизация: Итеративное улучшение методов атак для повышения успешности.

📊 Ключевые результаты:

1⃣ Успешность: На GPT-4o атака срабатывает в 89% случаев, на Claude 3.5 — в 78%.
2⃣ Поддержка модальностей: Метод применим к тексту, изображениям и аудио, что расширяет его применение для многомодальных моделей.
3⃣ Пример использования: BoN может использоваться для обхода фильтров, получения запрещённых ответов или раскрытия скрытых системных подсказок.

🛡 Риски и вызовы:

➖ Повышение уязвимости моделей: Масштабирование атак делает их более доступными для злоумышленников.
➖ Сложности защиты: Простое добавление новых ограничений не всегда помогает, так как метод BoN находит обходные пути.

🎯 Метод Best-of-N Jailbreaking открывает новые возможности для анализа слабых мест моделей, но требует срочного внимания со стороны разработчиков киберзащиты.

🔗 Подробнее читайте в тексте исследования.

Stay secure and read SecureTechTalks 📚

#кибербезопасность #LLM #PromptInjection #Anthropic #SecureTechTalks #AI #ИИ #моделибезопасности
More from @securetechtalks
  1. Oct 7, 2026🧨 AI Agent Gateway: шлюз, чтобы агент не таскал ключи по всем MCP Tuskira открыла исходны…
  2. Oct 6, 2026🧨 Два безопасных Skill могут собрать RCE Новое исследование и новая проблема: каждый навы…
  3. Oct 5, 2026🧨 OWASP Noir: карта API прямо из исходного кода OWASP Noir - это open source SAST инструм…
  4. Oct 2, 2026🧨 AI сокращает путь от найденной уязвимости до реальной атаки Google Threat Intelligence…
  5. Oct 1, 2026🧨 AI агенты выложили 13 000 внутренних скриншотов компаний в публичный Исследователи Glow…
  6. Sep 30, 2026🧨 MCP сервер может украсть OAuth токен через настоящий экран входа В официальном MCP Pyth…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →