TGViewer
SecureTechTalks SecureTechTalks @securetechtalks · 301 subscribers
Post #710 164
🚨 LLM научились автоматически взламывать другие LLM

На arXiv вышло новое исследование про использование языковой модели в качестве генератора атак на другую языковую модель.

🧠 Коротко о главном

Исследователи собрали автоматический цикл:

1️⃣ Атакующая модель генерирует вредный или запрещённый запрос.
2️⃣ Целевая модель с защитами пытается его отклонить.
3️⃣ Оценщик проверяет удалось ли обойти фильтр.
4️⃣ Если не удалось, то атакующая модель меняет формулировку и пробует снова.

Итого имеем сотни или даже тысячи итераций. Подход чем то напоминает brute-force по оптимизации jailbreak-атак.

📈 Рабочий ли механизм?

С каждой итерацией атаки становились:
- точнее,
- хитрее,
- менее заметными,
- лучше адаптированными под конкретную модель.

Атаки начинали работать и против других моделей, даже если они не участвовали в обучении цикла.

То есть появляется переносимость атак.

⚠️ Стоит ли волноваться?

Раньше jailbreak был ручной работой, теперь это автоматизированный процесс.

Если у злоумышленника есть доступ к одной модели и API-доступ к другой,
он может легко автоматически системы защиты.

🔗 Исследование: https://arxiv.org/abs/2602.12681

#LLMSecurity #AdversarialAI #PromptInjection #RedTeaming #CyberSecurity #AISafety #GenAI #AIThreats #SecureAI #SecureTechTalks
  • 👍 1
More from @securetechtalks
  1. Oct 2, 2026🧨 AI сокращает путь от найденной уязвимости до реальной атаки Google Threat Intelligence…
  2. Oct 1, 2026🧨 AI агенты выложили 13 000 внутренних скриншотов компаний в публичный Исследователи Glow…
  3. Sep 30, 2026🧨 MCP сервер может украсть OAuth токен через настоящий экран входа В официальном MCP Pyth…
  4. Sep 29, 2026🍷 Исследователи «напоили» LLM Команда UNSW решила проверить довольно странную гипотезу, ч…
  5. Sep 28, 2026🧨 GitHub отдал fuzzing AI агенту GitHub Security Lab открыла инструмент, который автомати…
  6. Sep 25, 2026🧨 Carbonato: ботнет устанавливает AI агента на взломанный сервер Исследователи ThreatDown…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →