👍 Стихи ломают ИИ: как поэзия обходит защиту больших языковых моделей
🧠 Представьте: вы просите ИИ рассказать, как сделать что-то опасное. Модель отказывается. Вы переписываете ту же просьбу… в стихах. И модель дает то, чего вы хотели.
Именно это обнаружили исследователи. Они назвали это adversarial poetry — «состязательная поэзия».
Что сделали:
Взяли 20 вручную написанных стихотворений с вредоносными просьбами внутри — про кибератаки, манипуляции, выход из-под контроля. Прогнали через 25 топовых моделей от 9 провайдеров: Google, OpenAI, Anthropic, Deepseek, Qwen, Mistral, Meta, xAI, Moonshot.
Результат:
🔳 Средний attack success rate — 62%.
🔳 У некоторых моделей — выше 90%. Gemini 2.5 Pro — 100%.
🔳 Переписали 1 200 вредоносных промптов из бенчмарка MLCommons в стихи — ASR вырос с 8% до 43%. В отдельных случаях — в 18 раз.
Поэзия срабатывает во всех доменах — от ядерного оружия до кибератак и манипуляции сознанием. Значит, дело не в конкретном запретном контенте, а в самой стихотворной форме. Метафоры, ритм, образность — всё это, видимо, «размывает» сигнал, на который настроены защитные фильтры.
Что ещё интереснее:
♑️ Маленькие модели отказывают чаще, чем большие. GPT-5-nano — 0% ASR, GPT-5 — 10%. Похоже, мощные модели лучше «понимают» стихи — и вместе с ними вредоносный смысл.
🦒 Anthropic (Claude) — самые устойчивые. Google и Deepseek — самые уязвимые.
♊️ Закрытые модели не защищённее открытых.
Главный вывод:
Модели учат отказывать на прозаических запросах, но стоит сменить форму — и защита рушится. Это ставит под вопрос статические бенчмарки и регуляторные оценки вроде EU AI Act: они проверяют модели на «нормальных» промптах, а обход стоит одного стилистического поворота.
Пока же ясно одно: поэзия — это не только про красоту. Это ещё и вектор атаки.
Post #919
832

- ❤ 15
- 🤔 11
- 👍 3