TGViewer
Data Science | Machinelearning [ru] Data Science | Machinelearning [ru] @devsp · 19.8K subscribers
Post #5363 3.74K
Как стихотворные запросы могут взломать нейросети 😂

Для того, чтобы обойти фильтры безопасности языковых моделей, не нужно быть хакером или разрабатывать сложный код. Достаточно написать запрос в стихах. Группа исследователей из лаборатории DEXAI провела эксперимент, который показал, что поэтическая форма помогает «пробить» защиту многих современных нейросетей.

На первый взгляд это может звучать как шутка, но цифры говорят сами за себя. В ходе эксперимента ученые прогнали около 1200 вредоносных запросов через 25 различных моделей, включая Gemini 2.5 Pro, GPT-5, Claude Opus 4.1, DeepSeek R1 и многие другие. И вот что интересно: те же самые запросы, переписанные в стихотворную форму, оказывались гораздо более эффективными. Причем «пробивали» защиту в среднем в 60% случаев, а у некоторых моделей этот показатель достигал 90–100%.

Чтобы проверить, как это работает, исследователи взяли набор запросов из открытого репозитория MLCommons AILuminate (включающие темы вроде химического оружия, кибератак и утечек данных) и переписали их в стихах. Получился своего рода поэтический «слой», который обходит стандартные фильтры безопасности.

У Gemini 2.5 Pro на 20 стихотворных запросов не было ни одного отказа — все ответы оказались небезопасными. В то время как модели вроде GPT-5 Nano и Claude Hiaku 4.5 с трудом «клюнули» на такие запросы, отклоняя их в 90% случаев 😂

Это, конечно, тревожный сигнал для разработчиков. Оказавшись на стадии тестирования, такие стилистические «обходы» безопасности могут легко оставаться незамеченными. По сути, современные бенчмарки и подходы к выравниванию моделей (такие как RLHF и Constitutional AI) не могут учесть таких «игровых» форматов, как стихи или сказки, где язык выглядит абсолютно безобидно, а за ним скрывается реальный риск.


Теперь, очевидно, перед разработчиками стоит новая задача: научить нейросети работать не только с прямыми запросами, но и с более «творческими» формами, где смысл может скрываться за метафорами и рифмами.

Data Science
  • ❤ 6
  • ⚡ 5
  • 🐳 2
  • 👀 1
More from @devsp
  1. Sep 30, 2026Две ИИ-фабрики в Армении: что там отгрохали и на кого это в итоге пашет В августе в Раздан…
  2. Sep 30, 2026Из Москвы в Миннеаполис — с тремя решениями для улучшения персонализации в рекомендательны…
  3. Sep 30, 2026Про Ember-1 сейчас гудят на Hacker News. Исследователи дообучили Kimi K3 так, что рассужда…
  4. Sep 30, 2026Локальный ассистент для зумов, часть 8: модель, из-за которой я перекроил диаризацию за од…
  5. Sep 29, 2026Путь к ИИ-сингулярности В багажнике у нас: пара репо с вайб-кодом, который ни один тест не…
  6. Sep 29, 2026Как нейросеть переводит видео. Часть 2: русский длиннее не текстом, а звуком Автор в одино…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →