TGViewer
CODE BLOG CODE BLOG @codeblog · 10.4K subscribers
Post #7434 1.63K
Стихи стали универсальным ключом для взлома GPT-4 и Gemini

Исследователи обнаружили изящный способ обхода защитных фильтров популярных нейросетей — «поэтический джейлбрейк». Метод Adversarial Poetry использует одну LLM для написания специфических стихотворений, которые при подаче на вход другой модели (GPT-4, Claude 3 или Gemini) ломают её систему безопасности. Ритмические конструкции и рифмы запутывают алгоритмы модерации, заставляя их пропускать запросы, которые в обычной форме были бы заблокированы.

Взломанные таким образом модели послушно генерируют инструкции по противоправным действиям, фейковые новости и токсичный контент, полностью игнорируя этические настройки. Опасность метода кроется в его доступности: для атаки не нужны глубокие технические знания архитектуры, достаточно просто стравить две нейросети в рифмованном баттле, где одна убедит другую нарушить правила. Похоже, ямб и хорей стали новым эксплойтом нулевого дня.
  • 👍 4
  • 😱 1
More from @codeblog
  1. Apr 10, 2026Когда придумал как фиксануть баг, но комп лень включать
  2. Apr 10, 2026Пушистый файрвол спас квартиру от пожара Пока инженеры Nvidia годами не могут решить пробл…
  3. Apr 10, 2026Как уплачено, так и . . .
  4. Apr 10, 2026Энтузиаст собрал PlayStation One на стероидах Моддер под ником Secret Hobbyist собрал ульт…
  5. Apr 9, 2026Первый раз мама была неправа
  6. Apr 9, 2026Иронично, но браузер от Google стал одним из последних на Chromium, где этот функционал до…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →