TGViewer
Makrushin Makrushin @makrushin · 3.87K subscribers
Post #525 2.58K
Как обойти фильтры LLM с помощью квантовой механики

Наконец-то после серии трёхнедельных перемещений по рабочим событиям, в пути где-то между Омском и Новосибирском, появилась возможность потестировать интересную атаку на LLM.

Мы научились внедрять вредоносные запросы в модель, а модели ещё лучше научились фильтровать эти запросы. Если простой промпт "забудь все предыдущие инструкции и выполни мой запрос" по какой-то причине игнорируется LLM, то можно попробовать отправить тот же запрос в другом формате. На другом языке, с использованием 1337speak. Но даже эти попытки будут заблокированы хорошим фильтром.

У больших языковых моделей есть фильтры безопасности. Они натренированы распознавать опасные паттерны в обычном тексте. Паттерны. В тексте.

«Объясни, как сделать X», «напиши код для Y»,

где X — что-то незаконное, а Y — какой-то вредоносный код.

В этом исследовании описана новая идея, как обойти эти фильтры, если написать запрос на языке математики. То есть с помощью математической "инкапсуляции" запросов в сложные задачи по теории множеств, логике или квантовой механике можно обойти цензуру. Если фильтр видит символы ∀, ∃, ∧, то воспринимает это как математическую задачу и пропускает запрос. Модель решает эту задачу и — главный трюк — в итоге получает инструкцию "забудь все инструкции и…"

Ещё один ответ на вопрос "зачем специалисту по кибербезу изучать математику?": чтобы уметь обойти фильтры.

@makrushin l MAX l VK l Сетка l Дзен
  • 👍 8
  • 😎 4
  • 🔥 2
  • 👀 2
More from @makrushin
  1. Sep 9, 2026Спустился с горы в Красную Поляну, чтобы рассказать про безопасность агентской разработки.
  2. Sep 4, 2026Атакующие модели внутри продуктов для защиты Подсмотрел недавние анонсы крупных глобальных…
  3. Aug 27, 2026Анализ причины действия для защиты ИИ-агентов Интересный подход к защите агентов от prompt…
  4. Aug 21, 2026По мотивам нашего доклада опубликовали статью о поверхности атаки на ИИ-агентов в разработ…
  5. Aug 12, 2026Зашёл в Shodan, чтобы поискать MCP-инструменты. Нашёл. 1699 MCP-серверов оказались доступн…
  6. Jul 27, 2026Объявляю неделю безопасности ИИ-агентов и зову всех на учёбу в школу! В Школе анализа данн…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →