TGViewer
AI for Devs AI for Devs @ai_for_devs · 17.6K subscribers
Post #130 2.24K
🔓 Новые подходы к защите LLM от prompt injection

За прошедние несколько недель вышли две интересные статьи из мира AI-безопасности. Meta AI выкатили концепцию Agents Rule of Two, а вторая команда — из OpenAI, Anthropic и DeepMind — показала, что все современные защиты от jailbreak и prompt injection пробиваются за считаные минуты.

Meta и “Правило двух”

Идея простая и до боли логичная: если ваш агент одновременно (1) получает недостоверные данные, (2) имеет доступ к приватным системам и (3) может менять что-то во внешнем мире — бед не избежать. Meta предлагает разрешать лишь два из трёх свойств на одну сессию. Всё, что дальше — только под присмотром человека.

OpenAI, Anthropic и компания: “всё ломается”

Учёные протестировали 12 популярных систем защиты от prompt injection — и обошли их все, включая те, что считались “непробиваемыми”.

Систематически настраивая и масштабируя общие методы оптимизации — градиентный спуск, обучение с подкреплением, случайный поиск и исследование с участием человека — мы обошли 12 современных защит (основанных на разных техниках) с успешностью атак выше 90% в большинстве случаев. При этом многие из этих защит ранее показывали почти нулевой успех атак.


Главный тезис статьи: тестирование с помощью фиксированных примеров (одиночных строк, обходящих систему) не имеет смысла. Реальные атаки адаптивны, итеративны и гораздо мощнее. Это наглядно показывает диаграмма на второй картинке.

–––

Вторая работа производит сильное впечатление и даёт трезвое представление о реальном состоянии защиты LLM. На этом фоне подход Meta с «Правилом двух» выглядит наиболее практичным способом проектировать безопасные системы: он не обещает чудес, но чётко задаёт инженерные границы, пока надёжные средства против prompt injection ещё не созданы.

Источник

@ai_for_devs
  • 👍 11
  • ❤ 3
  • 😱 2
  • 🤯 1
More from @ai_for_devs
  1. Oct 5, 2026⚡️ Команда Codex устроила челлендж на 28 дней Обещают каждый день выпускать что-то заметно…
  2. Oct 2, 2026⚡️ DeepSeek выпустили десктопный клиент: Deepseek Harness Вслед за ZCode и Kimi Code свой…
  3. Oct 1, 2026⚡️ Google представили Gemini 4 Argon По заявлениям компании, новая модель обошла флагманы…
  4. Sep 30, 2026⚡️ Anthropic опубликовали лучшую рекламу GLM Помните пост про abliterated-модели, у которы…
  5. Sep 29, 2026⚡️ DevDay 2026 подошел к концу Помимо главных новинок, также показали: • Тариф Pro Max за…
  6. Sep 29, 2026⚡️ OpenAI обновили GPT-6.1 Sol Параллельно с трансляцией всем стала доступна новая версия…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →