TGViewer
maxigacy (AI) Security maxigacy (AI) Security @aixsec · 391 subscribers
Post #17 363
Prompt injection вместо сериала на выходных

В эти выходные читал статью Defeating Prompt Injections by Design Флориана Трамера и его коллег.

Авторы предлагают CaMeL — архитектурную защиту LLM-агентов от prompt injection. В её основе две модели:

— P-LLM строит план по доверенному запросу и может работать с инструментами;
— Q-LLM обрабатывает недоверенные данные, но не имеет доступа к инструментам.

CaMeL дополнительно разделяет потоки управления и данных и проверяет, какие данные разрешено передавать конкретным инструментам.

Главная мысль: вместо попытки научить LLM распознавать абсолютно все атаки лучше спроектировать систему так, чтобы даже успешная инъекция не привела к опасному действию.

Пожалуй, теперь это мой любимый формат выходных: практика английского и погружение в безопасность LLM-агентов.

А как проходят ваши выходные? Давайте поделимся в комментариях:)

#AIxSec #LLMSecurity #CaMeL #PromptInjection #Research
  • ❤ 8
  • 👍 3
  • 🔥 3
  • 🤔 2
More from @aixsec
  1. Sep 25, 2026🤖 ИИ уволит аналитиков SOC? На OFFZONE поговорил с Ильёй Крестиничевым из SOC Яндекса о н…
  2. Sep 23, 2026Подключил MCP. Получил SSRF Когда обсуждают безопасность MCP, обычно вспоминают prompt inj…
  3. Sep 21, 2026⚡️ Яндекс обучил собственную LLM с нуля и открыл её веса 19 сентября был на Practical ML C…
  4. Sep 19, 2026Сегодня на Practical ML Conf от Яндекса 👨‍💻 На фото разбирают, как готовят ответы для до…
  5. Sep 18, 2026Уйти из кибербеза пасти гусей 🪿 Даже в театре нашёл с кем поговорить про AI Security 😅 З…
  6. Sep 17, 2026Firewall для tool calls Разрешить агенту инструмент delete_file ещё не значит разрешить уд…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →