TGViewer
AI Attacks AI Attacks @aiattacks · 1.01K subscribers
Post #426 158
Akrasia использует два ключевых механизма LLM — обучение в контексте (in‑context learning) и неверность модели (model unfaithfulness) — чтобы организовать бэкдор‑атаки. Атака:

-конструирует триггер на уровне кода;
-применяет обучение в контексте для освоения бэкдора;
-скрывает триггер и генерирует правдоподобные рассуждения, маскируя вредоносные действия.

В отличие от предыдущих атак (например, BadChain и BadCodePrompt), Akrasia фокусируется на триггерах, связанных с кодом, а не с естественным языком, и эффективнее обходит защитные механизмы.

Akrasia эффективно обходит современные методы защиты: сохраняет ASR до 98,82 % в 14 из 18 сценариев защиты (в том числе против COS, PeerGuard и ONION), а также лучше всего защиту преодолевает на моделях Qwen‑3.6‑35B и Gemini‑3.5‑flash.

При этом метод COS показал наибольшую эффективность против Akrasia — особенно на моделях Claude‑Sonnet‑5 и GPT‑5.5.

https://arxiv.org/html/2609.01023v2
More from @aiattacks
  1. Sep 24, 2026ИИ-агенты взломали 27 компаний и украли данные 600 тысяч банковских карт Всего за 5 дней з…
  2. Sep 21, 2026Исследователи из компании Hacktron, специализирующейся на кибербезопасности, использовали…
  3. Sep 21, 2026Как выбирать проекты на гитхабе, когда все вайбкодят. Статья, конечно, слоп. Но в основном…
  4. Sep 21, 2026PentestChain — десятиэтапную автоматизированную систему тестирования на проникновение, кот…
  5. Sep 21, 2026Читала вот эту статью https://cyberscoop.com/ai-agent-hacking-apocalypse-cybersecurity/ Вс…
  6. Sep 21, 2026Непрямое внедрение запросов (IPI) остаётся центральной проблемой безопасности LLM: в станд…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →