Akrasia использует два ключевых механизма LLM — обучение в контексте (in‑context learning) и неверность модели (model unfaithfulness) — чтобы организовать бэкдор‑атаки. Атака:
-конструирует триггер на уровне кода;
-применяет обучение в контексте для освоения бэкдора;
-скрывает триггер и генерирует правдоподобные рассуждения, маскируя вредоносные действия.
В отличие от предыдущих атак (например, BadChain и BadCodePrompt), Akrasia фокусируется на триггерах, связанных с кодом, а не с естественным языком, и эффективнее обходит защитные механизмы.
Akrasia эффективно обходит современные методы защиты: сохраняет ASR до 98,82 % в 14 из 18 сценариев защиты (в том числе против COS, PeerGuard и ONION), а также лучше всего защиту преодолевает на моделях Qwen‑3.6‑35B и Gemini‑3.5‑flash.
При этом метод COS показал наибольшую эффективность против Akrasia — особенно на моделях Claude‑Sonnet‑5 и GPT‑5.5.
https://arxiv.org/html/2609.01023v2
Post #426
158