Инъекция промпта была оружием хакеров. Теперь она работает против них.
Исследователи Tracebit разместили скрытые промпты прямо рядом с паролями и API-ключами в AWS. Когда агент-взломщик считывает секрет — ловушка попадает в его контекст и активирует safety-фильтры. Модель зависает. Сессия сломана.
Результаты на 152 атаках: успешный взлом с 57% → 5%. Opus 4.8 — с 93% до 0%. Полный взлом с закреплением доступа — с 36% до 1%. Один текстовый триггер.
Техника называется «контекстное бомбометание». Базовое внедрение — строка текста рядом с секретом. Работает не только в AWS — HashiCorp Vault, переменные окружения, любые машиночитаемые хранилища. ⚡
Ещё инструменты и кейсы по теме → platform.contentrun.ai
ИИ Инструменты | Контент-завод | База знаний
Post #143
30
