Zero Trust для ШІ-агентів: чому класична безпека більше не працюєAnthropic випустили
статтю про безпеку автономних ШІ-агентів. Якщо коротко: сучасні моделі знаходять і використовують вразливості настільки швидко, що час від появи багу до його експлуатації скоротився з місяців до лічених годин. ШІ-хакери шукають дірки швидше, ніж люди встигають перевіряти код.
Коли ми даємо ШІ-агенту автономію — наприклад, право самому обирати інструменти та виконувати завдання в кілька кроків — звичайні доступи (паролі, токени) перестають захищати систему. Агент може мати легітимні права, але виконати шкідливу дію через банальну промпт-ін'єкцію або підставні дані.
Головні загрози для агентів:- Промпт-ін'єкції та маніпуляції з боку користувачів.
- Отруєння пам'яті — коли агент запам'ятовує шкідливий контекст і починає діяти неадекватно.
- Зловживання доступами, які йому видали для роботи.
Як пропонують захищатися:1. Видавати доступи під конкретну таску. Агент не повинен мати постійних прав. Виконав завдання — доступ згорів.
2. Ізолювати інструменти. Усе, що запускає ШІ, має крутитися в закритих пісочницях (сендбоксах).
3. Перевіряти все. Контролювати не лише те, що приходить агенту на вхід, а й те, що він видає на виході після кожного кроку.
4. Захищати пам'ять. Постійно очищати або жорстко контролювати довготривалу пам'ять ШІ.
5. Автоматизувати захист.
Протидіяти ШІ-атакам вручну вже нереально, безпека теж має працювати на швидкості ШІ.
Головний висновок: проектувати системи з ШІ-агентами потрібно з думкою, що їх точно спробують зламати, і захист має спрацьовувати на кожному мікро-кроці.