🔐 Проектируйте ИИ-систему так, будто модель уже скомпрометирована.
Такой подход предлагает глава Microsoft Сатья Наделла: рассматривать модели как потенциальный внутренний риск, особенно когда им доступны данные, инструменты и выполнение действий.
Поставить второго ИИ следить за первым недостаточно: можно получить один чёрный ящик, проверяющий другой. Контроль должен существовать и за пределами моделей.
Что это означает на практике:
• Права задаёт система. Модель не определяет сама, какие ресурсы ей доступны.
• Действия оставляют проверяемый след. Логи должны быть защищены от изменения агентом.
• Аудит независим. Агент не должен одновременно действовать и контролировать доказательства корректности своих действий.
• Есть аварийная остановка. Уполномоченный человек может прервать работу посреди задачи.
• Тестируются и провалы: атаки, ошибки, пограничные случаи и изменения окружения.
https://x.com/satyanadella/status/2108931348857827686
Post #5929
2.9K

- 🔥 15
- 👍 9
- ❤ 8
- 😁 6
- 👏 4
- 🤔 4
- 🎉 3
- 💯 3