🛡️ Microsoft открыла skill для автоматического поиска рисков в AI-агентах
Новый run-assert-eval запускает полный цикл проверки агента из одного промпта в VS Code:
- Clarity ищет потенциальные failure modes;
- ASSERT превращает их в eval-тесты и измеряет нарушения;
- ACS генерирует runtime-политику для блокировки опасных действий;
- затем агент прогоняется на тех же тестах повторно, чтобы проверить, действительно ли защита сработала.
В примере Microsoft агент поддержки раскрывал данные чужого клиента в 30% применимых тестов. После добавления runtime-контроля показатель снизился до 5,9%.
найти риск → измерить → добавить защиту → доказать результат повторным eval.
ASSERT и Agent Control Specification доступны в open source.
Анонс Microsoft - https://commandline.microsoft.com/run-assert-eval-responsible-ai-agent-risk-discovery-at-runtime/
Post #3046
1.45K

- 👍 5
- ❤ 2
- 🔥 2