TGViewer
Machine learning Interview Machine learning Interview @machinelearning_interview · 30.3K subscribers
Post #3046 1.45K
🛡️ Microsoft открыла skill для автоматического поиска рисков в AI-агентах

Новый run-assert-eval запускает полный цикл проверки агента из одного промпта в VS Code:

- Clarity ищет потенциальные failure modes;
- ASSERT превращает их в eval-тесты и измеряет нарушения;
- ACS генерирует runtime-политику для блокировки опасных действий;
- затем агент прогоняется на тех же тестах повторно, чтобы проверить, действительно ли защита сработала.

В примере Microsoft агент поддержки раскрывал данные чужого клиента в 30% применимых тестов. После добавления runtime-контроля показатель снизился до 5,9%.


найти риск → измерить → добавить защиту → доказать результат повторным eval.

ASSERT и Agent Control Specification доступны в open source.

Анонс Microsoft - https://commandline.microsoft.com/run-assert-eval-responsible-ai-agent-risk-discovery-at-runtime/
  • 👍 5
  • ❤ 2
  • 🔥 2
More from @machinelearning_interview
  1. Sep 25, 2026Сингулярность
  2. Sep 25, 2026📋 Китай впервые обошёл США по числу ведущих ИИ-исследователей По данным нового исследован…
  3. Sep 25, 2026Пользователь смотрит видео, листает клипы, ставит лайки — каждое действие становится сигна…
  4. Sep 25, 2026✔️ OpenAI выпустила открытый бенчмарк для оценки ИИ в психологии Набор Mental Health Bench…
  5. Sep 24, 2026🤖 Microsoft открыла данные, на которых можно учить ИИ управлять роботом. Датасет libero-d…
  6. Sep 24, 2026Размер – не главное? У небольшой AliceAI-Foundation-80B-A3B-Base от Яндекса уже появились…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →