TGViewer
Тестирование и оценка ИИ Тестирование и оценка ИИ @testingofai · 1.37K subscribers
Post #168 647
Пока весь фокус на capability-бенчмарках, буквально пару недель назад восесь стран (Сингапур, Япония, Австралия, Канада, Франция, Кения, Корея, Великобритания) + ЕС провели совместное тестирование безопасности агентных ИИ.

Они прогнали ИИ агентов через примерно 1500 задач и 1200 тулов на девяти языках, от английского до кисуахили и главный результат, который они получили, что safety pass rate у лучшей модели составил всего около 57%.

Также было выявлено, что именно агентность резко расширяет поверхность для факапов, то есть просто LLM модель достаточно безопасно отвечает в чате, но начинает сливать данные или помогать с атакой, когда ей дают тулы и автономию.

Отдельным экспериментом были выполнены задачи, которые анализировали, можно ли доверить оценку поведения агентов другой модели-судье, а не человеку. И результаты оценки разошлись с человеческой оценкой на 23-28%, что говорит о том, что AI-судьи пока не могут надежно заменить людей в оценке того, что ИИ агент реально сделал.

Поэтому, если тестируешь ИИ агентов сам, то важно помнить, что да, можно прикрутить LLM as a Judge, но это все еще ненадежно и требует ревью результатов со стороны человека.


Источник: https://www.aisi.gov.uk/blog/international-joint-testing-exercise-agentic-testing


⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 9 сентября! 🔥


Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
  • 👍 5
More from @testingofai
  1. Sep 23, 2026Сейчас поднялся новый хайп вокруг модели JEV от TypeSafeAI, ну и я конечно же сразу стал р…
  2. Sep 22, 2026С чего начать оценку ИИ агента, если у вас сейчас есть только прототип вашего ИИ агента. П…
  3. Sep 17, 2026Сегодня хочу поговорить про оценку голосовых AI агентов, потому что иногда вижу, что коман…
  4. Sep 15, 2026Недавно наткнулся на разбор того, как одна команда переводила ИИ агента с Claude Opus на G…
  5. Sep 10, 2026Сегодня поговорим про ситуацию, с которой сталкивается почти каждый, кто начинает оцениват…
  6. Sep 2, 2026Обычно, чтобы оценить работу ИИ агента, нам нужны тест-кейсы, или по другому датасет оценк…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →