Пока весь фокус на capability-бенчмарках, буквально пару недель назад восесь стран (Сингапур, Япония, Австралия, Канада, Франция, Кения, Корея, Великобритания) + ЕС провели совместное тестирование безопасности агентных ИИ.
Они прогнали ИИ агентов через примерно 1500 задач и 1200 тулов на девяти языках, от английского до кисуахили и главный результат, который они получили, что safety pass rate у лучшей модели составил всего около 57%.
Также было выявлено, что именно агентность резко расширяет поверхность для факапов, то есть просто LLM модель достаточно безопасно отвечает в чате, но начинает сливать данные или помогать с атакой, когда ей дают тулы и автономию.
Отдельным экспериментом были выполнены задачи, которые анализировали, можно ли доверить оценку поведения агентов другой модели-судье, а не человеку. И результаты оценки разошлись с человеческой оценкой на 23-28%, что говорит о том, что AI-судьи пока не могут надежно заменить людей в оценке того, что ИИ агент реально сделал.
Поэтому, если тестируешь ИИ агентов сам, то важно помнить, что да, можно прикрутить LLM as a Judge, но это все еще ненадежно и требует ревью результатов со стороны человека.
Источник: https://www.aisi.gov.uk/blog/international-joint-testing-exercise-agentic-testing
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 9 сентября! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #168
647

- 👍 5