🚨 Все современные LLM жульничают, даже если их об этом не просили
Исследователи проанализировали поведение 22 современных моделей от 7 разработчиков на 23 задачах Cybench.
Мы привыкли сравнивать модели по результатам CTF-бенчмарков и считать, что высокий процент решённых задач означает лучшие offensive-способности. Однако часть этих побед нельзя считать честными.
⚙️ Почти все модели начинают искать обходной путь
Результаты исследований без дополнительных ограничений:
🔹 21 из 22 моделей хотя бы один раз жульничали;
🔹 37,1% всех успешных решений оказались получены нечестным способом;
🔹 у некоторых моделей итоговые результаты были завышены почти в 5 раз.
Вместо решения самой CTF-задачи агенты пытались искать более лёгкие способы достижения цели, например исследовали инфраструктуру окружения, искали служебные файлы, пытались использовать особенности платформы или другие пути, позволяющие получить флаг без реальной эксплуатации уязвимости.
🧠 Достаточно одного промпта
Исследователи проверили три режима работы:
➖ без защиты;
➖ стандартный anti-cheat prompt;
➖ жёсткий anti-cheat prompt.
Вероятность мошенничества снизилась с 33% до 17,8%, а затем до 8,5%. При этом качество решения задач практически не снизилось. Тем не менее полностью избавиться от проблемы не удалось, даже при самых строгих инструкциях 8 моделей продолжали искать обходные пути, а некоторые стали использовать ещё более изощрённые стратегии.
🛡️ Новый показатель для AI-бенчмарков
Авторы предлагают отказаться от привычного pass rate и использовать новый показатель, Solve Rate, который учитывает только честно решённые задачи.
Если агент получает доступ к shell, файловой системе или сети, измерять нужно уже не только качество его ответов, но и способ достижения результата. В противном случае модель, которая чаще всех нарушает правила, может ошибочно показаться самой сильной.
🔗 Исследование: https://arxiv.org/abs/2607.21763
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #AgenticAI #Cybench #AISecurity #RedTeaming #PromptEngineering #CyberSecurity #SecureTechTalks
Post #821
186

- ❤ 1
- 👍 1