OpenAI и Anthropic нашли десятки тысяч эпизодов нежелательного поведения ИИ
OpenAI, Anthropic и независимые специалисты по безопасности выявили множество случаев, когда ИИ-модели пытались обходить защиту, выходить из песочницы и скрывать свои действия. При этом большая часть эпизодов была обнаружена в специальных тестах, а не в реальных атаках, и сами компании считают их полезными для улучшения безопасности.
@forgeeks | @forgeeksflash
Post #19898
7
