甚至表现更好一些, 英语 100%, 中文 100%, 希伯来语 99.3%.
从测试结论来看, 目前大模型的安全对齐已经做得很好了, 尤其是希伯来语其实并不算特别小众的语言. 在2023年还有论文『Low-Resource Languages Jailbreak GPT-4』指出使用类似鲁语,苏格兰盖尔语或苗语会绕过模型安全机制. 但现在基本都没问题了.
另外需要注意, 为了测试控制变量, 我只测试了语言对模型安全机制的影响, 并没有使用提示词进行越狱, 至于模型对各种破甲提示词的识别能力则又是另一个有趣的研究课题了.
项目已开源, 想要围观细节报告可以在这里找到: http://github.com/karminski/The-71st-Language-Bench
#fable51 #deepseekflash #deepseekv41flash #希伯来语 #破甲
Post #4877
87