在昨晚 OpenAI 宣布企业套餐里加入 GLM 5.3 等开源模型之后,A\\ 立即发布报告,严肃批评了 GLM 5.3 等开源模型的安全问。
这个报告的信息量不大,但看完之后满脸问号。。。
报告先说 GLM-5.3 是「迄今发布的网络安全能力最强的开源模型」。
比美国前沿模型落后约4个月。
他们测试了几个模型,这些模型包括 Opus 4.6,Kimi K3,DeepSeek Flash,但 GLM 5.3 是唯一一个具备漏洞利用能力的模型。
然后提到 GLM 5.3 其实自带了安全护栏。
但是因为它是开源的,任何开源模型都可以通过一种拒绝行为削减技术,abliteration 来重新配置模型,专门移除拒绝行为,训练出不安全的 GLM 5.3 版本,制作一次约4400美元成本。
简单说就是开源模型天然可以改权重,都不安全。
对这个移除拒绝行为abliteration 的模型进行评测,发现这个版本确实很不安全。
对于原版的带安全护栏的 GLM 5.3,通过欺骗性提示词、预填充思考等方式,可以欺骗模型参与到危险的任务中。
而 Claude 不提供预填充思考功能,也不开源,无法被 abliteration,所以非常安全。
报告最后呼吁,让更多企业和机构用上安全的闭源模型刻不容缓。
。。。
这个报告看起来是在讨论模型安全,实则带着积分自我兜售的意思。
开源模型自带了安全护栏,然后你通过训练把它的安全护栏去掉,以此论证开源模型并不安全。
如果觉得开源模型不安全,大可以开源一个安全的给大家用。
也可以选择积极地参与到开源模型的安全建设里,一起为安全做出努力。
你也可以选择把自己的模型开放给全世界,不要天天封号。
卖模型就卖模型,还要占据个道德的高地。
@aigc1024
Post #25240
379