TGViewer
Alien外星人 Alien外星人 @steamvents · 2.47K subscribers
Post #452 2.3K
最近openai的受测模型由于要被测试,所以暂时取消了安全护栏,结果它在一个沙盒环境中越狱,为了寻找测试答案而对Huggingface发起了17000次攻击,并成功获取答案。

人类历史上第一场AI自主发动的网络攻击真的让人毛骨悚然:

受测模型的环境没有联网权限,只有一个代理服务可以下载各种依赖,然后模型找到了代理软件漏洞,给自己提权,越狱成功,随后找到一个有外网权限的机器,通过机器发动攻击。

通过这一套流程,我们可以做一些简单推论:

1. 任何软件都有漏洞。任何收容环境都有失败可能。

2. AI 的网络安全能力可以被认为无上限。

3. 由于1和2,可得出,任何环境都迟早被AI攻破。

4. 由于3,可以得出结论,位于后端(不是软件工程中的后端,是业务流的后端)的安全加固,意义有限。最重要的,是前端加固,也就是看起来最简单的安全护栏Guardrails。

换句话说,与其和AI玩攻防,不如用自然语言在业务前端就禁止AI进行某些行动和推理。这是成本最低、效果最好的。

但这又带来了另一个风险。Guardrail是基于自然语言的,自然语言的模糊性自然带来一种“AI用自己的理解来处理语义”的风险。举个例子,Guardrail定义了不能进行色情内容创作,然后AI有可能用某个极端开放的国家的关于色情的法律定义,来自我重新定义了Guardrail标准,进而相当于绕过了Guardrail。

遵守原始Guardrail了吗?遵守了。违规了吗?违规了。

所以未来对于语义的研究可能是AI安全的一大课题,语言学、哲学很可能以这种吊诡的角度进入网络安全领域。

正如Anthropic雇佣核物理学家来测试AI的伦理和安全标准,一些看起来和计算机科学、人工智能不沾边的东西,或许在未来将进入AI治理的核心领域。这是AI安全的一个完全不可预测的冰山一角。
  • ❤ 6
  • 👎 6
More from @steamvents
  1. Sep 26, 2026在浙大读本科时候,苏振华老师给我讲过这么个故事: 国企职工下岗之后,东北出现了一个被戏称为「忍者神龟」的特殊职业——丈夫用自行车载着妻子去卖淫,然后全程在屋外抽烟等待,事后载妻子回…
  2. Sep 26, 2026一个体制内知识分子,劝被强制失业的工人“只不过是从头再来”,但自己终其一生都没离开过体制、也从未“从头再来”过,我们管这种人叫_______
  3. Aug 17, 2026上了马老师的节目,聊了私家侦探和推理小说的一些事,欢迎各位收看。请多多支持马老师。 ---- 马老师对本期节目的介绍: 强烈推荐,真的是很有意思!欢迎赞转评! 我有一个朋友是私家侦…
  4. Aug 17, 2026海龙炫酷!
  5. Aug 7, 2026亡母二十周年祭 今年三月,我带家人回国了两个月,先飞回天津,然后从北到南去了保定、大连、杭州、安吉、广州、深圳、珠海。在大连见了一个高中老友,老友和她母亲曾有很长一段时间居住在我母…
  6. Jul 27, 2026(图为温哥华本地的当前在线Meshtastic 节点,能看到最南的美国 Point Roberts 也有几个节点) 无线电技术是我极为喜爱的一个通讯技术分支,因为它有巨大的技术底座…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →