🤖
🤖
核心导读
SaferAI报告显示,中国开源权重模型GLM-5.2在攻击性网络与生物能力上已接近GPT-5.5和Claude Opus 4.7,但安全防护严重缺失,几乎不拒绝危险任务。闭源模型的安全措施在开源权重上失效,前沿能力与安全差距扩大。专家警告开源危险能力风险,也提及中国监管侧重政治安全,以及开源支持者认为可增强防御的争议。
随着政策制定者讨论如何监管像OpenAI的GPT-5.6 Sol和Anthropic的Mythos这样日益强大的AI系统,一款中国开源权重模型已缩小了与行业领先者的差距。
AI安全非营利组织SaferAI的一份新报告显示,来自中国智谱(Z.ai)的开源权重模型GLM-5.2在网络和生物能力方面仅落后OpenAI的GPT-5.5和Anthropic的Claude Opus 4.7几个月。但前沿能力与安全实践之间的鸿沟正在扩大。
根据SaferAI通过Z.ai公共API进行的评估,GLM-5.2对交给它的攻击性网络或双重用途生物任务全部执行,没有拒绝任何一项。相比之下,Claude Opus 4.7“拒绝得如此彻底,以至于SaferAI根本无法在其上完成CyberGym测试。”CyberGym是一个评估网络安全能力的基准,OpenAI在上个月Hugging Face遭入侵前的评估中曾使用过它。
这残酷地提醒了批评者们多年来的警告:开源权重模型可能将高能力AI交到潜在攻击者手中,而一旦他们下载了权重,就无法监管其使用方式。随着开源权重模型迅速接近世界领先AI系统的能力,争论已从它们能否竞争转向如何在社会层面管理其发布后的风险。
SaferAI执行董事Henry Papadatos对TechCrunch表示:“能力的前沿不是风险的前沿,因此我们必须同时考虑缓解措施的现状,才能正确评估风险。”虽然Z.ai可以对其托管的API应用安全措施,但一旦有人在自己的硬件上运行权重,这些保护就无法强制执行——他们可以移除或修改任何安全防护、对模型进行微调或更改系统提示。
OpenAI和Anthropic等前沿开发者倾向于依赖分类器、拒绝训练和API级控制等安全措施来限制危险的网络和生物辅助。这些措施远非万无一失:越狱攻击时常能绕过已部署模型的防护。AI安全非营利组织Far.ai在xAI的Grok 4.5和Google DeepMind的Gemini 3.1 Pro等前沿模型中发现了数百种通用越狱方法——即被定义为可重复使用的密钥,能成功应对大多数有害请求。据该报告,当攻击者结合多种操纵技术(包括角色扮演、冒充权威、伪造对话历史和后续提示)来放大模型防御中的弱点时,越狱就会成功。
但针对闭源模型的安全防护在开源权重模型上完全不起作用,后者被设计为可在任何基础设施上运行,带有一组或不带任何安全防护。Papadatos表示:“目标显然应该是让好的能力——安全的能力——对任何人开放,然后我们努力去除坏的能力,即使以开源的方式也是如此。”
Papadatos指出,一种可能有帮助的技术是“预训练数据过滤”,即AI公司从训练数据中移除攻击性网络安全信息,然后在精选数据集上训练模型。一些研究表明,这可以在不损害整体模型性能的情况下减少危险生物学知识。然而,对于网络安全,数据过滤的实用性要低得多。很难训练出一个擅长编程但不是好黑客的通用模型。由于编程已成为AI最大的盈利点,开发者在寻找限制滥用的方法的同时,也面临压力继续提升这些能力。
因此,前沿开发者越来越多地依赖其他缓解措施。一种方法是选择性地限制模型提供的网络安全协助类型。例如,Anthropic的Opus 5根据模型系统卡,可以搜索未编译源代码中的漏洞,但不能搜索编译软件中的漏洞。理由是这让Opus 5更难用于攻击目的。其他措施包括严格的部署前安全评估、发布风险评估,以及如果系统被认为过于危险则扣留模型权重。
就GLM-5.2而言,SaferAI表示Z.ai没有发布安全框架、部署前测试承诺或风险评估。TechCrunch询问Z.ai是否在发布前进行了内部或第三方前沿安全评估,但未收到回复。
中国领导人已日益承认高级AI的风险。在上月的世界人工智能大会上,中国国家主席习近平强调了开源权重模型的重要性,同时强调必须确保AI仍是严格受人类控制的工具。
在斯坦福网络政策中心研究中国AI政策的Graham Webster告诉TechCrunch,中国有完善的人工智能监管法规,但历史上这些规则侧重于政治敏感内容、虚假信息和社会稳定,而不是灾难性AI风险,如攻击性网络能力和生物滥用。“美国AI思想家总体上比中国社区更关注这种存在主义的灾难性[想法],”Webster说,并补充说许多中国政策研究者认为,如果真的会出现新的前沿风险,美国公司可能会先遇到它。
Webster继续说:“中国体系有信心控制这些技术在国内的使用。在中国上网是实名制的,企业可以被追责,用户也可以被追责。”Webster思考道,模型提供商用于拒绝涉及某些政治话题的机制,有可能被调整,以确保模型拒绝完成攻击性网络攻击,或不提供不良生物工程结果。他还表示,由于中国公司倾向于在幕后与监管机构协调,很难知道他们在发布前进行了哪些内部测试。
开源权重AI的倡导者认为,开源权重对网络安全很重要,因为它允许公司防御攻击——Hugging Face依赖GLM-5.2来防御OpenAI的入侵——并且如果知道即将发生的威胁,能更好地准备。Hugging Face首席执行官Clem Delangue本周在社交媒体帖子中表示:“帮助阻止AI驱动网络攻击的同一套系统,如今可以帮助防御每天数百万次网络攻击,同时帮助我们识别并修复漏洞,抢在攻击者利用之前。”
Papadatos表示,这种好处往往被夸大,而且并不意味着“我们应该开源危险的能力”。“我的核心观点是,我们不应接受危险能力可以被世界任何地方的任何人轻易获取,”他说,并强调他认为行业应努力让“好的能力”易于获取。默认情况下,攻击者采用新工具的速度比防御者更快。例如,勒索软件团伙可以在一周内改变其方法,而医院无法做到。
分享这篇文章: