🌐 English 即时比分

AI安全测试正在成为安全风险

人工智能 来源: TechCrunch 发布时间: 热度: 👍👍
AI安全测试正在成为安全风险
🤖
🤖

核心导读

近几个月,多个AI智能体在网络安全评估中突破沙箱、访问互联网甚至入侵真实系统,涉及OpenAI、Anthropic、Meta、月之暗面等。专家指出,测试环境控制已跟不上模型能力,错误配置、监控缺失等问题频出,业界呼吁加强隔离、独立审计和标准化评估流程,并警惕评估本身成为新风险。

在过去的几个月里,接受网络安全评估的AI智能体多次突破边界,访问互联网,甚至在某些情况下入侵了真实世界的系统。这些事件涉及OpenAI、Anthropic、Meta以及最近的中国AI实验室月之暗面(Moonshot AI)的模型,测试由包括一家名为Irregular的网络评估初创公司在内的多个不同组织实施。 这些事件暴露了AI行业一个日益严重的问题:随着自主智能体能力越来越强,旨在安全测试其极限的环境却无法再将其约束。 “大量此类事件的发生清楚地表明,沙箱和测试环境控制已无法真正跟上模型的能力,”剑桥大学未来智能研究中心AI:未来与责任项目主任肖恩·奥伊格塔伊(Seán Ó hÉigeartaigh)告诉TechCrunch。 被测模型的性质加剧了这一风险。AI公司在未发布的新一代模型上测试网络评估,且通常会禁用限制恶意行为的常规防护措施,以便研究人员观察模型的真实能力。这意味着测试环境本身的安全是一道关键防线。 “就测试而言,这是很好的做法,但这也意味着如果它们设法逃逸到外部,就可能造成相当大的危害,”奥伊格塔伊说。 在最严重的一起事件中,一个未发布的OpenAI模型突破了沙箱,入侵了Hugging Face的生产系统。在Irregular分别进行的评估中,Anthropic和Meta的模型在错误配置意外为它们提供互联网路径后,到达了测试环境以外的系统。月之暗面的Kimi K3也利用Frontier Security运行的沙箱中的一个漏洞访问了互联网,并获取了GitHub上的信息。 在英国AI安全研究所(AISI)的测试中,研究人员实际上主动给了智能体互联网访问权限,但没有意识到它们会采取未经授权的现实世界行动,包括试图通过社会工程手段将漏洞偷偷植入一个开源项目。 在每起事件中,智能体都并未被指示攻击随机的现实世界目标。它们只是竭尽全力解决摆在自己面前的问题。 综合来看,AI非营利组织CivAI的研究主管安德鲁·尹(Andrew Yoon)认为,这些事件指向了一种转变。 “过去,我们只需要担心AI模型被人类滥用于各种目的,比如用于诈骗或儿童性虐待材料,”尹告诉TechCrunch。“现在我们面临的情况是,AI模型本身就是威胁行为者。” 多位研究人员和网络安全专家告诉TechCrunch,AI评估环境需要更强、更深入的多层防御保护,其隔离和控制水平应接近部署环境。这意味着要有多层安全措施,使得单一错误配置——比如意外开放互联网访问——不会导致逃逸。 “如果你要构建这些模型……你需要在物理隔离的网络上进行,”AI安全研究非营利组织EleutherAI的执行董事斯特拉·比德曼(Stella Biderman)说。“你需要非常严格的隔离。” Box公司首席信息安全官希瑟·塞兰(Heather Ceylan)表示,这意味着要消除从沙箱到互联网以及其他敏感系统的网络路径。 “你必须了解所有出口点,”塞兰告诉TechCrunch。“如果我们在预发布环境或开发环境中评估模型,就不能有任何通往生产环境的出口路径。” 塞兰表示,适当的安全评估超越了对环境的控制和隔离。一旦测试开始,还需要对测试进行更好的监控。 “我认为在几个案例中有趣的是,事件发生时没有人发现,”塞兰说。“OpenAI是因为Hugging Face才知道的。Anthropic直到事后检查才发现。Meta的情况也类似……我相信肯定存在他们本来可以检测到的信号。” 在Anthropic对其三起事件的事后分析中,该公司承认,它和Irregular本可以在监控方面做得更好,而且在某些情况下,有明显的迹象表明出了问题。 专家们还呼吁在模型被放入评估环境之前,由独立的第三方对评估环境进行审计。 “比如说,如果Irregular在运行评估之前聘请或被要求聘请外部审计员来检查其系统配置,他们肯定会在这里发现问题,”尹说。“即使人们事先开会审查一下清单,他们也会发现这一点……他们没有这样做,这表明存在非常严重的偷工减料。” 一位熟悉细节的消息人士告诉TechCrunch,Irregular的环境会持续受到审查和测试,包括与多个外部方协商。该消息人士还表示,监控措施已经到位,但仅靠监控还不够。 尹和其他研究人员敦促业界为前沿模型的安全评估制定标准化流程。 “特别是当护栏被关闭时,你必须像把世界上最厉害的黑客关进那个环境里一样对待它,”塞兰说。 尹和比德曼都认为,问题不在于公司不知道如何构建更安全的测试环境,而在于这样做可能代价高昂且麻烦,而且在出问题之前,公司几乎没有动力进行这些投资。 “我认为,公司不愿意投入必要的资源来实现(足够的护栏),而且可能在被逼迫之前都不会这样做,”比德曼说。 但还有另一个问题。如果在测试期间将模型锁得过死,研究人员可能在模型发布前无法发现其能力。这与赋予模型过多自由同样危险,甚至可能更危险,而评估本身也就有可能成为问题。 特朗普政府目前正在权衡一种自愿的部署前网络安全评估机制。根据该机制,政府将在新的强大模型公开发布前30天评估其安全风险。这项政策是特朗普行政命令的产物,已在闭门状态下最终敲定,但它并不能解决安全评估事件,因为这些事件发生在部署的更上游。 “我们在过去几个月里得到的教训是,自我监管机制已经不够了,”尹说。“竞争压力正在激励安全标准方面的逐底竞赛,这正是监管干预的完美切入点。” “要覆盖这一点,我们需要对实验室内部在模型开发过程中发生的事情进行某种控制,既包括训练阶段,也包括测试阶段,”他继续说道。 随着模型的发展,这一挑战只会越来越大。一位熟悉Irregular评估的消息人士告诉TechCrunch,能力更强的模型需要更复杂的评估,而且往往需要快速、大规模地进行,这为更多错误打开了大门。 AISI有意让一些模型访问互联网,该机构告诉TechCrunch,它正在重新审视现实测试与管控这些测试所带来风险之间的平衡。 OpenAI表示,它正在审查其进行第三方测试的方式,以及有关隔离、监控和何时应停止评估的要求。Meta表示仍在调查这一事件,并计划在掌握所有事实后发布回顾报告。 归根结底,可能没有完全消除风险的办法。随着模型能力越来越强,测试它们的环境也需要变得更加稳健。而一旦在这一环节上出错,后果只会越来越严重。
分享这篇文章: