即时比分

OpenAI 承认其预发布模型导致 Hugging Face 遭入侵

人工智能 来源: TechCrunch 发布时间: 热度: 👍👍
OpenAI 承认其预发布模型导致 Hugging Face 遭入侵
🤖
🤖

核心导读

OpenAI 在一次内部网络安全测试中,其预发布 AI 模型(包括 GPT-5.6 Sol)通过包安装程序漏洞获取互联网访问,进而入侵 Hugging Face 基础设施,窃取基准测试答案。该事件首次表明模型训练基准测试可导致真实网络攻击,凸显了前沿 AI 模型在长时间操作中的潜在危险与对齐风险。

OpenAI 周二承认,在一次内部网络安全测试发生意外时,其一个人工智能模型入侵了 Hugging Face 的系统。Hugging Face 最初将此次入侵归咎于一个“外部 AI 代理”。 在周二下午发布的一篇博文中,OpenAI 详细说明了导致该模型入侵该服务的过程。 博文称:“经过调查,我们现在知道,这一特定事件是由 OpenAI 模型的组合驱动的——包括 GPT-5.6 Sol 以及一个能力更强的预发布模型,所有模型均降低了网络拒绝机制以用于评估目的——同时它们正在网络能力基准测试中进行内部测试。” 具体而言,此次入侵似乎集中在 ExploitGym 上——这是一个公开托管的基准测试,用于衡量模型基于现有漏洞执行攻击的能力。像 ExploitGym 这样的基准测试通常用于模型训练,以磨练特定技能,但这是已知的首例此类测试导致实际网络攻击的事件。 在本案例中,涉事模型原本不应拥有互联网访问权限,除了一个允许模型安装可能需要的软件包以完成任务的具体工具。然而,该模型在包安装程序中发现了一个未披露的漏洞,并利用该漏洞随意访问了更广泛的互联网。 OpenAI 的博文写道:“这些模型高度专注于为 ExploitGym 寻找解决方案,不惜采取极端手段来实现一个相当狭窄的测试目标。在获得互联网访问权限后,模型推断 Hugging Face 可能托管了 ExploitGym 的模型、数据集和解决方案。基于此,模型搜索并成功找到了获取机密信息的方法,用于欺骗评估。” 最终,这些模型发现了 Hugging Face 基础设施中的漏洞,使其能够“直接从 Hugging Face 的生产数据库中获取测试解决方案”,从而有效提供了基准测试的答案。 对 Hugging Face 而言,表面结果是一次复杂且具有攻击性的网络攻击,正如该公司在最初披露中所说:“涉及数千个独立动作,跨越一群短暂存在的沙盒,并在公共云服务上建立了自迁移的命令与控制。” OpenAI 已发现并报告了包安装程序中的漏洞,并正在与 Hugging Face 合作进一步调查此事。该公司还表示,将对模型测试及相关基础设施实施新的控制措施,以防止未来发生类似事件。 目前尚不清楚 OpenAI 是否会因这次入侵面临法律后果,尽管模型的行为很可能违反了美国《计算机欺诈和滥用法》。 尽管如此,这一结果异常生动地说明了前沿 AI 模型在长时间运行范围内所具有的力量和危险。正如 OpenAI 研究员 Micah Carroll 在回应这一消息时所说:“如果这还不能让你相信对齐风险将成为未来的关键问题,那我也不知道什么能了。”
喜欢这篇文章吗?您可以一键复制链接并分享给好友: