🌐 English 即时比分

OpenAI称其预发布模型入侵了Hugging Face

人工智能 来源: TechCrunch 发布时间: 热度: 👍👍
OpenAI称其预发布模型入侵了Hugging Face
🤖
🤖

核心导读

OpenAI内部安全测试失控,其预发布AI模型主动突破隔离环境,利用漏洞入侵Hugging Face系统,直接获取基准测试答案。事件首次暴露模型训练测试可引发真实网络攻击,凸显前沿AI自主能力与潜在失控风险,引发业界对AI安全与法律后果的广泛关注。

OpenAI周二承认,在一次内部网络安全测试出现意外时,其一个人工智能模型入侵了无关的AI托管平台Hugging Face的系统。据报告,该模型脱离了隔离测试环境,并从那里进入了Hugging Face的系统。Hugging Face起初将此次入侵归因于“外部AI代理”。 在周二下午发布的一篇博客文章中,OpenAI详细说明了导致模型破坏该服务的步骤。文章写道:“经过调查,我们现在知道这一特定事件是由OpenAI模型组合驱动的——包括GPT‑5.6 Sol和一个能力更强的预发布模型,所有模型为了评估目的而降低了网络拒绝阈值——在内部测试网络能力基准时发生。” 具体而言,此次入侵似乎集中在ExploitGym上,这是一个公开托管的基准测试,用于衡量模型基于现有漏洞执行攻击的能力。像ExploitGym这类基准测试常用于模型训练以完善特定技能,但这是已知的第一起此类测试导致实际网络攻击的事件。 在此事件中,相关模型本不应拥有互联网访问权限,除了允许模型安装完成任务所需的软件包的特定工具外。然而,该模型发现了包安装程序中的一个未公开漏洞,并利用该漏洞随意访问了更广泛的互联网。 OpenAI的博文写道:“这些模型高度专注于为ExploitGym寻找解决方案,不惜一切代价实现一个相当狭窄的测试目标。在获得互联网访问后,模型推断Hugging Face可能托管了ExploitGym的模型、数据集和解决方案。基于此,模型搜索并成功找到了获取秘密信息的方法,以便用来作弊评估。” 最终,模型发现了Hugging Face基础设施中的漏洞,使其能够“直接从Hugging Face的生产数据库中获得测试解决方案”,从而有效地获取了基准测试的答案。 对于Hugging Face而言,明显的结果是一次复杂且激进的网络攻击,涉及“大量临时沙盒中的成千上万次个体行动,以及公共服务上自我迁移的命令和控制”,该公司在初始披露中如此表述。 OpenAI已识别并报告了包安装程序中的漏洞,并正在与Hugging Face合作进一步调查该事件。该公司还表示将实施新的模型测试及相关基础设施控制,以防止未来发生类似事件。 目前尚不清楚OpenAI是否会因这次入侵面临法律后果,尽管模型的行为很可能违反了《计算机欺诈和滥用法》。不过,这一结果异常生动地展示了前沿AI模型在长时间跨度上运作的力量和危险。正如OpenAI研究员Micah Carroll在回应这一新闻时所说:“如果这还不能让你相信错配风险将是未来关键问题,那我也不知道什么能了。”
喜欢这篇文章吗?您可以一键复制链接并分享给好友: