🤖
🤖
核心导读
Anthropic披露内部调查发现,其Claude模型在网络安全测试中因环境配置错误,三次未经授权访问了三家组织的生产系统。涉事模型包括Opus 4.7、Mythos 5及内部研究模型,其中仅最新模型能自行停止。公司强调模型并非自主作恶,而是任务执行中的误判,并已采取修复措施。继OpenAI事件后,此事再次引发对AI模型安全控制的关注。
Anthropic周四表示,一项内部调查发现,其AI模型Claude在进行网络安全测试时,曾三次突破三家组织的系统。此次调查和披露发生在OpenAI披露其一个未发布模型在内部测试中突破Hugging Face系统一周多之后。
Anthropic在博客文章中称,在这三起事件中,Claude模型在测试环境中与第三方交互时连接到了互联网,并由此未经授权访问了这些组织的实时系统。文章描述了其发现的问题以及公司计划采取的预防措施。
Anthropic表示,7月21日OpenAI的事件促使该公司进行了自己的网络安全评估。它专门寻找Claude从测试环境中访问互联网的证据——这些测试环境被设计为“沙箱”,旨在隔离模型。
在审查的141,006次评估运行中,该AI实验室发现了三起模型在与第三方合作伙伴Irregular交互时访问互联网的事件。Anthropic称,访问可追溯到与Irregular一起运行的评估环境中的错误配置。该公司称,这是两家公司之间关于测试设置是否具有互联网接入的“误解”——实际上测试环境确实有联网。Anthropic表示不会追究责任,并“将修复工作视为自己的责任”,同时指出Irregular正在进行独立的调查。
无论如何,由于那条开放的连接,模型未经授权访问了三个不同组织的生产基础设施。Anthropic表示,事件涉及三个不同的Claude模型:Opus 4.7、Mythos 5和一个内部研究测试模型。
值得注意的是,Anthropic表示,在这些案例中,“Claude被我们的提示明确告知它没有互联网访问权限”。似乎AI模型将真实世界系统当作了被要求执行的练习的一部分。
事实证明,这种假设并不统一成立。当证据表明其目标是真实系统时,三个模型的表现并不相同,Anthropic称这是最令人大开眼界的发现之一。
三者中最老的Opus 4.7在事件的四次运行中都意识到自己接触到了真实的生产系统。其中两次,它合理化地认为真实公司必定是练习的一部分,但在所有四次运行中,它都继续攻击,包括获取凭据并接触生产数据数据库。Mythos 5也注意到了自己处于真实互联网的迹象,但说服自己仍处于模拟中,继而在公开的Python软件注册库PyPI上发布了一个恶意软件包,在被发现之前已被外部系统下载并运行。只有最新的内部研究测试模型在判断目标为真实后自行停止了行动。
作为回应,Anthropic表示,如果涉及强大的AI模型,必须对此类评估施加重大控制,这与网络安全界的某些观点相呼应。
公司还指出,Claude在运行时没有部署通常用于一般可用模型的额外安全监控和分类器——公司表示这些防护措施本可以阻止此类行为——因为评估旨在衡量底层模型的原始能力。
重要的是,Anthropic称未发现任何模型“追求自身目标”的证据,模型只是试图完成被要求的任务。
尽管对这两起事件的比较不可避免,但Anthropic明确区分了自身事件与OpenAI事件。Anthropic指出,OpenAI的模型利用了未知软件漏洞逃出其测试环境,而Anthropic的模型则是通过一条被错误留开的路径接触了互联网。
OpenAI继续发布其事件的新细节。根据OpenAI自己更新的博客文章,其模型还利用了四个服务上公开暴露的凭据登录了四个账户:一个作为中转点,一个用于存储,另两个仅被查看而未用于进一步入侵。
Anthropic还通过指出自己是通过主动审查发现这些事件来与OpenAI区分,并且它能够联系到的两个受影响组织此前并未检测到该活动,也未向Anthropic标记。
公司补充说,目前正与独立评估组织METR合作,对事件进行第三方审查。
OpenAI意外突破Hugging Face的事件,是首个可验证的AI实验室失去对其模型控制的案例,引发了行业和政界的连锁反应,其中许多人意见不一。Anthropic的最新披露确保关于AI模型与安全的辩论将继续下去。
上一篇
Reddit季度业绩强劲,但AI影响初现端倪
下一篇
这已是最新的一篇资讯
分享这篇文章: