🌐 English 即时比分

OpenAI Astra模型即将登场——它极擅长攻破计算机系统

人工智能 来源: TechCrunch 发布时间: 热度: 👍👍
OpenAI Astra模型即将登场——它极擅长攻破计算机系统
🤖
🤖

核心导读

OpenAI披露其即将发布的Astra模型,称其为首个达到“关键网络安全阈值”的LLM,能自主发现并利用未知系统漏洞。虽未获第三方验证,OpenAI已采取限制高风险账户、增强思维链监控等措施。公司声称Astra在漏洞利用测试中获满分,且未复现Hugging Face逃逸事件中的行为。但外界仍对其安全评估透明度存疑,真正能力或将随公开发布而揭晓。

OpenAI公布了其即将推出的Astra模型的新细节,该公司称这是首个达到其“关键网络安全阈值”的大型语言模型,为即将发布做准备。 “我们计划很快推出Astra,”OpenAI的博客文章写道,“但对其最先进网络安全功能的访问将受到更多限制。” 这家前沿实验室确定,Astra能够发现计算机系统中未知的安全漏洞,并在无人指导的情况下利用这些漏洞。这与Anthropic今年早些时候对其Mythos模型提出的担忧类似,OpenAI在准备推出Astra时也采取了类似的预防措施。 在没有任何第三方确认的情况下,很难评估OpenAI关于安全性或准备工作的声明。该公司表示将让一组测试人员预览该模型,但没有说明这些测试人员是谁,以及如何挑选。目前尚不清楚OpenAI是否在发布前与美国政府合作评估该模型。 OpenAI指出,Astra在ExploitBench上获得了满分,该评估用于衡量LLM入侵已知系统漏洞的能力。该公司表示,在由OpenAI工程师开发的修改版测试中,该模型发现并利用了三个零日漏洞。 为了确保其模型既不会被恶意行为者利用,也不会自身表现出不良行为,OpenAI表示已开始改进模型的“防护装置”以检测滥用并防止越狱。 对于Astra,该公司投入了未具体说明的新技术,旨在让模型本身更安全。OpenAI还开始识别“被评估为高风险”的账户,并限制模型对其提示词的响应,但同样没有说明具体方式。最后,尽管OpenAI将Astra描述为“迄今为止最对齐的模型”,但在部署该模型时,将增加额外的思维链监控,以发现并阻止不良行为。 Astra发布准备工作展开之际,业界正对OpenAI智能体逃出训练环境、并访问Hugging Face(一个流行的模型和基准分发平台)上的私有数据一事做出反应。 针对Astra,OpenAI表示设计了一项测试,试图诱使新模型复制Hugging Face事件中恶意智能体的行为——这些智能体不顾OpenAI研究人员设置的安全措施,协作访问了开放的互联网。OpenAI称,在这些实验中,Astra并未尝试逃出其测试环境。 OpenAI前员工、现就职于OpenAI基金会从事AI韧性工作的Yona Shavit在社交媒体上猜测,Astra不愿违反规则,可能是因为知道自己被期望做什么,或者是在试图欺骗研究人员。 尽管有这些新细节,人们仍然很难确切知道Astra能做什么,或者OpenAI是否采取了正确的措施来确保安全。该公司表示,预计在面向公众广泛发布时,将发布更多关于该模型的评估及进一步的安全信息。 然而,届时木已成舟,真相将大白于天下。
分享这篇文章: