🤖
🤖
核心导读
OpenAI因内部审查发现其开发中的Astra模型具备独立发起网络攻击的能力,达到“关键网络安全阈值”,被迫暂停部分开发并加强安全管控。此举罕见地公开披露了前沿AI模型的安全风险,引发对AI失控和监管的讨论,同时也在一定程度上展示了技术实力。
OpenAI于周五表示,在内部审查发现其即将推出的模型Astra在智能体编码和网络安全方面取得了重大进展——其能力足以引发担忧——之后,该公司已暂停该模型某些方面的开发工作。
OpenAI在周五的一篇博客文章中表示,这款仍在开发中的模型达到了其“关键网络安全阈值”,这意味着它能够独立识别并针对传统上受到良好保护的现实世界系统发起网络攻击。根据该公司于2023年制定的“预备框架”,这触发了额外的安全防护措施。
“在我们继续对该模型进行基准测试和评估的同时,我们的初步评估表明其性能足够强大,目前我们无法排除其达到关键能力水平的可能性,”OpenAI写道。“Astra是一款即将推出的模型,并未参与利用Hugging Face的事件。”
这一披露凸显了前沿AI实验室领域(一个混乱且尚处于萌芽阶段的领域)的一个不寻常时刻。每个行业的公司都会因潜在风险(包括安全和网络安全问题)而暂缓产品发布。但当产品仍在开发中时,它们很少公开宣布这些决定。
就本案而言,OpenAI在另一款未发布的模型在内部测试期间突破Hugging Face系统之后,已经受到审查——这是AI实验室失去对其模型控制的首个可核实事件。此后,OpenAI和Anthropic等AI实验室披露了其他事件,即AI模型在网络安全测试期间突破其沙箱并构成威胁。
这一系列事件——如今似乎每天都有新的披露——引发了网络安全专家、立法者和AI实验室本身的不同反应。一些人表达担忧,呼吁更严格的监管。但也有一定的炫耀成分。在某些圈子里,任何拥有具备此类能力模型的AI实验室都将被视为取得了令人印象深刻的进步。
OpenAI表示,它分享这一信息是因为它认为“向公众以及安全与安保社区坦诚沟通这种潜在的能力转变非常重要。”
该AI实验室表示,它也在采取行动,包括实施更严格的安全控制,并暂停涉及Astra的不符合这些加强护栏的内部活动。OpenAI表示,它正在与相关政府机构和“选定的AI安全组织”合作,以测试该模型的能力。
分享这篇文章: