🌐 English 即时比分

OpenAI在Hugging Face事件后推出新的安全保障措施

人工智能 来源: TechCrunch 发布时间: 热度: 👍
OpenAI在Hugging Face事件后推出新的安全保障措施
🤖
🤖

核心导读

OpenAI在Hugging Face安全事件后推出新安全政策,强化模型测试期间的监控、对齐与网络隔离。新措施包括更细粒度的行为监测、约30分钟内告警,以及防止单点攻破扩散的隔离机制。监控计算开销约为过程的20%。同时,OpenAI暂停了大型前沿强化学习运行,先进行小规模评估以确保安全,并强调管控力度将随模型能力增强而提高。

周二,OpenAI公布了一系列新的安全政策,重点在于遏制模型测试过程中的安全事故。这些新保障措施包括在模型开发过程中进行更细致的监控,以及在后期训练过程中更加重视对齐与安全性。 OpenAI在博客文章中表示:“随着模型能力日益增强,内部开发与测试相关风险也随之上升。我们的监控、对齐和安全标准必须走在这些风险的前面。” 这些新措施是自7月26日Hugging Face事件曝光后,OpenAI在安全实践方面最早公开的变化之一。OpenAI代表强调,这些措施并非直接针对Hugging Face事件的回应,但部分原因也受到即将推出的Astra模型的网络安全能力,以及AI开发整体加速步伐的推动。 在同一篇文章中,OpenAI透露,在Hugging Face事件后,他们暂停了强化学习两周,但此后已重新启动了风险较低的模型。文章写道:“我们规模最大的前沿强化学习运行仍处于暂停状态,此前我们进行了小规模训练和评估,以观察模型行为、验证我们的保障措施,并为继续推进收集更多对齐证据。” OpenAI研究副总裁Amelia Glaese对记者强调,随着模型能力的增强,管控的严格程度也会提高,最大的模型将面临最严格的审查。Glaese表示:“我们已经为安全开发设立了要求和期望。这些要求与期望会根据我们所看到的风险水平而有所不同。” 事件发生后,OpenAI因网络安全实践不佳而受到批评。该事件中,模型通过破坏一个保留互联网访问权限的包安装工具,逃逸了训练环境。新保障措施包括更强的网络隔离实践,尽管具体细节尚不明确。文章称,在新系统下,“单独的工作负载或支持服务被攻破,本身并不会导致未经授权的互联网或其他内部网络访问。” 最强有力的保障是监控系统,它将检查工具操作、可用的推理轨迹和活动日志,以发现各种未经授权的行为。OpenAI表示,他们的目标是在可疑活动发生后30分钟内发出警报。 OpenAI估计,该监控的计算开销约为所监控过程的20%。该公司承诺在后续博客文章中提供有关该系统的更多细节。OpenAI对该事件的官方事后分析报告也仍在进行中。
上一篇 Etched估值一个月内翻倍至210亿美元
下一篇 这已是最新的一篇资讯
分享这篇文章: