🌐 English 即时比分

OpenAI新推理技术引发AI安全专家担忧

人工智能 来源: TechCrunch 发布时间: 热度: 👍👍
OpenAI新推理技术引发AI安全专家担忧
🤖
🤖

核心导读

The Information报道称,OpenAI新模型Astra将采用“不透明递归”推理技术,可能使思维链更难监控,引发AI安全专家强烈担忧。专家指出该技术或削弱可监控性,甚至导致“逐底竞争”。虽然Astra使用有限,但Anthropic和谷歌DeepMind已在讨论类似技术,业界担忧不透明推理的扩展将彻底脱离可见监控。

据The Information周二报道,OpenAI的新模型Astra将采用一种名为“递归深度”的推理技术,使其能够跳出大多数推理模型所特有的顺序思维模式。这项技术也被称为“不透明递归”,可能会使模型的思维链更难被监控——这已让AI安全专家感到不安。 尽管据报道Astra对该技术的使用有限,但其出现仍在AI安全专家中引发了重大关切。 “我对Astra使用不透明递归的报道感到极为担忧,”Redwood公司首席执行官Buck Shlegeris在消息传出后的一篇帖子中写道。“我不知道Astra的思维链可监控性是否比之前的模型差很多。但如果OpenAI进一步推进这项技术,他们就可以大规模增加递归,彻底摧毁思维链的可监控性。” 长期倡导AI安全的Zvi Mowshowitz也发表了看法,他写道,可能有必要通过法律来防止AI实验室之间的“逐底竞争”。 “这项技术是在玩火,冒着打破OpenAI和Anthropic一直在努力确立的一条禁忌的风险——即我们要尽最大努力维持思维链的忠实性和可监控性,”Mowshowitz写道。“更密集地使用此类技术可能会损害可监控性。” 在正常情况下,推理模型的思维链会提供模型在尝试解决问题时所采取的连续步骤。虽然这种表示并不完美,但它仍是监控错误行为或偏离对齐的有用工具。以OpenAI最近的“ rogue agent”活动为例,思维链记录是揭示代理行为原因的重要工具。 在不透明递归中,模型采用了一种不太线性的方法,在循环中多次处理相同的查询。结果留下的可读痕迹更少,从而有效地绕过了传统的思维链记录。 至关重要的是,Astra对这项技术的使用似乎有限。该模型的思维链仍有望保持可读性,OpenAI也反驳了任何其将转向“神经语”的暗示。OpenAI已宣布计划在其前瞻性安全计划中,构建广泛的思维链监控系统。 OpenAI首席科学家Jakub Pachocki在X上的一篇帖子中强调,该实验室致力于保持思维链的可读性。“OpenAI从我们的第一个推理模型起,就一直努力保留和利用思维链监控,”Pachocki写道。“这是我们当前研究计划的核心目标。” 所有AI模型都会进行一定数量的不透明推理,很少有研究者将思维链日志视为模型推理的直接表示。然而,这些提醒并不能消除人们的担忧,即不透明递归可能使AI推理更难监控,尤其是当它在不同模型中的使用不断增长时。在周三上午的后续报道中,The Information称,Anthropic和Google DeepMind已经开始讨论这项技术。 Redwood Research首席科学家Ryan Greenblatt在回应这一消息的帖子中表示,不透明推理的扩展速度可能比传统思维链推理快得多,从而有效地将所有推理从可见渠道中移除。 “我最担心的是,从这里开始的一个自然进程可能是将不透明推理扩展到模型完全或几乎完全在潜在空间中推理的程度,”Greenblatt写道。“我希望现在还不算太晚,能够避免最令人担忧的架构,也希望OpenAI能就此止步。”
分享这篇文章: