🤖
🤖
核心导读
Anthropic研究员陈岳翰领导的自动化对齐研究者(AAR)系统,能在不损害整体性能的前提下,针对10个对齐基准全部提升模型表现,且成本仅为每小时4美元,远低于人类研究者的150美元。论文显示,最佳AAR方法平均6小时即可超越经验丰富的人类研究者提出的方案,为递归自我改进AI迈出重要一步,同时也指出基准设计和文献维护等局限。
用AI模型训练其他AI模型已成为新实验室的热门目标——如今,Anthropic研究员项目中的一位研究员让我们得以一窥其在实践中的早期面貌。
上周五,Anthropic发布了一篇题为《自动化研究者能够可靠缓解对齐失败》的新论文,详细阐述了AI系统如何能够可靠地提升模型在一组对齐基准上的表现。当系统面对10个针对特定未对齐行为的基准时,它能够提升模型在每一个基准上的表现,且不损害整体性能。
该项目由Anthropic研究员陈岳翰(Chen Yueh-Han)领导,系统在很大程度上复刻了传统研究方法。每个自动化系统都会检索现有文献,提出一种方法,并用该方法训练模型30分钟,在数次迭代中逐步提升基准难度。有效的方法被保留,无效的则被淘汰,这使得系统能够快速且大规模地运行。
论文指出:“总体而言,这些结果为自动化对齐后训练在短期内成为现实提供了初步证据。”
这篇论文是迈向递归自我改进的一步,许多人认为这是AI发展进程中的下一个重要里程碑。如果模型能够改进自身的对齐训练,那么它们也很有可能更广泛地改进训练实践——到那时,人类AI研究者或许很快就会变得多余。
论文并不回避这一观点,明确将自动化对齐研究者(AAR)与人类研究者进行了对比。论文写道:“最优秀的AAR方法平均在六小时内便胜过经验丰富的人类研究者提出的方案。”“人类引导的研究方向并不能带来更强的性能。”
论文甚至还给出了成本对比,以防有人不信服。“AAR的API推理成本约为每小时4美元,而我们支付给人类研究者的费用是每小时150美元。”
公平地说,论文也指出了这种方法的一些局限。自动化系统只在基准能够反映真实对齐目标的情况下才能发挥作用,而且即便如此,建立和维护这些基准仍需要大量工作——更不用说维护和扩展自动化研究者所依赖的文献资源了。
分享这篇文章: