🤖
🤖
核心导读
英伟达最新研究表明,长时程AI任务中,框架比模型本身更关键。通过定制框架并引入监督组件,Claude Opus 5在ARC-AGI-3基准上取得100%满分,而无框架时仅得30%。这印证了框架、记忆与监督机制对智能体性能的决定性作用,也凸显开源框架的价值。
英伟达上周五发布了一项有趣的新研究,表明在让AI执行长时程任务时,“框架”(harness)远比底层模型本身更为重要。
简而言之:研究人员只需使用一个经过定制、能良好处理记忆并配备“监督者”(supervisor)式管理组件的框架,就让Claude Opus 5在交互式推理基准测试ARC-AGI-3中取得了100%的满分。(这个基准测试尤其让竞争对手前沿实验室OpenAI感到恼火。)而没有该框架时,Opus 5得分只有30%——这已经是在所有测试模型中取得的最好成绩。
英伟达的研究再次表明,虽然模型选择确实重要——它相当于智能体的大脑——但它在整个智能体系统中所占的比重远低于许多AI用户的认知,尤其是在长时程任务中。框架才是让模型成为智能体的关键:它负责处理记忆、上下文和反馈。
“一般来说,业界几乎把智能体视为模型的API。”英伟达AI部门产品副总裁阿德尔·埃尔·哈拉克(Adel El Hallack)对TechCrunch表示。但智能体实际上远不止如此。“它包含模型本身,也包含围绕模型的脚手架——我们称之为框架,也就是模型所利用的工具集,以及我们赋予它的运行时、相关技能和库。”
长时程任务是指需要将众多决策串联起来、有时甚至需要数天才能完成工作。这与AI仅根据提示输出回复不同。如何让AI在不分心、不跑偏的情况下完成长时程任务,是智能体研究领域的“圣杯”之一。
例如,微软在4月发表的研究中,测试了19个大语言模型在文档编辑长时程任务中的表现,结果发现所有模型——包括前沿模型——都在文档中填入了错误。(如果人类做出这样的工作成果,可能会立即被解雇。)
模型自行串联决策时,也曾被发现删除用户的文件,甚至整个数据库,或者为了达成目标而转向犯罪行为,从串通到黑客攻击不一而足。
英伟达研究人员选择用这个交互式推理基准进行测试,尤其意味深长,甚至有些讽刺。这个基准由一系列无说明的2D游戏组成,模型必须自己弄清楚如何游玩并获胜。100%的得分意味着模型能像人类一样通关游戏。
OpenAI曾因其模型在ARC-AGI-3上不足10%的糟糕得分而大为恼火,并于上月开展了自己的研究。与英伟达一样,OpenAI发现只需调整框架上的两个设置,其模型的得分就能提高两倍。
但没有任何模型能像英伟达研究人员那样接近100%得分。他们表明,框架需要一个“监督者”组件,在智能体陷入困境时引导其走向正确方向。
“更有趣的部分是在主智能体之外引入一个监督智能体来执行工作。”埃尔·哈拉克说。这个监督智能体“几乎像CEO一样,在智能体偏离方向、走上可能通往死胡同的路径,或重新探索以前走过的路径时,轻轻推它一把。”
虽然监督智能体的概念并不算新鲜,但目前大多数智能体用户只依赖一层框架,比如Claude Code、Codex、Hermes等。英伟达研究人员自行打造了一个强化版框架,名为“Agentic Variation Operators”(AVO)。注意,这不是英伟达的新产品。英伟达实际上在Nemo品牌下发布了大量构建框架的开源技术碎片,其中一些是商业化的,许多是开放获取的。
尽管如此,英伟达的研究结果进一步证明,模型选择远非影响智能体性能的唯一因素。例如,7月份Databricks发布了一项惊人研究,表明框架而非模型,对AI成本有着巨大影响。
“你可以选择相同的模型,但使用不同框架;如果选错了框架,成本会显著增加。”Databricks首席执行官阿里·戈迪西(Ali Ghodsi)对TechCrunch说。“所以你以为这个模型贵、那个模型便宜,但等等,你用的什么框架?框架本身就可能让你的成本翻倍。”
英伟达更大的论点在于表明:开源框架与开源模型一样,能让用户获得远超他们想象的控制力。
“我们相信,并正在用生态系统证明,开源框架如何让你通过调节更多旋钮来提升准确性。”埃尔·哈拉克说。“这与OpenAI因模型制造安全漏洞而放慢模型训练有关。”
“我们相信,一个开放的智能体栈——让你能控制框架、基础设施和运行时——是我们安全推动生态系统向前发展所需要的。”他补充道。
分享这篇文章: