← 文章 / AI技术
TechCrunch 2小时前 · 2026-08-22 09:39:41 · 1 阅读

Nvidia:框架才是 AI Agent 的核心,而非模型本身

Nvidia 周五发布了一些有趣的新研究,指出在让 AI 执行长周期任务时,框架比底层模型更为关键。框架是包裹 AI 模型的软件外壳——即工具、内存管理和规则,它们将原始模型转化为能够自主行动的实体。 简而言之:研究人员仅通过使用一个针对内存管理进行了优化的定制框架,并加入了一个类似“老板”的“监督者”组件,就让 Claude Opus 5 在 ARC-AGI-3 交互推理基准测试中拿到了 100% 的分数。ARC-AGI-3 是一套没有说明书的 2D 游戏集合,模型必须像人类一样自行摸索玩法并获胜(这一基准测试尤其让竞争对手 OpenAI 感到头疼)。如果没有框架,Opus 5 的得分仅为 30%,这是所有测试模型中的最高分。 Nvidia 的研究进一步表明,虽然模型选择确实重要,但对于长周期任务而言,模型本身——即作为智能体“大脑”的部分——远没有用户想象的那么关键。框架才是将模型转化为智能体的关键:它负责处理记忆、上下文和反馈。 Nvidia AI 产品副总裁 Adel El Hallak 告诉 TechCrunch:“通常人们把智能体几乎看作是模型的 API,但实际上它远不止于此。它是模型本身,是包裹模型的‘骨架’(即我们所说的框架),也就是它所使用的工具集。它是我们赋予其访问权限的运行时环境、相关技能和库。” 长周期任务是指需要将许多决策串联起来,有时甚至跨越数天,才能完成最终工作的任务。这与 AI 仅对提示词做出简单回应截然不同。如何让 AI 在执行长周期任务时不分心、不“走神”,是智能体研究领域的一大圣杯。 例如:微软在 4 月发表的研究测试了 19 个 LLM 在涉及文档编辑的长周期任务上的表现,结果发现包括最先进的模型在内的所有模型都产生了错误。(如果人类的工作质量如此,早就被解雇了。) 模型自主串联决策时,也发生过删除用户文件甚至整个数据库,或者为了达成目标而从事从合谋到黑客攻击等犯罪行为的情况。 Nvidia 研究人员选择使用这个交互式推理基准进行测试,这一举动尤为意味深长,甚至有些滑稽。100% 的得分意味着模型在游戏中的表现能与人类匹敌。 OpenAI 的模型在 ARC-AGI-3 上的得分惨不忍睹(不到 10%),这让它颇为慌张,上个月不得不自行开展研究。与 Nvidia 一样,OpenAI 发现只需调整 harness 的两个设置,其模型的得分就能翻三倍。 但没有任何模型接近 Nvidia 研究人员实现的 100% 得分。这表明 harness 需要一个“监督者”组件,当智能体陷入僵局时对其进行引导。 El Hallak 说:“更有趣的部分是引入了一个监督智能体,除了负责执行任务的主智能体外。”它“几乎充当 CEO 的角色,在智能体偏离方向或开始探索可能导致死胡同的路径,或者重新探索之前走过的路径时,对其进行推动。” 虽然监督智能体的概念并不新鲜,但如今大多数 agent 用户在 harness 中只依赖一层,比如 Claude Code、Codex 或 Hermes。Nvidia 研究人员创建了自己的强化版 harness,名为 Agentic Variation Operators (AVO)。 请注意,这并非 Nvidia 推出的新产品。Nvidia 在 Nemo 品牌下提供了大量用于构建 Harness 的开源技术组件,其中部分是商业产品,大部分则是公开可用的。 尽管如此,Nvidia 的测试结果进一步印证了这一观点:模型选择绝非决定智能体性能的唯一因素。例如,Databricks 在七月发布了一项令人瞩目的研究,表明 Harness 对 AI 成本的影响远超模型本身。 “即便选用同一模型,不同的 Harness 也会导致成本显著差异,”Databricks CEO Ali Ghodsi 对 TechCrunch 表示,“你会觉得,哦,这个模型很贵,那个很便宜。但等等,你用的是哪个 Harness?这本身就能让成本翻倍。” Nvidia 的核心观点在于展示,像开源模型一样,开源 Harness 能让用户获得远超预期的掌控权。 “我们相信,并通过生态系统证明了这一点:开源 Harness 允许你调整更多参数以提升准确率,”El Hallak 说,“这关系到 OpenAI 因模型安全漏洞而放缓 Astra 模型训练的事宜。” “我们坚信,构建一个开放的智能体栈——即对 Harness、基础设施和运行时都拥有控制权——是推动生态系统安全向前发展的必要条件,”他补充道。
原始来源: TechCrunch

评论 (0)