程序图:让AIAgent自我进化的施工图纸,24项测试21项第一
知识图谱告诉 AI "世界是什么",程序图告诉 AI "下一步该做什么"。这一次,AI 真的能自己教自己了。
引言
你有没有遇到过这种情况:让 AI 帮你完成一个复杂任务,刚开始还井井有条,做着做着就开始"迷路"——工具调用顺序乱了,目标忘了,甚至反复执行同一个无效操作?
这不是个例,而是当前大语言模型(LLM)Agent 面临的普遍难题。随着任务链条变长,Agent 的"程序性知识"——也就是该做什么、按什么顺序做、在什么条件下做——全靠自由生成来维持,很容易崩盘。
2026 年 9 月,来自 Google、佐治亚理工学院和北京大学的研究团队在 arXiv 上发表了一篇重磅论文,提出了一种全新的解决方案——程序图(Procedural Graph)。简单来说,就是给 AI Agent 装上了一张"施工流程图",而且这张图还能自我进化。
论文在 7 个基准测试、4 个主流大模型上进行了验证,结果令人印象深刻:在 24 组实验中,程序图在 21 组中拿下第一。
什么是程序图?一张图看懂"该做什么"
我们先来理解一个类比。
知识图谱大家都很熟悉了:它用"实体-关系-实体"的三元组来组织事实知识,比如"北京-是首都-中国",回答的是"是什么"的问题。

程序图的思路如出一辙,但组织的是"程序性知识":它用"步骤-关系-步骤"的三元组来描述任务流程,比如"现金流预测→触发→融资申请",回答的是"该做什么"的问题。
每个节点代表一个工具调用、推理步骤或任务状态;每条边描述了步骤之间的合法转换,并附带三个关键属性:
- 触发条件(condition):什么时候该走这一步
- 操作指引(guidance):具体怎么做
- 避坑提示(pitfalls):什么不该做
举个例子:一条"现金流预测→融资申请"的边可能标注着——"当预计资金跑道低于安全缓冲时触发;建议提前提交申请以预留到账时间;切忌在已有申请未处理时重复提交。"
这种设计让 Agent 不再"凭感觉"选择下一步,而是有据可依。
两大核心机制:在线指导 + 离线进化
程序图的框架包含两个互补的阶段。
在线推理:实时导航,而非全局灌输
Agent 执行任务时,程序图保持冻结。每一步决策时,框架做三件事:
- 定位:根据 Agent 最近的动作,在图中找到当前节点
- 提取:取出该节点周围 2 跳范围内的局部子图
- 生成指导:一个指导模型读取子图,结合最近的轨迹窗口,生成情境化的下一步建议
关键在于"局部"二字。不是把整张图塞进上下文(那会消耗大量 token),而是只看 Agent 当前所在位置附近的信息。这就像你在地铁里看线路图,只需要关注当前站和接下来几站的信息,而不是整张地图。
实验证明,这种局部化策略在三个基准测试上都优于全图注入,同时 token 消耗降低了 15%-71%。
离线进化:从失败中学习,从成功中提炼
程序图最亮眼的特性是自进化。每一轮进化包含四步:
- 诊断性执行:用当前图跑一批训练任务,记录成功和失败的轨迹
- 反馈驱动变异:一个 LLM 精炼器对比成败轨迹,提出图的修改方案——添加缺失节点、删除导致失败的边、修改属性描述
- 验证门控:在独立的验证集上测试修改后的图,只有性能不下降才接受
- 拒绝记忆:被拒绝的修改方案会被记录下来,防止下一轮重蹈覆辙
这个过程不断循环,图的结构和属性越来越精炼。

实验结果:全面碾压,尤其是长周期任务
研究团队在 7 个基准测试上评估了程序图的表现,涵盖多跳问答、多轮对话、专业任务评估、具身环境操作、工具调用、函数调用和长周期金融决策。
核心发现:
- 在 BFCL v3(函数调用)上,Gemini 3.5 Flash 使用程序图后准确率从 58% 飙升到 67%,提升 9 个百分点
- 在 GDPval(专业任务)上,Gemini 3.1 Pro 从 71.37 分提升到 78.78 分
- 在 τ-bench(工具交互)上,同一模型从 73.04% 提升到 80%
最惊艳的是长周期金融决策任务 EnterpriseArena。 在这个任务中,Agent 需要在 132 个月内管理企业财务,经历三次未预告的经济危机。程序图将 Gemini 3.1 Pro 的全程存活率从 6% 提升到 34%,将 Grok 4.1 Fast 从 26% 提升到 40%。
为什么差距这么大?因为程序图引导 Agent 在"风平浪静"的月份就提前融资,而不是等到危机来临才手忙脚乱。这种"未雨绸缪"的能力,正是结构化程序知识的价值所在。

自进化的力量:从零开始,超越人类设计
论文中最令人兴奋的发现之一:程序图从最小骨架出发,通过自进化可以构建出匹配甚至超越人类专家手工设计的图。
在 MultiChallenge 任务中,人类专家手工设计的图一开始反而把成功率从 87.5% 拉低到了 58.93%——说明专家先验也可能有缺陷。但经过迭代进化后,程序图不仅修复了这些缺陷,还将成功率提升到了 92.86%,比专家初始版本高出 33.93 个百分点。
在 EnterpriseArena 上,自进化经过 10 轮迭代,将验证集上的存活率从 0% 提升到 90%。第一轮进化发现了"审计现金→预测跑道→融资决策"的顺序骨架,一举将存活率从 0 拉到 45%。后续轮次逐步优化细节、剪枝冗余分支。
这意味着:我们不再需要精心设计 Agent 的工作流程,让它自己从执行反馈中学就好。
写在最后
程序图的核心洞察很朴素:与其让 AI Agent 在每一步都"自由发挥",不如给它一张可以查询、可以修改的"施工图纸"。而这张图纸本身,也能从实践中不断进化。
这项工作对 AI Agent 领域的启示是深远的。未来的 Agent 可能不再依赖固定的提示词工程或手工编排的工作流,而是像程序图一样——在执行中学习,在失败中进化,在成功中沉淀。
当然,研究也指出了局限性:指导机制会增加 token 消耗(虽然减少了执行步数),跨求解器和跨工具的迁移能力还有待验证。但瑕不掩瑜,程序图为构建更可靠、更自主的 AI Agent 提供了一条切实可行的路径。
原文链接:Procedural Graphs: Self-Evolving Execution Structures for LLM Agents
作者:Yuxing Lu, Yicheng Chen, Shanchan Wu, Sercan Ö. Arık(Google / 佐治亚理工 / 北京大学)
觉得这篇文章有价值?点个赞和在看,让更多开发者看到!
欢迎在评论区分享你的想法。
欢迎转发给身边的朋友。
#AI Agent #程序图 #大语言模型 #自进化 #Google研究 #LLM #知识图谱 #人工智能