← 文章 / AI技术
银翼AI评测室 1小时前 · 2026-10-03 09:17:50 · 7 阅读

把AIAgent比作一个人,终于把智能体架构讲明白了

智能体科普 · 方法论连载 04

把 AI Agent 比作一个人,
终于把智能体架构讲明白了

你大概每天都能刷到 "AI Agent"、"智能体":帮你订机票的、写周报的、自动剪片的。可要是追问一句——它里面到底有什么?——LLM、RAG、Planner、Runtime,一堆词砸过来,瞬间劝退。

别背术语。把它当成一个活人看,一遍就懂。

先记住这句:LLM 只是大脑皮层。没有骨架、感官、手脚和免疫系统,它就只是个会聊天的「植物人」。

01全景:Agent 就是一个「数字人」🧍


传统软件像机器:零件坏了修零件,逻辑写死在代码里。AI Agent 更像活人——会想、会看、会记、会动手,当然,也会生病。

图:Agent 的「人体架构」全景——每个组件,都对应一个人体器官。

对照着看:

大脑皮层 = LLM:负责想。GPT、Claude、豆包都在这层。

前额叶 = Planner 规划器:负责排步骤,"先查天气、再订酒店、最后排行程"。

海马体 = Memory 记忆:短期记这轮对话,长期存你的偏好。

眼睛 = Perception 感知:读你打的字、传的文档、发的图。

嘴巴 = Output 输出:说人话、给表格、写代码。

双手 = Tool 工具:真正去做——调接口、跑代码、查资料。

脊椎 = Runtime 运行时:撑起整个循环,调度、超时、重试全靠它。

神经 = Data Bus 数据流:模块之间传信号。

免疫 = Safety 护栏:防诈骗、防注入、控权限。

胃 = RAG 管线:把文档清洗、切碎、消化成能检索的知识。

记住这张图,下面挑最容易误解的三处展开。

专业视角:这套"器官",工程上有个正式名字——Agent Scaffold(脚手架)。业界的标准定义:Agent 是以 LLM 为核心控制器,能感知环境、自主规划、调用工具、闭环执行任务的软件系统。LLM 提供"认知",脚手架提供"行动",两者缺一不可。

02大脑特写:想、排、记,是三个器官 🧠


很多人以为 Agent 的脑子就是一个大模型。其实大脑里至少住着三个角色:

大脑皮层(LLM):你问什么,它想什么。

前额叶(Planner):把"帮我策划一次亲子游"拆成四步,安排先后顺序。

海马体(Memory):记着"用户带 8 岁小孩、喜欢轻松路线",下次直接用。

说一个内行才看得出的细节:市面上不少所谓 Agent 的"规划",只是把"请一步一步思考"写进提示词,让模型自己想——那不是独立的前额叶,只是大脑皮层多想了一步。任务一复杂,就会露馅。

专业视角:LLM 的本质是基于 Transformer 架构的自回归模型,一个 token 一个 token 地"接龙"生成文本——temperature 控制随机性,top_p 控制候选范围。海马体的短期记忆就是上下文窗口(Context Window),容量按 token 计数,超了就遗忘;长期记忆通常用向量数据库实现:文本先经 Embedding 模型转成高维向量,检索时按相似度召回。规划的主流实现是 ReAct、Plan-and-Solve 等范式,本质都是"先拆解、再逐步执行、边执行边修正"。

03眼睛、嘴巴和双手:聊天机器人只能"说",Agent 能"做" 👀✋


聊天机器人只用了三个器官:眼睛听你说,大脑想一下,嘴巴答上来。所以它永远停在"说"。

Agent 多了一双手。你问:"成都今天天气怎么样?适合户外的话,推荐 3 条周边徒步路线,整理成出行指南。"它会:

① 调天气接口 → 查到 25°C、晴;

② 翻长期记忆 → 记得你带小孩、要轻松;

③ 从路线知识库里检索 → 筛掉要虐爬的赵公山和太远的西岭雪山;

④ 免疫系统做最后一道安检 → 通过,才输出指南。

中间每一步都在重复同一个循环:想一想 → 动动手 → 看结果 → 再想。这个循环叫 ReAct——它就是 Agent 和聊天机器人的分水岭。

专业视角:双手的机制叫 Function Calling:LLM 从不直接执行任何操作,它只输出一段结构化 JSON(工具名 + 参数),由 Runtime 校验后执行,再把结果拼回上下文供下一轮推理。所以每只"手"都配有一份"说明书"(工具描述 + 参数 Schema)——说明书写得清不清楚,直接决定调用成功率,这也是工具层最常见的故障源。ReAct 即 Reasoning + Acting,推理与行动交替进行。

04骨架、免疫和胃:让它活下来、跑起来、不生病 🦴


还有三个"看不见的器官",决定 Agent 是玩具还是产品:

脊椎(Runtime):没有它,Agent 走两步就瘫——死循环停不下来、出错不会重试,都是脊椎的问题。

免疫(Safety):人会被骗,Agent 也会。有人把恶意指令藏进文件名,Agent 读到就照做——免疫瘫痪,越权操作就来了。

胃(RAG):胃不好,吃进去的知识就吐出错的。引错资料、胡说八道,多半是胃的锅,不一定是脑子笨。

专业视角:免疫要防的核心攻击是提示注入(Prompt Injection)——把恶意指令伪装成正常内容骗过模型,防御组合拳是输入过滤 + 权限最小化(RBAC)+ 输出审核。胃的正式名字是检索增强生成(Retrieval-Augmented Generation,RAG):先检索、后生成,相当于让模型"开卷考试";分块(Chunking)的粒度、检索后的重排序(Rerank),是决定"开卷成绩"的两个关键旋钮。脊椎(Runtime)工程上对应状态机与工作流引擎,负责把"死循环熔断、失败重试、断点恢复"做成确定性代码——确定性的事不能交给概率性的大脑。

05Agent「看病」指南 🩺


理解了器官,排查问题就有了章法:症状对应器官,先找位置,再开药。

症状病灶常见处方
答非所问、理解偏差大脑(LLM)换更强模型 / 调提示词
工具调用报错、参数错手(工具层)修工具描述 / 加参数校验
任务拆错、步骤混乱前额叶(Planner)改规划策略 / 加约束
循环停不下来脊椎(Runtime)加最大步数 / 超时熔断
引错知识、胡说八道胃(RAG)更新知识库 / 调检索
被注入、越权操作免疫(Safety)输入过滤 / 权限白名单

(还有完整版:忘了说过的话→海马体、输出格式乱→嘴巴、看不懂图→眼睛……原理相同,对症下药。)

06写在最后


三条结论带走:

1. Agent 不是一个模型,是一套身体。LLM 只是大脑皮层,缺了其他器官,它什么也做不成。

2. 80% 的问题不用改代码。修复优先级:调提示词/数据 → 改工具/检索 → 改代码 → 换模型。一上来就嚷嚷微调的,多半是没找准器官。

3. 人是概率性的。同一个问题,Agent 这次对、下次可能错。所以别追求 100% 正确,要降低出错率——而且要有一套评测体系,批量地测它。这也是我们每天在做的事。

专业视角:概率性来自 LLM 的生成机制——逐 token 采样,天然带随机性,同样的输入也能得到不同的输出。所以 Agent 的质量不是一个定值,而是一个分布:工程上的做法是用固定用例集批量跑、统计成功率和失败模式(即评测/benchmark),而不是写一条"输出必须等于预期"的断言。传统软件的单元测试思维,在这里从根上就不适用。

你最想让 Agent 先长好哪个器官?评论区聊聊。如果这篇让你看懂了,点赞、转发给那个还在背术语的朋友。

Agent 不是一个模型,
而是一套「身体」。

银翼 AI 评测室 · 方法论连载 04

愿所有 Agent 都经得起 Voight-Kampff 测试。

原始来源: 银翼AI评测室

评论 (0)