把AIAgent比作一个人,终于把智能体架构讲明白了
智能体科普 · 方法论连载 04
把 AI Agent 比作一个人,
终于把智能体架构讲明白了
你大概每天都能刷到 "AI Agent"、"智能体":帮你订机票的、写周报的、自动剪片的。可要是追问一句——它里面到底有什么?——LLM、RAG、Planner、Runtime,一堆词砸过来,瞬间劝退。
别背术语。把它当成一个活人看,一遍就懂。
先记住这句:LLM 只是大脑皮层。没有骨架、感官、手脚和免疫系统,它就只是个会聊天的「植物人」。
01全景:Agent 就是一个「数字人」🧍
传统软件像机器:零件坏了修零件,逻辑写死在代码里。AI Agent 更像活人——会想、会看、会记、会动手,当然,也会生病。
图:Agent 的「人体架构」全景——每个组件,都对应一个人体器官。
对照着看:
大脑皮层 = LLM:负责想。GPT、Claude、豆包都在这层。
前额叶 = Planner 规划器:负责排步骤,"先查天气、再订酒店、最后排行程"。
海马体 = Memory 记忆:短期记这轮对话,长期存你的偏好。
眼睛 = Perception 感知:读你打的字、传的文档、发的图。
嘴巴 = Output 输出:说人话、给表格、写代码。
双手 = Tool 工具:真正去做——调接口、跑代码、查资料。
脊椎 = Runtime 运行时:撑起整个循环,调度、超时、重试全靠它。
神经 = Data Bus 数据流:模块之间传信号。
免疫 = Safety 护栏:防诈骗、防注入、控权限。
胃 = RAG 管线:把文档清洗、切碎、消化成能检索的知识。
记住这张图,下面挑最容易误解的三处展开。
专业视角:这套"器官",工程上有个正式名字——Agent Scaffold(脚手架)。业界的标准定义:Agent 是以 LLM 为核心控制器,能感知环境、自主规划、调用工具、闭环执行任务的软件系统。LLM 提供"认知",脚手架提供"行动",两者缺一不可。
02大脑特写:想、排、记,是三个器官 🧠
很多人以为 Agent 的脑子就是一个大模型。其实大脑里至少住着三个角色:
大脑皮层(LLM):你问什么,它想什么。
前额叶(Planner):把"帮我策划一次亲子游"拆成四步,安排先后顺序。
海马体(Memory):记着"用户带 8 岁小孩、喜欢轻松路线",下次直接用。
说一个内行才看得出的细节:市面上不少所谓 Agent 的"规划",只是把"请一步一步思考"写进提示词,让模型自己想——那不是独立的前额叶,只是大脑皮层多想了一步。任务一复杂,就会露馅。
专业视角:LLM 的本质是基于 Transformer 架构的自回归模型,一个 token 一个 token 地"接龙"生成文本——temperature 控制随机性,top_p 控制候选范围。海马体的短期记忆就是上下文窗口(Context Window),容量按 token 计数,超了就遗忘;长期记忆通常用向量数据库实现:文本先经 Embedding 模型转成高维向量,检索时按相似度召回。规划的主流实现是 ReAct、Plan-and-Solve 等范式,本质都是"先拆解、再逐步执行、边执行边修正"。
03眼睛、嘴巴和双手:聊天机器人只能"说",Agent 能"做" 👀✋
聊天机器人只用了三个器官:眼睛听你说,大脑想一下,嘴巴答上来。所以它永远停在"说"。
Agent 多了一双手。你问:"成都今天天气怎么样?适合户外的话,推荐 3 条周边徒步路线,整理成出行指南。"它会:
① 调天气接口 → 查到 25°C、晴;
② 翻长期记忆 → 记得你带小孩、要轻松;
③ 从路线知识库里检索 → 筛掉要虐爬的赵公山和太远的西岭雪山;
④ 免疫系统做最后一道安检 → 通过,才输出指南。
中间每一步都在重复同一个循环:想一想 → 动动手 → 看结果 → 再想。这个循环叫 ReAct——它就是 Agent 和聊天机器人的分水岭。
专业视角:双手的机制叫 Function Calling:LLM 从不直接执行任何操作,它只输出一段结构化 JSON(工具名 + 参数),由 Runtime 校验后执行,再把结果拼回上下文供下一轮推理。所以每只"手"都配有一份"说明书"(工具描述 + 参数 Schema)——说明书写得清不清楚,直接决定调用成功率,这也是工具层最常见的故障源。ReAct 即 Reasoning + Acting,推理与行动交替进行。
04骨架、免疫和胃:让它活下来、跑起来、不生病 🦴
还有三个"看不见的器官",决定 Agent 是玩具还是产品:
脊椎(Runtime):没有它,Agent 走两步就瘫——死循环停不下来、出错不会重试,都是脊椎的问题。
免疫(Safety):人会被骗,Agent 也会。有人把恶意指令藏进文件名,Agent 读到就照做——免疫瘫痪,越权操作就来了。
胃(RAG):胃不好,吃进去的知识就吐出错的。引错资料、胡说八道,多半是胃的锅,不一定是脑子笨。
专业视角:免疫要防的核心攻击是提示注入(Prompt Injection)——把恶意指令伪装成正常内容骗过模型,防御组合拳是输入过滤 + 权限最小化(RBAC)+ 输出审核。胃的正式名字是检索增强生成(Retrieval-Augmented Generation,RAG):先检索、后生成,相当于让模型"开卷考试";分块(Chunking)的粒度、检索后的重排序(Rerank),是决定"开卷成绩"的两个关键旋钮。脊椎(Runtime)工程上对应状态机与工作流引擎,负责把"死循环熔断、失败重试、断点恢复"做成确定性代码——确定性的事不能交给概率性的大脑。
05Agent「看病」指南 🩺
理解了器官,排查问题就有了章法:症状对应器官,先找位置,再开药。
| 症状 | 病灶 | 常见处方 |
|---|---|---|
| 答非所问、理解偏差 | 大脑(LLM) | 换更强模型 / 调提示词 |
| 工具调用报错、参数错 | 手(工具层) | 修工具描述 / 加参数校验 |
| 任务拆错、步骤混乱 | 前额叶(Planner) | 改规划策略 / 加约束 |
| 循环停不下来 | 脊椎(Runtime) | 加最大步数 / 超时熔断 |
| 引错知识、胡说八道 | 胃(RAG) | 更新知识库 / 调检索 |
| 被注入、越权操作 | 免疫(Safety) | 输入过滤 / 权限白名单 |
(还有完整版:忘了说过的话→海马体、输出格式乱→嘴巴、看不懂图→眼睛……原理相同,对症下药。)
06写在最后
三条结论带走:
1. Agent 不是一个模型,是一套身体。LLM 只是大脑皮层,缺了其他器官,它什么也做不成。
2. 80% 的问题不用改代码。修复优先级:调提示词/数据 → 改工具/检索 → 改代码 → 换模型。一上来就嚷嚷微调的,多半是没找准器官。
3. 人是概率性的。同一个问题,Agent 这次对、下次可能错。所以别追求 100% 正确,要降低出错率——而且要有一套评测体系,批量地测它。这也是我们每天在做的事。
专业视角:概率性来自 LLM 的生成机制——逐 token 采样,天然带随机性,同样的输入也能得到不同的输出。所以 Agent 的质量不是一个定值,而是一个分布:工程上的做法是用固定用例集批量跑、统计成功率和失败模式(即评测/benchmark),而不是写一条"输出必须等于预期"的断言。传统软件的单元测试思维,在这里从根上就不适用。
你最想让 Agent 先长好哪个器官?评论区聊聊。如果这篇让你看懂了,点赞、转发给那个还在背术语的朋友。
Agent 不是一个模型,
而是一套「身体」。

银翼 AI 评测室 · 方法论连载 04
愿所有 Agent 都经得起 Voight-Kampff 测试。