构建组织的 AI 第二大脑:打造可向专家学习的 Agent
- 我们打造了一款 AI 代理,作为特定领域的“第二专家”,让深层专业知识得以随时获取、共享和传承,供组织内任何人使用。
- 这不是典型的领域专用代理。其创新之处在于融合了两个层次:
- 这两个层次共同将一次性专家修正转化为永久且复利的机构记忆,该模式设计为可扩展到其他由可检索文本而非模型权重主导的领域。
- 该系统正在为 Meta 的领域主题专家(SME)节省大量时间,让他们能够更专注于其专业知识发挥最大价值的工作。
许多大型组织在专家知识方面面临同样的问题。虽然部分内容已以模型、操作手册、检查清单和框架的形式记录下来,但最有价值的专家知识仍存在于人们的头脑中,很少被持久捕获。以合规领域为例,数百次产品审查中可能反复出现同类问题,专家评估需耗费数天的人工研究,而评估之间的不一致会带来真实的组织风险。
专家花费大量时间回答常规问题、而非投入真正新颖且模糊、需要其判断力的工作,这种情况并不少见。我们需要系统能够捕获组织中专家的思考方式,并将这些知识提供给所有需要的人,从而使专业知识更易分享、复用和保存。
我们着手通过将机构智慧编码为特定合规领域的 AI 代理来解决这一挑战。该代理结合了充当组织“第二大脑”的知识系统、映射领域专家实际思考方式的推理层,以及能将专家努力永久复利的自动改进管道。该模式可泛化至任何拥有深层专业知识的企业主业领域,无论是金融、安全还是工程。
The Architecture at a Glance
开箱即用的 LLM 是很好的基础,但要在专业领域充分发挥作用,往往还需要更深入的组织内部背景。缺少这种基础,通用模型的价值就很有限——因为它无法区分“组织可以做什么”(对通用信息的总结)和“组织应该考虑做什么”(基于历史立场、公司方向、业务背景等)。在高风险领域,要弥合这一差距,就必须把组织自身的知识和优先级注入模型,让它分析问题的方式与组织实际的思考方式保持一致。
我们设计的系统分为四层,每层解决一个不同的问题:

这四层相互依存:知识系统的文件结构让自动化编辑成为可能;推理层的显式流程让故障归因变得可控;评估框架为每次变更把关;改进循环则同时反哺知识和推理两层。缺了任何一层,其余几层都会跟着退化。
构建组织第二大脑
大型组织在专家工作的过程中会积累成千上万份文档。把这些文档直接当作组织知识很诱人,但真正的知识是隐性的:专家如何推理、优先考虑什么、如何消除歧义。一个在推理时才检索文档片段的 agent,每次都要从原始材料重新推导这些思考过程,既慢又容易出错,结果还不稳定。
我们的做法是提前把隐性知识显性化。一个长期运行的离线流程会对源文档进行推理,并将其提炼成结构化的知识文件——以机器可读的形式,记录组织如何理解其所在领域,包括约束条件、适用边界和流程走向。
最重要的是,这些知识构成了反馈闭环的基础,让 agent 能够学习并落实人类专家的反馈,而无需重新训练底层模型。
业界已形成类似的共识。Andrej Karpathy 的 LLM Wiki将智能体知识构建成可导航的文件图,而 Google 的Open Knowledge Format则为跨智能体互操作标准化了这一结构。其共同洞见在于:知识应当预先提取、显式结构化,并逐步披露,而非每次查询时重新推导。我们将这些原则扩展至一个系统,其中引用保真度和机构一致性不容妥协,将 200 余个文件组织成严格的分类体系:- 立场文件记录组织的权威定调:即组织已决定如何解读某一领域问题,及其约束条件、边界情况和可机器执行的路由规则,告知推理层何时应应用这些内容。
- 分类与词汇文件充当该组织描述其领域所用术语的权威术语表,例如实体类型、活动类别和分类层级。每个文件均作为单一事实来源,以确保智能体与组织使用一致的语言。
- 路由索引将输入特征映射到相关的立场和程序,决定哪些文件适用,而不单纯依赖嵌入相似度。这使检索结果确定且可审计。
- 网关文件定义智能体在进入分析领域前必须通过的阈值测试,防止其在不适用的场景中使用专门知识。

按信息密度与使用频率组织知识
一个关键架构决策在于如何划分 wiki 精选库与补充检索(RAG)之间的知识边界。我们依据信息密度和预期使用频率进行分割。
高密度、常被引用的资料纳入 wiki:如提炼后的文档,记录组织的决策逻辑,包括立场、决策框架、边界示例和战略解读。智能体几乎在每个推理步骤中都会参考这些内容。由于它们承载着组织不断演化的思维,必须保持更新,而 wiki 的结构使得这些内容易于更新、版本控制和验证。
稀疏且仅在特定情境下相关的资料则通过语义或关键词搜索(RAG)提供服务:那些在适用时极其重要、但在大多数情况下无需详查的资料,例如详细参考资料、单个产品规格、历史决策记录和细分领域的外部知识。将所有这类资料加载进 wiki 会使系统臃肿,并稀释注意力。
结果是,智能体的核心推理始终基于最精炼、最新的组织知识,同时在场景需要时仍能获取支撑性证据。这种组合形成了一个“组织第二大脑”,它编码的是组织如何解读和应用信息,而不仅仅是信息存放在何处。
通过可组合的配方实现专家推理
仅有知识是不够的。领域专家并非简单地回忆事实,而是遵循结构化的方法论:财务分析师逐步执行估值模型,安全工程师按照威胁建模流程操作。挑战在于将这类方法论以 LLM 能够可靠执行的形式捕获下来。
我们用一种可组合的流程来解决这个问题,称之为 recipe(配方)。知识文件是声明式的,而 recipe 是指令式的。每条 recipe 规定了一个多步骤的分析工作流:先检查什么,每一步加载哪些知识,遵循怎样的决策程序,以及什么样的分析才算完整。
这里的关键设计是把 agent「知道什么」和「如何推理」分开。recipe 引用知识文件,但本身不包含任何领域事实;知识文件陈述立场,但不规定任何流程。这样做意味着:
- 新增一条组织立场,只需添加一个知识文件并更新路由索引,不用改任何 recipe。
- 修复 agent 方法论上的缺陷,只需编辑对应的 recipe,不用动任何知识文件。
- 出问题时能清晰定位到某一层:到底是知识错了,还是流程错了?
Recipe 可以组合成流水线,就像主厨的晚宴总配方会把工作委托给各个子配方(酱汁、主菜、配菜),而自身不包含这些细节。我们的顶层路由 recipe 负责审视输入,选择要调用哪些下游 recipe,每个下游 recipe 处理一个分析阶段。
这也是实现渐进式披露的关键。与其在开头就塞进一整套覆盖所有可能场景的庞杂指令,不如让每个 recipe 步骤只携带与该阶段相关的指令和知识。早期版本使用单个扁平的指令文件,并通过语义搜索加载所有来源,每次运行都会把大量相关性混杂的文件拉进上下文窗口。重构为 recipe 驱动的分阶段流程后,每次查询只触碰一小部分针对性内容,每轮消耗的 token 减少了约 80%。上下文窗口是有限的,注意力也会随信息量增加而下降,因此在恰当的时机提供恰当的指令,能直接提升推理质量。
让人始终掌握控制权
人类专家自始至终掌控着这套系统。agent 只是加速并规范他们的工作,而不是取代他们的判断,也不取代他们对结果的最终裁定权。
我们通过两个机制来落实这一点:
检查点(Checkpoint)是分析过程中预先定义的节点,agent 会在这些节点上把中间推理过程呈现给专家审阅,等待确认、纠正或调整方向后,才继续往下执行。
当智能体遇到真正的歧义时,就会触发升级机制——无论是输入信息不足,还是存在多种合理的解释。智能体不会强行给出答案,而是将问题转交专家,由专家的决定来引导分析方向。
检查点与升级机制同时承担三个功能:
- 质量与方向控制:专家能在错误累积前及时拦截,并确保分析始终沿着他们认定的最相关路径进行。
- 训练信号:每一条修正与每一次升级都会作为输入,进入自我改进循环。
- 信任校准:专家通过观察智能体的推理过程而非仅看最终输出,以及看到它主动标记不确定性而非掩盖,从而逐步建立信心。
决策越重大,这一点就越重要。因此我们建议在合规、金融风险评估、安全审查和工程安全等领域默认保留人类参与。
自我改进飞轮
我们认为,自我改进飞轮是这个系统最具特色的部分。结构化知识系统和可组合配方共同构建了一个人类与智能体均可理解、可测试且模块化的系统,但相互依赖的文件数量使得人工维护无法扩展。当领域专家向智能体提供反馈时,这些反馈需要被转化为精确的文件编辑操作。这个过程可能耗时数周,因为它要求理解完整的依赖图、验证其他内容未被破坏,并确认修复确实有效。
已有大量研究——从 RAG 记忆系统到模型权重知识编辑——致力于解决智能体如何存储、检索和更新知识。但鲜有关注随着文档型机构知识库的增长以及专家观点的演变,如何持续保持其正确性。自动起草修复方案的智能体日益常见,但我们尚未见到在未重新训练模型的前提下,将如此严谨的验证机制应用于结构化知识库的工作。
我们将此类维护视为编译问题并加以自动化。每一条专家修正都会经历四个阶段:
- 将专家反馈诊断为包含根因的可执行问题。
- 将问题编译为最小化且经验证的编辑。
- 验证修复方案有效且无回归。
- 请领域专家进行审查。
循环完成后,回归测试套件将纳入本次修复的问题,以确保后续更新能持续保留该行为。

诊断:将每条修正归因于根本原因
原始专家反馈来源于领域专家(SME)与智能体交互并提供修正的对话记录。诊断阶段从这些对话中提取结构化信号。
我们的第一种方法是按对话形式对反馈进行分类。如果专家提供了信息,就说明存在知识缺口;如果专家引导了智能体,就说明存在流程问题。这种启发式方法失败了,因为对话形式并不能很好地反映根本原因。专家对结论的纠正可能暴露的是知识缺口、流程缺陷,也可能是真实存在的歧义。
实际可行的方法是将提取与分类分离。首先,从专家处提取每一条实质性信号,同时获取智能体的完整知识清单(加载的每个文件、加载时间及其使用方式)。然后,阅读实际的知识文件,并应用单一归因测试:智能体能否根据其源材料得出正确结论?
- 如果材料中包含正确答案但智能体仍然出错:流程问题。
- 如果材料中不包含正确答案:知识缺口。
- 如果专家对正确答案本身存在分歧:歧义,标记为需人工讨论。
编译:手术式多智能体编辑
编译器将每条已诊断的问题转化为最小化的文件编辑。子智能体并行分析影响,考察交叉引用、与现有内容的冲突、token 预算影响、测试覆盖率和重复风险。
两项设计决策保障了可靠性:
独立的对抗性审查。另一个 agent 在全新的上下文中运行,完全不知道改进的理由,只拿到知识库的修改 diff,任务是找出各种问题:是否引入了矛盾、破坏了边界情况、或削弱了原有立场。由于它不与提出修改的 agent 共享任何上下文,因此不会继承它们的盲点。
确定性的结构校验。由 linter 以程序化方式检查问题:悬空的交叉引用、文件大小超限、标识符冲突、依赖循环等。这一层不靠概率判断——只有通过或不通过。
评估:证明修复有效
每个修改提案都要经过两阶段验证:
定向重放:让 agent 重新运行触发反馈的原始场景,但它不知道自己在被测试。由一个独立的评审模型对照最初的专家反馈评估新输出,同样不知道改动内容。这种刻意的盲测设计能避免确认偏误。如果定向重放失败,就重新编译。
回归测试:运行该领域的多个基准,通常是由问答对组成的结构化测试套件。对于可能存在多个正确答案的分析类领域,则由独立的 LLM 评审按一定标准对每个测试用例判定通过与否。agent 会在多个并行、独立的会话中回答基准问题,从而检测性能是否出现回归。如果回归测试失败,就重新编译,并在提示中加入更新说明,描述 agent 在哪里出现回归,同时附上原始问题和已尝试的修复方案。
合入与增强:复利效应
流水线的最终产出是一个附带完整审计记录的 pull request(diff)。人类专家面对的是一个已被验证有效的修复,而不是去调试一个原始的失败案例。一旦审批通过并合入(知识文件或 recipe 得到更新),最初失败的场景及其经过验证的正确答案会被自动添加进回归测试套件。这意味着每次修复都会永久抬高门槛,今后对知识系统的任何改动都必须保住刚修正的行为。
效果
经过六个星期、三个开发冲刺,系统达到了以下成果:
- 领域 SME 几乎对 agent 输出的每次结果都评价为有用,相比早期版本输出经常需要大幅返工的情况,是显著的改进。
- 个体评估时间从几天缩短至几分钟。
- 自动化自我改进,以前需要完整工程冲刺周期才能产出的有效知识修订,现在得以自动批量生成。
- 在各次改进周期中零回退,每项修复均自动强化回归测试套件。
- 领域专家一致反馈,该智能体承担了绝大部分分析工作,使他们能够专注于真正模棱两可、需人工判断的案例。
应用此架构
我们构建该系统的特定领域,需要将数十个来源(包括内部立场文件和外部资料)综合为风险加权评估。但该架构与领域无关,凡满足以下条件均可应用:
- 专家头脑中存在难以文档化的部落知识。
- 评估一致性至关重要。
- 工作量超过可用专家容量。
- 现成 LLM 的分析能力不足。
适用该模式的典型领域包括监管合规、协议遵循、金融风险评估、安全审查、工程标准合规以及采购评估。这些领域的共同点是:组织需要的是具备真正机构专业知识的 AI 系统,而非仅拥有通用知识的模型。
采用此架构需满足以下要求:
- 具备明确文件边界、交叉引用和依赖图的结构性知识系统(即该领域的组织第二大脑)。
- 将领域知识与分析方法论(菜谱)分离的过程层。
- 随每次改进周期不断扩展的自动化评估套件。
- 针对领域风险容忍度校准的人机协同检查点。
其核心原则很直接:将复杂性保留在人类与智能体均可阅读的文本文档中,而非嵌入微调模型权重。每一次改进都是一次文本编辑,领域专家可在 30 秒内完成审查;每次变更均可版本控制、对比差异且可回滚。编译流水线虽复杂,但其输出始终透明。
致谢
作者感谢以下为本系统开发做出重要贡献的人士。特别感谢(按姓氏字母顺序):Cecilia Baek、Philipp Kaufold、Cat Hughes、Suzanne Leijten、Michael Marcusa、Jordi Mola、Timothy Neo、Elliott Prentiss、Laia Reyes、John Ross、Julio Santil、Taylor Wilson Thomas、Mansi Tripathi、Nikhil Shanbhag、Madeleine Vos 和 Jackie Zajac。