AI 根因分析从模型推理转向上下文工程
可观测性工程师中有越来越多的人认为,大语言模型的推理能力已经不再是 AI 辅助根因分析的瓶颈。当前更棘手的问题在于决定哪些数据能传入模型的处理流程。
对于将大语言模型应用于事件响应的团队而言,他们从实践中得出的一个启示是:投入精力准备上下文信息,其回报可能比追求更强大的模型更为可观。
大多数 AI 根因分析(RCA)工作可以分为两大类。基于代理的设计会向模型提供工具,让其自行展开调查,并在推理过程中自主选择要获取哪些遥测数据。确定性设计则会在前期就建立起信号间的关联,并向模型提供一个预先准备好的上下文。Coroot 的工作反映出,业界普遍正朝着第二种范式转变:Dynatrace 的 Davis AI 也是依赖于确定性的、基于拓扑结构的因果分析,通过遍历实时依赖关系图来精准定位根本原因,而非让大语言模型(LLM)在开放式的代理循环中自由运行。这两种方法的故障表现形式各不相同,这使得难以判断诊断失败是源于推理能力不足,还是源于向模型提供了错误证据的治理框架。
可观测性供应商 Coroot 的最新研究试图将这两个变量区分开来。在其原创研究中,工程师 Nikolay Sivko 将借助大语言模型(LLM)进行根因分析(RCA)的过程拆分为两项任务:对当前呈现的数据进行推理,以及决定哪些数据以何种形式传入模型的“数据采集框架”。他认为,“AI 能否进行根因分析?”这个问题本身就是错误的,因为这两项任务需要分别进行评估。
Coroot 的处理流程将信号关联成调查结果,并在不涉及代理循环的情况下,以单一聚焦的上下文形式将这些结果传递给大模型,这样就可以将错误答案归因于模型本身,而非证据缺失。为了验证这一机制,Sivko 构建了一个场景:通过 Chaos Mesh NetworkChaos 实验在目录服务与其 Postgres 数据库之间注入延迟,从而减慢查询速度并导致前端出现 502 错误。该场景特意包含了一些误导性信号,例如因网络往返时间而被夸大的查询时长。随后,他向十一款模型输入了相同的提示(约 9800 个令牌),要求每款模型分别给出根本原因、因果链以及即时修复方案。
前沿专有模型 Claude Opus 4.8、GPT-5.5 和 Gemini 3.1 Pro 均通过了测试,不仅给出了实验名称,还指出需要删除该实验及其定时任务。更大的开放权重模型大多表现不俗。小一点的模型,Gemma 4 31B 是唯一能识别根本原因的自托管模型,而更大的 Qwen3.6 35B 和 Qwen3 Coder Next 均未能识别出根本原因。
这些研究结果并未平息相关的争议。基于代理的方法仍然有其独特的优势,因为能够自主获取数据的模型可以捕捉到固定处理管道从未预料到的信号,对于预定义相关性集合之外的新型事件,这至关重要。不过,这种灵活性是以可操作性为代价的。ZenML 和 Incident.io 的案例表明,在生产环境中,使用多代理大语言模型(LLM)进行调查向来以难以调试而闻名,因为运行失败时不会留下清晰的调用堆栈,只有不可预测的提示词交互以及代理之间自发形成的协调。这种脆弱性促使许多从业者转向了另一种方案:在 Reddit 上讨论权衡取舍的工程师们表示,他们放弃了完全基于代理的设计,转而采用一个小范围为 LLM 步骤、主要为确定性的工作流,理由是可靠性更高且 Token 成本更低。确定性管道以部分灵活性为代价,换取了可重复性和更清晰的评估,这也正是业界越来越将治理框架(而非模型本身)视为 AI 根因分析(RCA)中最困难部分的主要原因。
关于成本,Sivko 指出,即使在前沿的模型上,单次简短的调用也只需要几美分,因为相关性分析工作是在调用模型之前就完成了的。他认为,AI RCA 的推理部分“基本上已经解决”,而当前的重点工作在于“在调用模型之前为其准备好正确且紧凑的上下文”。这一结论表明,下一轮的工程努力应聚焦于治理框架而非模型本身。这种观点契合业界当前围绕上下文工程推动相关工作的广泛趋势。 Anthropic 、 LangChain 以及可观测性供应商 Mezmo 提供的指导意见均指向同一个核心理念:对于基于大语言模型(LLM)的推理和可观测性,精心筛选出信号强度高且紧凑的最小上下文集合,现在已经成为确保其可靠性的核心原则。
原文链接:https://www.infoq.com/news/2026/07/ai-rca-context-engineering/