← 文章 / AI技术
The Batch 5小时前 · 2026-09-09 00:55:02 · 5 阅读

GLM-5.3新突破、AI模型与硬件提速、DeepSeek新Agent框架

各位朋友,

Agentic coding 如何改变了软件工程的基础要求?即使你用 coding agent 来写所有代码,理解软件基础依然至关重要——你得知道该在哪些地方引导 agent 做取舍,甚至要先搞清楚有哪些取舍需要做。此外,构建 AI 应用时,AI 核心往往要嵌入一个更大的软件系统中,而这就需要熟练的工程师来把控。

不懂软件基础的新手靠 vibe coding 也能做出简单应用,但 coding agent 往往会在延迟、可用性、一致性、可靠性、可维护性、简洁性或成本等方面做出糟糕的取舍。多数情况下,开发者根本不知道这些取舍的存在,自然也就无法引导 agent 根据具体应用场景做出正确决策。

本期通讯基于我们对 AI 工程技能的调研,梳理出软件工程中最重要的知识点。具体而言,需要掌握以下能力:

  • 全栈应用开发
  • 数据管理
  • 系统架构设计
  • 保障系统安全与可靠
  • 生产环境的扩展与运维

全栈应用开发。Agentic coding 让许多原本只专注于某一方向(如前端或移动端)的开发者能够胜任更宽的全栈角色。Coding agent 可以帮你搞定那些不太熟悉的环节,但理解整个技术栈如何运作仍然是关键。熟练的开发者需要理解前端和后端系统的核心组件与概念,包括 UI 组件、缓存、页面渲染、API 选型与设计、认证、状态与会话管理、异步处理、数据持久化、测试、安全和无障碍访问。

数据管理。数据值得格外关注,因为它是软件的基石,且相对难以变更(即便有 Agent 辅助迁移)。掌握数据管理,你就能分析访问模式,据此决定存储什么、存多久;能选对数据模型和存储类型(如关系表、文档、键值、图)及相应基础设施,而这些选择会直接影响速度、可扩展性、可用性、可靠性和成本。你还能理解事务与并发,确保数据干净、一致、新鲜。需要时,你还能做好隐私保护、治理与合规。你了解如何管理数据生命周期。

随着应用演进,你也知道如何让数据架构随之演进。数据管理决策需要大量人为提供的上下文。你的 AI 系统会从数据源获取输入上下文,如果数据架构选得不好,AI 就不知道自己不知道什么。正因如此,需要一位既具备相关领域背景、又精通 AI 工程的人——也就是你——来做出正确判断。如何为 Agent 构建数据基础设施(而非仅面向传统软件或人类用户),也是一个快速演进的领域,你需要随着领域发展持续调整最佳实践。

AI 工程技能图谱中的软件工程基础:构建全栈应用、管理数据、设计系统架构、保障系统安全可靠、以及规模化与生产运维

设计系统架构。当你理解了软件和数据全栈的主要组件之后,就能更好地决定如何把它们组装起来。做好系统设计,需要先弄清软件的目标(有多少用户?延迟有多重要?成本有多重要?等等),然后才能在应用平台、前后端边界、系统拆分、应用状态存放位置、架构粒度(单体 vs. 微服务)等方面做出选择。你还要选技术栈(编程语言、运行时、组件/前端/后端框架、数据技术)——有时需要先跑一些实验来评估不同方案,再最终敲定。

此外,"正确的架构"是一个动态目标,取决于项目所处的阶段。为快速搭建原型而选的简单架构,未必适合构建第一套生产系统;而随着应用规模扩大,架构也可能需要继续调整。要做这些决策,你必须对软件组件和应用场景都有深入的技术理解,才能设计出——并持续演进——一个权衡更合理的架构。

构建安全可靠的系统。打造可靠的系统,需要掌握测试策略的制定方法,以验证系统正确性:单元测试与集成测试如何搭配、选用什么框架、覆盖率做到什么程度。你还需要围绕可能的故障做设计——如何处理故障(比如 API 触发速率限制)、实现优雅降级、将故障影响范围压到最小。此外,"安全左移"运动正在把安全工作提前到生命周期更早的阶段(在传统项目时间线上更靠左),而非先写完代码再考虑安全。就像越来越多开发者在向全栈方向靠拢一样,如今许多开发者也同时扮演起安全工程师的角色。现在你可以借助 AI 工具扫描代码漏洞、排查依赖中的供应链注入风险、审查云配置的攻击面。但要真正做到位,仍然需要具备一定的安全知识。

生产环境的扩展与运维。要真正服务用户,必须掌握将软件部署到生产环境的方法。理解软件开发生命周期(SDLC)的全流程同样关键——除了编码和测试,还包括配置部署环境、制定发布策略、落地 CI/CD 自动化,以及理解 IaaS。

生产运维需要落地可观测性工具、配置告警、管理事故。要实现应用扩展,你得理解真实负载,掌握服务器扩容、负载均衡,并通过分片、索引、复制等手段调整数据基础设施,必要时做架构变更,让系统能从容应对规模增长。此外,掌握版本控制、代码评审、依赖维护、技术债管理等编码最佳实践,有助于系统随时间持续演进。

编码 Agent 改变了我们构建软件的方式,哪怕目标软件本身不含任何 AI 组件。一些编码知识——比如死记语法——正在变得过时。但对软件运行机理有深入理解的开发者,远胜于那些只会 vibe coding、对原理一知半解的人。

除了 AI 知识,掌握软件基础原理也能帮你判断软件能做什么、不能做什么。这些认知会直接影响你使用 coding agents 的方式和构建策略。接下来的两封信中我会展开讨论。

继续构建!

Andrew

来自 DEEPLEARNING.AI 的消息

New AI course by Oracle and DeepLearning.AI focuses on building adaptive coding agents that learn from experience.

构建能从经验中持续学习的 coding agents。在"Building Adaptive AI Agents"课程中,你将把 agent 自身的运行轨迹转化为可复用技能,并构建代码知识图谱来捕捉关键词搜索的盲区,让 agent 每次运行都比上次更强,而不是重蹈覆辙。免费报名

资讯

GLM-5.3 leads in benchmarks with high scores, compared to Kimi K3 and others, showcasing model improvements.

GLM-5.3 在网络安全领域取得新进展

Z.ai 最新旗舰模型在 Artificial Analysis 的智力基准综合指数上,与开源权重榜首 Kimi K3 基本持平。公司透露,该模型在发现和利用软件漏洞方面的能力显著提升,因此开放权重前需先完成安全测试。

新变化:Z.ai 仅通过对前代模型 GLM-5.2 进行微调,便提升了 GLM-5.3 在编码和 agentic 任务上的表现,而非从头训练新模型或改动架构。

  • 输入/输出:文本输入(最长 100 万 tokens),文本输出(最长 128,000 tokens,生成速度 90 tokens/秒)
  • 架构:MoE Transformer,总参数 7530 亿,每 token 激活 400 亿
  • 功能:可调节推理深度(low/high/max)、工具调用、结构化输出、流式生成、上下文缓存
  • 性能:在 Artificial Analysis Intelligence Index 上取得 60 分;在 Z.ai 的测试中,于 CyberGym(漏洞利用检测基准)上所有模型中得分最高
  • 可用性与价格:GLM Coding Plan 订阅(每月 18 美元至 168 美元)和 ZCode 开发环境,Z.ai API 定价为每百万输入/缓存/输出 token 1.40 美元/0.26 美元/4.40 美元
  • 权重与许可:权重预计在发布约两周后开放,许可协议尚未公布(GLM-5.2 采用 MIT 许可证)
  • 未披露:知识截止时间、GLM-5.3 的具体训练数据

工作原理:智谱在 GLM-5.2 微调配方的基础上进行扩展,将其应用于规模更大、类型更丰富的环境(即模型尝试完成指定任务的模拟工作区)。这套配方包含单次异步优化——一种强化学习方法,模型每次只处理一个尝试结果,而不用等整个批次完成。训练方法还会把智能体尝试过程的冗长记录切分成压缩后的片段,让模型能够从长时间运行的任务中学习,而不只是应对短任务。

  • 智谱在设计编程类训练任务时,刻意模拟真实的长期软件工程工作,而不是干净独立的谜题。比如其中一项任务:给模型一个机器学习工程师的工作环境,要求找出训练流水线变慢的原因,然后优化流水线,并证明提速有效且没有影响输出质量。
  • 训练所需的环境数量远超开发团队的自建能力,因此公司用智能体来搭建环境,部分任务的奖励信号也由智能体生成。
  • 一个独立的评分智能体先检查每个任务在对应环境中是否可解,再对模型表现打分。智谱构建评分器时不向它展示任务的参考答案。只有当评分器既能正确接受正确解,又能正确拒绝未动过或未完成的解时,其判定才算有效。
  • 公司还研究并试图防范模型的 reward hacking 行为——即模型钻空子、不真正完成任务也能赚取奖励的漏洞。

性能表现:第三方测试显示,GLM-5.3 与顶级开源权重模型不相上下,比领先的闭源模型略低几分,在智能体任务上提升明显。Z.ai 自家测试则显示,进步最大的是智能体编程和网络安全领域。

  • 在 Artificial Analysis 的智能指数(综合九项经济价值任务的评测)上,GLM-5.3 以 max reasoning 模式(60 分,每项任务 $0.68)追平 Kimi K3(每项 $0.84),较 GLM-5.2 的 max reasoning 模式(每项 $0.44)提升 7 分。不过它仍落后于闭源头部模型:Claude Opus 5 max reasoning(63 分,每项 $2.34)、GPT-5.6 Sol max reasoning(61 分,每项 $0.96–$1.23)、Grok 4.6 high reasoning(61 分,每项 $0.84)。
  • 在 Z.ai 的网络安全测试中,GLM-5.3 在 CyberGym(通过触发错误来定位并确认源代码中的漏洞)上取得 84.5%,为该基准的最高分,领先 Claude Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)。在 ExploitBench(测试对加固软件的利用尝试)上,GLM-5.3 达到 54.4%,是 GLM-5.2(24.4%)的两倍多,也超过 Kimi K3(32.2%),但远逊于 Claude Mythos 5(78.0%)和 GPT-5.6 Sol(76.5%)。
  • GLM-5.3 的通识表现相对平庸:Humanity's Last Exam 正确率仅 42.3%(落后于早期 Grok 和 Claude Opus 模型),GPQA Diamond 解题率 91.72%(低于中等算力配置下的 Gemini 3.7 Flash),AA-Omniscience 准确率仅 34%,远低于其他头部模型。
  • 在 Z.ai 自建的 Code Bench(按完成率和逐步准确率评分的编码基准)上,GLM-5.3 以 max reasoning 模式完成了 34.5% 的任务,平均每任务约 75,000 个输出 token,领先 Claude Opus 4.8 max reasoning(29.5%,每任务 120,000 token),但落后于 Claude Fable 5 max reasoning(39.5%,每任务 57,000 token)。

Z.ai 的低调发布:本周 Z.ai 证实,此前在 OpenRouter 等平台上迅速走红的神秘多模态模型 Ox Alpha,正是 GLM-5.3 Flash。Z.ai 以 MIT 协议发布了这款 3200 亿参数模型的权重文件

新闻背后:GLM-5.3 的登场恰逢业界就"具备高级网络安全能力的开放权重模型是否过于危险、不宜发布"展开激辩,它的表现让争论双方都有了新的论据。

  • Z.ai 选择了临时性防护方案,而非 OpenAI 和 Anthropic 采用的永久机制——后两者要求机构必须注册才能使用其具备最强安全漏洞利用能力的模型。Z.ai 则公开了模型在 CyberGym 和 ExploitBench 上的评分,并决定在与经过审核的安全合作伙伴完成两周的安全评估后,才正式发布模型权重。
  • GLM-5.3 的发布引发了竞争对手的直接回应。8月17日,OpenAI 总裁 Greg Brockman 在一篇博文中警告,网络安全能力达到或接近前沿水平的开放权重模型"极有可能显著加速威胁态势的演变",并附上了 GLM-5.3 的发布页链接。而就在数周前,OpenAI 自家的评估智能体已突破 ExploitGym 环境、入侵了 Hugging Face 的基础设施,Brockman 的警告紧随其后。
  • 对其他开放权重模型的初步测试表明,恐慌可能大过了实际威胁。7月,美国和英国的 AI 安全研究机构联合评估了 Kimi K3,发现它在 ExploitBench 的全部 41 项任务中均未执行任意代码——这是最严重的攻击结果。相比之下,能力最强的专有模型在关闭安全防护后,平均执行了 20 次任意代码。

为何重要: Z.ai 最初的目标是打造更强的智能体编程工具,结果意外收获了一个在发现安全漏洞方面能力极强的模型。公司刻意在训练数据中加入了网络安全缺陷场景,并在模型发现漏洞时给予正向奖励。如预期那样,随着训练规模扩大,这项能力持续提升,在 CyberBench 上超越所有其他模型。但问题在于,模型在"构建漏洞利用"方面的进步超出了设计者仅用于"发现漏洞"的初衷。公司并未打算让 GLM-5.3 在 ExploitBench 上的得分超过前代两倍;模型只是不断追逐"利用漏洞"这一可得奖励,能力就水涨船高了。

我们的思考: Z.ai 的每次新发布都比上一次更强、更受关注。各大 AI 实验室之间的竞争让所有用户受益,尤其是当它们开放模型权重、供大家研究、修改并在自己的硬件上运行时。期待更多新模型问世!


柱状图对比 GPT-5.6 Sol Ultrafast 与 Sol,突出处理任务时的速度差异。

AI 竞速时代的内在逻辑

已经在关注模型成本和准确性的开发者,现在又多了一个必须重视的关键因素:速度。

最新动态:OpenAI 与 Cerebras 预览了 Ultrafast——一项新的 API 服务层级,让 GPT-5.6 Sol 跑在 Cerebras 硬件上,而不是 OpenAI 自己的基础设施。

  • 吞吐量:Ultrafast 宣称最高每秒输出 750 个 token。Artificial Analysis 测得 GPT-5.6 Sol 在 OpenAI 官方 API 上以最大推理强度运行时只有每秒 65 个 token,照此计算 Ultrafast 快了约 11 倍。
  • 完成时间:在六项质量相当的 GDPVal 任务(OpenAI 衡量真实经济价值工作的基准测试)上,Cerebras 实测 Ultrafast 平均每项任务 83 秒完成,而标准版 Sol 需要 7.7 分钟,端到端提速 5.6 倍。
  • 延迟:GPT-5.6 的延迟偏高。Artificial Analysis 数据显示,标准版 GPT-5.6 Sol 在最大推理强度下输出首个 token 需要 97.2 秒,而 GPT-5.5 在高推理强度下只要 14.5 秒。两家公司都没有公布 Ultrafast 的延迟数据。
  • 价格与可用性:仅向选定客户开放有限预览,其他人可加入等待名单,价格和正式发布时间均未公布。
  • 未知信息:基准测试数据尚无独立验证。

同一周还有两款同样主打速度的产品发布:Google 推出了 Gemini 3.7 Flash,Nvidia 发布了 Nemotron 3.5 Lightning。三者都瞄准了那些响应速度直接决定产品体验的应用场景。

到底什么是"速度"?AI 领域里,"速度"通常对应两项指标,不同模型和硬件侧重也不同。延迟(即首字响应时间)衡量的是从发出请求到模型开始输出的等待时长;吞吐量则衡量输出启动后每秒能生成多少 token。Ultrafast 追求的是吞吐量:Cerebras 的硬件将 GPT-5.6 Sol 的模型权重全部装载在 44 GB 片上 SRAM 中,省去了 GPU 推理中反复访问外部内存造成的瓶颈。

  • GPT-5.6 Sol on Ultrafast:吞吐量最直观的体现来自 Cerebras。Ultrafast 在 11 小时 11 分钟内完成了 Humanity's Last Exam 的全部 2,500 道题——这是一份覆盖 100 多个学科的专家级测试——而 Claude Fable 5 用了 78 小时 27 分钟,快约 7 倍。Cerebras 还报告称,在 Fast 模式下,Ultrafast 整体速度比 Claude Fable 5 快 11 倍,比 Claude Opus 4.8 快 5 倍。
  • Gemini 3.7 Flash:Google 未公布 Gemini 3.7 Flash 的吞吐量或延迟数据,但 Artificial Analysis 测得其输出速度为每秒 330 个 token(仅次于 Gemini 3.5 Flash-Lite),首字响应时间为 13.2 秒。该模型在 Artificial Intelligence Index 上的平均分也从上一代 Gemini 5.6 Flash 的 52 分提升至 56 分。
  • Nemotron 3.5 Lightning:据 Nvidia 称,其输出速度比同级别其他模型快至多 4 倍,智能体任务完成速度快 30%。Artificial Analysis 测得各供应商的平均吞吐量为每秒 302 个输出 token,首字响应时间 7.5 秒。Nvidia 同步发布了开源路由库 NeMo Switchyard,它会将智能体工作流的每一步分发给最契合该步骤在速度、质量或成本方面需求的可用模型。Nvidia 表示,通过 Switchyard 路由而非在单一大型模型上跑完所有步骤,任务完成成本降至仅用 Claude Opus 4.8 的约三分之一。

新闻背后的故事:超快推理并非 OpenAI 在速度上的全部投入。本周,公司公布了与 Broadcom 合作开发的新推理芯片 Jalapeño 的首批测试数据。测试显示,无论运行 OpenAI 自有模型还是开源权重模型,其延迟和吞吐量表现均令人期待。需要注意的是,芯片厂商还需在速度、并发用户数和硬件功耗之间取得平衡,三者都会影响推理的成本和可靠性。

为什么重要:达到这种速度后,模型能做什么比它在一项固定任务上做得多好更值得关注。

  • 在对话和其他实时场景中,用户能直接感知延迟:语音助手若停顿超过约一秒,体验就会显得卡顿,因为人类对话的轮次间隔通常只有 0.3 到 1 秒
  • 对于用 Agent 写代码的开发者来说,等几分钟才拿到结果,足以让人分心、丢失思路或转去做别的事。稍后回来时得在脑中重新拼装问题,上下文切换带来的认知疲劳也随之增加。
  • 低延迟和高吞吐量让常驻 Agent 能够监控系统、网站或安全日志,并在事件发生时即时响应。如果一个 Agent 花一分钟才分析出问题,很可能已经错过了实时处置的窗口。
  • 工具调用同样高度依赖延迟和吞吐量。搜索、代码执行和数据检索等工具都会增加 Agent 工作流的耗时。

我们的思考:更快的 AI 模型已经让 Agent 能以语速级别完成编码、数据检索和对话响应。我们鼓励开发者不仅思考现有应用中哪些需要更高吞吐和更低延迟,更去探索只有借助新模型和新硬件才能实现的全新应用。


插件配置界面,多个插件已启用,体现了 DeepSeek-V4-Pro 的新特性。

DeepSeek-V4-Pro 迎来更新

DeepSeek 的旗舰模型正式结束预览版,性能提升,并发布了评测该模型所用的 harness。这套 harness 免费开源,但公司上调了模型定价。

最新动态:DeepSeek 发布了 DeepSeek-V4-Pro-0813,即其两款第四代模型中较大那款的正式版。

  • 输入/输出:文本输入(最多 100 万 token),文本输出(最多 38.4 万 token,速度 78.1 token/秒)
  • 架构:Mixture-of-experts transformer,总参数 1.6 万亿,每个 token 激活 490 亿;可选的投机解码模块使权重达到 1.7 万亿参数
  • 特性:可调推理强度(无、低、高、最大),默认为高强度;支持工具调用和上下文缓存
  • 性能:Artificial Analysis 智能指数 53 分,在开源权重模型中排名第三;在 Arena WebDev 排行榜的 115 个模型中排第 10
  • 可用性/价格:可通过 DeepSeek 应用和网站的 Expert Mode 使用;也可通过 DeepSeek API 调用,高峰时段(UTC 01:00–04:00 和 06:00–10:00)每百万 token 输入 1.32 美元、缓存 0.044 美元、输出 3.96 美元,非高峰时段半价
  • 权重/许可:MIT 许可,商业和非商业使用均免费
  • 未公开:新的训练数据和方法、知识截止日期

公司还发布了开源 agent harness 的开发者预览版,并上调了所有模型的 API 价格。

工作原理:DeepSeek-V4-Pro-0813 保留了 4 月预览版的参数规模和架构,包括 DeepSeek 此前为预览版发布的投机解码模块 DSpark。DeepSeek 表示此次更新增强了模型的 agent 能力,但没有说明具体改动。

  • DeepSeek 用超过 32 万亿 token 对预览版进行了预训练,然后通过监督学习和强化学习,在各自领域分别微调了 10 个模型副本,最后通过 on-policy distillation(即让一个新的学生模型模仿这 10 个专家模型的输出)将它们合并为一个模型。
  • DeepSeek 的混合注意力机制在两种注意力层之间交替切换。两者都会压缩模型读取输入时存储的 key 和 value,但其中一种仅对选定的 token 子集做注意力计算。以 100 万 token 的输入为例,相比 DeepSeek-V3.2,该模型只需 27% 的计算量和 10% 的 key/value 存储内存。
  • 模型返回答案时会附带推理过程。若请求涉及工具调用,后续 API 请求必须携带此前的推理记录,否则会被拒绝,从而使推理状态得以跨多次调用持续保留。
  • DeepSeek Harness 将模型、工具、技能、会话、沙箱、存储、循环、调度和用户界面全部视为可配置、可替换的插件。它记录模型摄入的一切——系统提示词、推理过程、工具调用及结果、子智能体调度、上下文注入等——使任意会话都能被恢复、分叉、检索或重放。其最小模式仅赋予模型一个 shell 和文件编辑器,正是 DeepSeek 在编码智能体基准测试中所采用的配置。该框架基于名为 Cordis 的插件内核构建,DeepSeek 与北京大学在一篇论文中详细阐述了其设计。
  • DeepSeek 的 API 兼容 OpenAI 的 Responses 格式,因此 OpenAI 的 Codex 编码智能体只需运行一个安装脚本即可调用 DeepSeek 模型,大大降低了从 OpenAI 模型迁移的门槛。

性能表现:独立评测发现,DeepSeek-V4-Pro-0813 相比其 4 月预览版有大幅提升,但对 DeepSeek 更小的 Flash 模型仅有微弱领先。该模型在开放权重模型中首次跻身综合智能第三,但在 Artificial Analysis 的智能指数上仍落后最佳闭源模型约 10 分。最显著的改进体现在编码能力上。其单任务成本仍远低于多数闭源头部模型,但 OpenAI 降价之后,能力接近的 GPT-5.6 Luna 单任务成本已低于 DeepSeek。

  • 在 Intelligence Index(由九项经济实用任务评测综合而成)上,DeepSeek-V4-Pro-0813 开启最大推理模式得分 53 分(每任务 $0.25),较其四月预览版(最大推理模式,45 分,每任务 $0.05)提升 8 分,比 DeepSeek-V4-Flash-0731(最大推理模式,52 分,每任务 $0.11)高 1 分。该模型在此指数上落后于 10 个模型,包括 Gemini 3.7 Flash(高推理模式,57 分,$0.40)。它超过了 GPT-5.6 Luna(最大推理模式,52 分,每任务 $0.05),但 GPT-5.6 Luna 是少有的每任务成本低于更新版 DeepSeek-V4-Pro 或 Flash 的模型。
  • 在 DeepSeek 自家测试中(采用最大推理模式和 DeepSeek Harness 的最小配置),DeepSeek-V4-Pro-0813 最大的提升来自编码 Agent 任务。在 Terminal-Bench 2.1(命令行环境下的多步任务)上,得分从 72.1% 升至 87.9%;在 DeepSWE(解决高难度软件工程问题)上,从 12.8% 跃升至 62.7%;在 CyberGym(发现软件漏洞)上,从 52.7% 升至 83.3%,略超 Claude Fable 5(最大推理加回退模式,83.1%)。
  • 使用其他 harness 的独立评测中,该模型在 Terminal-Bench 2.1 上的表现偏低:Vals AI(使用其内部评测 harness)测得 54.68 分,Artificial Analysis(使用开源 Terminus 2 harness)测得 78.7%。

新闻背后: DeepSeek 近期发布了 DeepSeekV4-Flash 的实验版,增加了视觉能力。公司尚未公布 DeepSeekV4-Pro 同类视觉-语言版本的计划。

为何重要: DeepSeek 公开了其用于模型评测的 harness,这一点很少有公司做到。Agent 性能是模型与其 scaffolding 共同作用的结果,因此公开的 harness 决定了开发者只能"读"数字,还是能够复现它们。该 harness 采用 MIT 许可,且与模型无关(model-agnostic)。

我们的看法:Agent harness 这个市场越来越拥挤了!虽然 DeepSeek Harness 是开源的,但在接受安全专家的全面评估,以及在其他模型上的跑分测试之前,用户对是否把它投入生产环境可能会持观望态度。希望能尽快看到靠谱的第三方测试,以及开发者们接下来的试验和改进。


上下文管理流程图,展示在发送到 LLM 输入前的上下文编辑过程。

让 LLM 替 Agent 清理上下文

AI Agent 通常通过总结或删除最旧的内容来压缩上下文窗口。研究人员设计了一种更有选择性地管理 Agent 记忆的方法。

最新进展:社交电商平台小红书的 Xubin Hao 及其团队开发了 self-governing context(Self-GC)。和常见的 Agent 设计类似,Self-GC 会积累包含用户请求、工具调用以及 URL、文件路径等结果的输入输出上下文。不同之处在于,一个 LLM 会决定上下文中哪些部分要保留、精简或丢弃,然后再发送给对应的 LLM。

核心思路:仅靠基于内容类型或存续时间的规则,不足以让 Agent 判断该保留哪些上下文信息。一条较早的工具输出可能是某个 URL 的唯一记录,之后还需要重新访问;而一条较新的输出可能早已过时。LLM 能更灵活地做这类判断——它可以随着上下文的累积阅读已有信息,判断哪些细节之后可能派上用场。

工作原理:当输入 token 占用主 LLM 上下文窗口超过 30% 时,Self-GC 会把历史记录发送给一个规划模型(默认为 Qwen3.6-Plus),询问它对每条用户请求、工具调用及其相应结果该如何处理。

  • 规划器可以选择保留这些条目,或从三种操作中择一执行。(i)「折叠(Fold)」:将某条内容移出主历史,存入独立存储区,并附一条简短备注说明存放位置,以便 Agent 需要时逐字取回。(ii)「遮蔽(Mask)」:原地压缩某条内容,保留首尾文字、削减中间重复部分,适合处理冗长的日志。(iii)「修剪(Prune)」:直接删除任务已不再需要的条目,比如失败命令的日志。
  • Self-GC 先在一份历史副本上执行规划好的操作,丢弃任何可能干扰最近一次请求或 Agent 正在生成的回复的操作。随后评估剩余操作能节省多少 input tokens。
  • Self-GC 只在预估能降低后续调用成本(含利用缓存输入带来的节省)时才真正缩短历史。实际测试中,他们发现规划方案若能让历史缩减至少 30%,就值得应用,因此采用了这一经验阈值。

实验结果:作者在一个面向小红书用户的 Agent 上测试了 Self-GC,该 Agent 能浏览网页、执行 shell 命令并编辑文档。对比基线为遵循固定规则的方法,例如删除最旧的消息或删除工具输出。Self-GC 删掉的历史更少,但丢失有用信息的概率也远低于基线方法。为量化这一点,作者重放了真实用户与 Agent 之间已完成的对话:在对话中途暂停,对截至该点的历史运行 Self-GC,再用 GPT-5.5 判断缩短后的历史是否仍完整保留了后续对话用到的所有细节。

  • 在 33 段高难度对话中,Self-GC 删除了 43.95% 的 input tokens,84.85% 的情况下保留了全部必要细节。固定规则方法删除了 61.90%–69.87% 的 tokens,但仅 54.55%–69.70% 的情况下保留了必要细节。
  • 在 332 段更大的对话集上,Self-GC 删除了 31%–34% 的 input tokens,在三个不同规划器模型(Qwen3.6-Plus、Qwen3.7-Max 和 GLM-5.1)下,91.27%–94.58% 的情况下保留了必要细节,表明 Self-GC 对多种 LLM 均有效。固定规则方法删除了 40.19%–47.76% 的 tokens,但仅 77.71%–87.46% 的情况下保留了必要细节。
  • 在部分真实用户账户上进行实际测试,Self-GC 相比未启用的账户减少了 10% 到 15% 的输入 token 数量。
  • 但也要注意:作者的评估只测试了 Self-GC 保留关键信息的能力,并未验证其生成优质输出的表现。缩短上下文后,系统输出可能包含与完整上下文相同的信息,但实用性未必相当。

    为什么重要:通过缩减上下文来节省成本,存在模型后续遗忘关键细节的风险。懂得保留、精简和删除哪些内容,才能让长期运行的 agent 既经济实惠,又不至于"健忘"。

    我们的思考:John McCarthy 是"人工智能"一词的缔造者,他在 1959 年前后为计算机发明了"垃圾回收"机制,让程序员不必手动管理内存。妥善管理 agent 记忆的需求,再次说明 LLM 可以被当作操作系统来对待——同时也说明,软件工程的基本功对于构建优质 AI 应用不可或缺!

    原始来源: The Batch

    评论 (0)