← 文章 / AI技术
AI思维训练营 4小时前 · 2026-09-25 23:41:17 · 3 阅读

AIAgent记忆反常识:别提前写总结,用的时候再现场整理

Agent 记忆不好用,多半是整理的时间点太早:存的时候根本不知道将来怎么用。Salesforce 这篇论文把整理推迟到用记忆的那一刻,没训练过的 8B 小模型就赢了 GPT-5.4 的写时记忆法。

一个从没训练过的 8B(80 亿参数)小模型,在家务考场 ALFWorld 上赢了 GPT-5.4 亲自写的总结:79.3% 对 77.9%。这是 Salesforce AI Research 的 Yefan Zhou、Yang Li 等人 9 月23 日挂出的论文《Just-in-Time Memory》里最扎眼的数字。他们只改了一件事:把整理记忆的时间点,从记完笔记那一刻挪到用记忆那一刻。笔记记得更勤的 Agent,新任务就一定做得更漂亮吗?论文给的答案是未必。

毛病出在哪?看看今天 Agent 记忆的通用做法:任务一结束,立刻把这段经历蒸馏成总结、工作流或者技能存起来。这个动作有个名字,叫写时整理。它赌的是当初蒸馏出来的东西,恰好就是以后需要的东西。可写完总结那一刻,谁知道几个月后是哪个任务来用它?

一、三个考场,一份成绩单

怎么验证?论文摆了三个考场:ALFWorld 的 140 道文本家务题,WebShop 的 500 单模拟网购,τ²-bench 的航空、零售、电信客服对话。执行模型换了三个:Qwen3-8B、Gemini-2.5-Pro、GPT-5.4。

先看最小那档的成绩。Qwen3-8B 当执行模型,ALFWorld 上 JitMem 拿到 77.4%,比同组最强的写时方法 SkillOS 的 61.2% 高 16.2 个百分点;WebShop 上无记忆基线只有 9.8% 成功率,JitMem 拉到 32.8%,翻了 3 倍还多。

成本账也有意思:别人每次往上下文塞上万 token 的总结(token 是模型阅读量的计费单位),ReasoningBank 塞 19.7K,SkillOS-base 塞 22.4K;JitMem 只多塞 1.9K,平均步数还从 17.8 降到 11.6。记的东西更少,干活却更利索。

二、记忆的价值,由用它的任务决定

一条记忆值多少钱,要等用它的任务来了才算得出来。

论文的做法很直白。存的时候不做任何蒸馏,原始轨迹一字不改留着;等新任务来了,检索器捞回最相关的几条原始记录,整理器把任务和记录放在一起读,现场剪一份只服务这道题的简报。

JitMem 的推理与训练流程:存原始轨迹,读时由整理器现场生成任务简报

[来源:arXiv:2609.27334 Figure 1]

这就是我想给你的那个类比:别人的记忆是下课当晚写好的课堂总结,JitMem 是把上课录音原样存着,等考前一晚知道考什么题型,再现场剪一张小抄。总结只能写一次,录音又能剪多少次?

这条路其实已经走了三年。从 2023 年 Reflexion 的口头反思,到今年 ReasoningBank、SkillOS 用强化学习训练"怎么写总结",大家都在写时整理上使劲。JitMem 头一回把整理动作整体挪到读时。

三、同一段录音,两张小抄

看一个具名例子。Agent 曾完成"把凉鸡蛋放进微波炉",完整记录入库。后来两个新任务同时找上门,"把热土豆放进冰箱"和"把报纸放到沙发上",检索回来的都是同一条记录。

整理器给两个任务剪出了不同的流程:前者是加热降温,土豆加热再送冰箱;后者是寻找放置,从桌面拿起报纸移到沙发。同一段经历,两张小抄,各自踩中自己的考点。

同一段

[来源:arXiv:2609.27334 Figure 3]

放到客服场景,这个能力直接换成分数。τ²-bench 电信域规矩多、步骤长,JitMem 把成功率从最强基线的 61.6% 拉到 72.6%,涨了 11 个点。

航空和零售两个域呢?包括 JitMem 在内所有记忆方法都没比无记忆稳出多少。作者直接写了:程序性强的场景才吃整理这一套,纯查事实的场景不吃。

四、省下来的不只是分数

训练侧还有一笔巧账。写时整理做强化学习有个头疼处:今天写的总结有没有用,要等很多个任务之后被检索到才知道,奖励隔着好几道题。JitMem 的简报当场被当前任务消费,成没成就是即时奖励。

用 GRPO(一种强化学习训练法)把整理器训练一遍,WebShop 成功率从没训练时的 11.7% 涨到 32.8%。更实惠的是整理器能搬家:用 Qwen3-8B 当执行模型训练一次,直接搬去给 GPT-5.4 用,拿到 86.7%,离用 GPT-5.4 重训只差 1.4 个点。

拆件对照实验还堵了一个怀疑:清空检索记录让训练过的整理器裸奔,分数掉回没训练的水平以下。它学的确实是蒸馏别人经历的手艺,没有偷偷背题的痕迹。

训练前后的整理器对比:训练版会补上

[来源:arXiv:2609.27334 Figure 4]

五、AI 刚学会人类早就在做的事

这篇论文戳中我们一个共同的时间偏见:总以为经验的价值在产生那一刻就定死了,于是急着总结、急着归档。我自己的感受是,复盘当晚写的总结,隔段时间换个新项目翻出来,能直接套上的没几条,有用的部分都得对着新场景现场重剪一遍。

人类的记忆早就这么工作了。心理学家近百年前就确认,回忆是重建,每想起一次就按当下的场景和目的重组织一次,记忆越用越被改写。AI Agent 花了三年学记笔记,现在才开始学回忆。

如果记忆真该在用的那一刻才整理,那我们手里那些经验和 SOP(标准流程文档),有多少是写得太早的总结?

英国心理学家巴特利特在 1932 年的《Remembering》里写:记忆是一种想象性的重建。
原始来源: AI思维训练营

评论 (0)