← 文章 / AI技术
机智新语 2小时前 · 2026-10-01 16:40:29 · 3 阅读

不用大模型打分,实现AI记忆的新解决路径

一个 Agent 记性好不好,很大程度上取决于它怎么判断"这条记忆跟当前问题有没有关系"。

这件事目前主流做法是交给大模型。把候选记忆拉出来,让模型挨个打分,挑出高分的那几条塞进 Prompt。做法直观,代价也很直观。每次召回都要跑一遍大模型,慢,贵,而且判断标准会飘。

2026 年 9 月,德州大学达拉斯分校的三位研究者提交了一篇论文,标题是 Jev-Mem: System-One-Controlled Agentic Memory。他们把这件事拆开了。

论文做了什么

作者是 Dongming Jiang、Yi Li 和 Bingzhe Li,论文编号 arXiv:2609.23986,9 月 21 日上线。代码用 MIT 协议开源,Python 写的。

它把这类判断从大模型手里拿走,交给一个专门做概率决策的轻量引擎。

这个引擎叫 Jev,它不做生成。你问它一个问题,它只回答是或否,或者给一个概率分数。它擅长的是结构化判断,不负责写文章。

这套分工借的是认知心理学的双系统理论。System 1 是快速直觉,比如一眼认出熟悉的脸。System 2 慢一些,要一步步推理,像解一道数学题。Jev-Mem 把它搬到了记忆系统上。

三个平面各管什么

整个架构切成三层,每层的职责边界划得很硬。

System One 控制面负责所有高频判断。写入的时候,它决定这条内容要不要存,给它打上类型标签,同时记下时间、实体和因果关系。召回时它负责查询路由和预算分配。给候选打分,判断"证据够了没有",这些也归它。

Memory Plane 记忆面是存储层,默认落在本地 SQLite。每条记忆保留原始文本、时间戳和来源。同一条记忆会同时挂在四种关系图上,语义、时间和因果各一张,还有一张是实体,它既回答"发生过什么",也回答"什么时候发生的"、"为什么"和"跟谁有关"。

这里有一个设计选择值得注意。默认配置会保留每一条有效观测,哪怕它当时看不出有什么用,因为有些细节的价值要过很久才显现,早删了就找不回来。

System Two 推理面就是普通大模型,只干两件事,把筛选出来的记忆拼进 Prompt,然后生成回答、摘要或者事实提取结果。

记忆的过滤和排序,以及冲突判断,一点都没有留给它。

⚡只判断,不生成只回答是或否,或者给一个分数。💡 判断从大模型手里拿走

写入流程

对话流进来,先过一遍脱敏,把敏感信息摘掉。

然后交给 System One 判断这条值不值得长期保存。值得保存的,抽成结构化事实,打上时间、实体和因果标签,写进本地记忆库。

这一步还有个细节。系统会先从已有记忆里找一批候选,让 Jev 判断新条目和它们之间有没有推断出来的关系,而时间戳排序这类确定性的连接,直接交给普通代码处理。

判断和计算分开,能算的绝不让模型判断。

召回流程,这是最不一样的地方

传统方案的做法是,用户提问,先把记忆库里的内容做一遍向量或关键词粗筛,再让大模型给候选打分。

Jev-Mem 的召回分四步走。

第一步,取出当前作用域下的活跃记忆。向量和关键词搜索在这时候负责给出初始锚点。第二步,把一批记忆条目批量送进 System One,每条得到一个相关性概率分。第三步是按概率阈值和 token 预算做截断。这一步还能顺着因果和实体关系往外做图遍历,把候选扩展开。最后把筛选后的记忆片段交给大模型合成答案。

这套机制还会中途停下来。控制器每轮之后会重新评估一次,证据足够了就停,继续搜的预期收益很低了也停,或者碰到预设的上限就停。论文里说完整的决策轨迹都能查,包括路由选了哪些图视图、预算怎么分配,以及为什么停下来。缓存命中和降级事件也有记录。

这里要说清楚一点,免得误解。向量检索并没有被完全扔掉,它还在,只是从"决定谁进 Prompt 的主角"退成了"提供初始锚点"。

区别在于打分和取舍这一步归谁。以前归大模型,现在归一个只输出概率分数的轻量引擎。

🔍 召回的四步📚取出记忆 ➜ ⚡批量打分 ➜ ✂️截断 ➜ 🤖合成答案

superseded 替代链

记忆系统有个很容易被忽略的问题,就是知识会互相矛盾。

用户上个月说要部署在阿里云,这个月改成自建机房了。两条记忆都在库里,检索时都命中,大模型拿到两个互相冲突的结论,只能自己猜一个。

Jev-Mem 的处理方式是给记忆加上替代关系。新的结论进来,旧的那条被标记成 superseded。系统因此知道哪条已被推翻、被谁推翻。到了召回这一步,失效的条目不会再被当成有效证据。

这个机制对长期运行的知识库特别有用。它让记忆库不再是只增不减的堆积,而是一份有版本关系的记录。

🔁 superseded 替代链📝 新结论  ➜  🏷️ 标失效  ➜  🚫 退出召回↺ 知道被谁推翻

Memory 的作用域划分

记忆分两个作用域,边界很实用。

project-scope 管项目内的决策和架构约定。这类记忆跟着项目走,编码 Agent 用到的绝大多数是这一层。项目里定下的技术选型和约定,下次开新会话不用重新交代。

global-scope 管用户的长期偏好和通用设定,跨项目生效。

拆开的好处是隔离。项目 A 的技术选型不会污染项目 B,而用户个人的编码习惯两边都能用上。

本地优先也是同一个思路。记忆存在本地仓库里,编码场景可以直接存进代码仓库跟着版本走。论文明确点了 Cursor 和 Claude Code 这类编程 Agent 是目标场景。

成绩单

测试集用的是 LoCoMo,一个专门测长对话记忆的基准;答案模型选 GPT-4o-mini,质量由大模型当裁判打分。

方案综合得分 ↑记忆构建耗时(秒) ↓平均查询延迟(秒) ↓
全上下文0.481不适用1.74
A-MEM0.5803,6362.26
MemoryOS0.5533,27632.68
Nemori0.5901,0442.59
MAGMA0.7001,4041.47
Jev-Mem0.7771580.93

三个数字比较有说服力。综合分比最强的基线高 11.0%。记忆构建时间从最快的 1,044 秒压到 158 秒,快了 6.6 倍;查询延迟从 1.47 秒降到 0.93 秒,少了 36.7%。

耗时这项最能说明问题。A-MEM 和 MemoryOS 都要三千多秒,MemoryOS 的查询延迟甚至到 32.68 秒。这些时间大头都花在让大模型反复做记忆整理和打分了。

对抗性问题上它拿了 0.962

分类成绩里有一个数字值得单独看。

在对抗性问题上,Jev-Mem 得分 0.962,同组里第二名是 MAGMA 的 0.742。这个差距比综合分的差距大得多。

对抗性问题测的是另一件事。题目的答案压根不在记忆库里,系统应该承认"我记不得",而不是硬编一个出来。全上下文方案在这项上只拿到 0.205。把全部历史都塞给模型,它反而更容易被无关内容带着跑。

这件事说明记忆系统的水平不只看召回准不准,知道自己不该回答什么同样重要。相关性判断这件事,交给概率引擎,结果比交给大模型更稳。

🐢 大模型打分  vs  ⚡ 概率引擎决策
🐢 大模型打分每次召回都跑 LLM判断标准会飘⚡ 概率引擎只输出概率分延迟 0.93 秒

一个刚加上的东西

论文上线时有个明显的短板。Jev Decision API 是外部服务,决策内核没开源,开源客户端只能连它的接口。想完全离线跑,做不到。

9 月 27 日,项目加上了 Laya 支持。Laya 是可以本地跑的决策后端,切换过去之后记忆构建和召回都用本地模型判断,不需要 TypeSafe 的 API key。图结构、检索策略和 System Two 答案模型是共用的,换的只是决策那一段。

论文里的成绩全部来自 Jev,Laya 还没有对应的基准数据。

客观边界

有三件事得说清楚。事实文本的提取仍然依赖大模型,System One 判断的是"要不要存"和"准不准",至于把一段对话抽成一句结构化事实,这件事还是 System Two 在做。

本地跑起来有门槛。默认的 minilm 向量后端第一次使用要下载模型,装 Laya 还要额外拉权重。好在仓库自带一个离线 demo,不需要任何 API key 和模型下载就能跑通流程,只是它用确定性的模拟决策,不测答案质量。

基准成绩的范围有限。论文报的是 LoCoMo 上的结果,仓库里虽然带了 LongMemEval 的运行脚本,但论文没有声称对应成绩。数据规模也从几千条到几十万条不等,超大规模下的表现还需要更多验证。

值得记住的地方

"不用向量"这个说法其实不太准确。向量还在,只是退到辅助位置。

它做的是把记忆管理里的两类劳动分开。第一类问题的答案很短,是或否,或者一个分数,比如这条有没有关系,以及要不要停、该信谁。这类问题适合专用的轻量引擎。第二类问题的答案很长,要把证据写成一段通顺的结论,这才需要大模型。

现在大多数记忆系统把这两件事一起塞给大模型,于是每一次记忆操作都在烧大模型的算力。分开之后,省下来的是钱、延迟,还有判断的一致性。

记忆系统的水平,未必取决于背后那个模型有多聪明。它更取决于你把哪些活派给了不该干这活的那一方。


参考来源

  • 论文:Jev-Mem: System-One-Controlled Agentic Memory for Efficient AI Agents,arXiv:2609.23986(2026-09-21)
  • 代码:https://github.com/libingzheren/Jev-Mem
  • 论文页:https://huggingface.co/papers/2609.23986
原始来源: 机智新语

评论 (0)