不用大模型打分,实现AI记忆的新解决路径
一个 Agent 记性好不好,很大程度上取决于它怎么判断"这条记忆跟当前问题有没有关系"。
这件事目前主流做法是交给大模型。把候选记忆拉出来,让模型挨个打分,挑出高分的那几条塞进 Prompt。做法直观,代价也很直观。每次召回都要跑一遍大模型,慢,贵,而且判断标准会飘。
2026 年 9 月,德州大学达拉斯分校的三位研究者提交了一篇论文,标题是 Jev-Mem: System-One-Controlled Agentic Memory。他们把这件事拆开了。
论文做了什么
作者是 Dongming Jiang、Yi Li 和 Bingzhe Li,论文编号 arXiv:2609.23986,9 月 21 日上线。代码用 MIT 协议开源,Python 写的。
它把这类判断从大模型手里拿走,交给一个专门做概率决策的轻量引擎。
这个引擎叫 Jev,它不做生成。你问它一个问题,它只回答是或否,或者给一个概率分数。它擅长的是结构化判断,不负责写文章。
这套分工借的是认知心理学的双系统理论。System 1 是快速直觉,比如一眼认出熟悉的脸。System 2 慢一些,要一步步推理,像解一道数学题。Jev-Mem 把它搬到了记忆系统上。
三个平面各管什么
整个架构切成三层,每层的职责边界划得很硬。
System One 控制面负责所有高频判断。写入的时候,它决定这条内容要不要存,给它打上类型标签,同时记下时间、实体和因果关系。召回时它负责查询路由和预算分配。给候选打分,判断"证据够了没有",这些也归它。
Memory Plane 记忆面是存储层,默认落在本地 SQLite。每条记忆保留原始文本、时间戳和来源。同一条记忆会同时挂在四种关系图上,语义、时间和因果各一张,还有一张是实体,它既回答"发生过什么",也回答"什么时候发生的"、"为什么"和"跟谁有关"。
这里有一个设计选择值得注意。默认配置会保留每一条有效观测,哪怕它当时看不出有什么用,因为有些细节的价值要过很久才显现,早删了就找不回来。
System Two 推理面就是普通大模型,只干两件事,把筛选出来的记忆拼进 Prompt,然后生成回答、摘要或者事实提取结果。
记忆的过滤和排序,以及冲突判断,一点都没有留给它。
⚡只判断,不生成只回答是或否,或者给一个分数。💡 判断从大模型手里拿走写入流程
对话流进来,先过一遍脱敏,把敏感信息摘掉。
然后交给 System One 判断这条值不值得长期保存。值得保存的,抽成结构化事实,打上时间、实体和因果标签,写进本地记忆库。
这一步还有个细节。系统会先从已有记忆里找一批候选,让 Jev 判断新条目和它们之间有没有推断出来的关系,而时间戳排序这类确定性的连接,直接交给普通代码处理。
判断和计算分开,能算的绝不让模型判断。
召回流程,这是最不一样的地方
传统方案的做法是,用户提问,先把记忆库里的内容做一遍向量或关键词粗筛,再让大模型给候选打分。
Jev-Mem 的召回分四步走。
第一步,取出当前作用域下的活跃记忆。向量和关键词搜索在这时候负责给出初始锚点。第二步,把一批记忆条目批量送进 System One,每条得到一个相关性概率分。第三步是按概率阈值和 token 预算做截断。这一步还能顺着因果和实体关系往外做图遍历,把候选扩展开。最后把筛选后的记忆片段交给大模型合成答案。
这套机制还会中途停下来。控制器每轮之后会重新评估一次,证据足够了就停,继续搜的预期收益很低了也停,或者碰到预设的上限就停。论文里说完整的决策轨迹都能查,包括路由选了哪些图视图、预算怎么分配,以及为什么停下来。缓存命中和降级事件也有记录。
这里要说清楚一点,免得误解。向量检索并没有被完全扔掉,它还在,只是从"决定谁进 Prompt 的主角"退成了"提供初始锚点"。
区别在于打分和取舍这一步归谁。以前归大模型,现在归一个只输出概率分数的轻量引擎。
🔍 召回的四步📚取出记忆 ➜ ⚡批量打分 ➜ ✂️截断 ➜ 🤖合成答案superseded 替代链
记忆系统有个很容易被忽略的问题,就是知识会互相矛盾。
用户上个月说要部署在阿里云,这个月改成自建机房了。两条记忆都在库里,检索时都命中,大模型拿到两个互相冲突的结论,只能自己猜一个。
Jev-Mem 的处理方式是给记忆加上替代关系。新的结论进来,旧的那条被标记成 superseded。系统因此知道哪条已被推翻、被谁推翻。到了召回这一步,失效的条目不会再被当成有效证据。
这个机制对长期运行的知识库特别有用。它让记忆库不再是只增不减的堆积,而是一份有版本关系的记录。
🔁 superseded 替代链📝 新结论 ➜ 🏷️ 标失效 ➜ 🚫 退出召回↺ 知道被谁推翻Memory 的作用域划分
记忆分两个作用域,边界很实用。
project-scope 管项目内的决策和架构约定。这类记忆跟着项目走,编码 Agent 用到的绝大多数是这一层。项目里定下的技术选型和约定,下次开新会话不用重新交代。
global-scope 管用户的长期偏好和通用设定,跨项目生效。
拆开的好处是隔离。项目 A 的技术选型不会污染项目 B,而用户个人的编码习惯两边都能用上。
本地优先也是同一个思路。记忆存在本地仓库里,编码场景可以直接存进代码仓库跟着版本走。论文明确点了 Cursor 和 Claude Code 这类编程 Agent 是目标场景。
成绩单
测试集用的是 LoCoMo,一个专门测长对话记忆的基准;答案模型选 GPT-4o-mini,质量由大模型当裁判打分。
| 方案 | 综合得分 ↑ | 记忆构建耗时(秒) ↓ | 平均查询延迟(秒) ↓ |
|---|---|---|---|
| 全上下文 | 0.481 | 不适用 | 1.74 |
| A-MEM | 0.580 | 3,636 | 2.26 |
| MemoryOS | 0.553 | 3,276 | 32.68 |
| Nemori | 0.590 | 1,044 | 2.59 |
| MAGMA | 0.700 | 1,404 | 1.47 |
| Jev-Mem | 0.777 | 158 | 0.93 |
三个数字比较有说服力。综合分比最强的基线高 11.0%。记忆构建时间从最快的 1,044 秒压到 158 秒,快了 6.6 倍;查询延迟从 1.47 秒降到 0.93 秒,少了 36.7%。
耗时这项最能说明问题。A-MEM 和 MemoryOS 都要三千多秒,MemoryOS 的查询延迟甚至到 32.68 秒。这些时间大头都花在让大模型反复做记忆整理和打分了。
对抗性问题上它拿了 0.962
分类成绩里有一个数字值得单独看。
在对抗性问题上,Jev-Mem 得分 0.962,同组里第二名是 MAGMA 的 0.742。这个差距比综合分的差距大得多。
对抗性问题测的是另一件事。题目的答案压根不在记忆库里,系统应该承认"我记不得",而不是硬编一个出来。全上下文方案在这项上只拿到 0.205。把全部历史都塞给模型,它反而更容易被无关内容带着跑。
这件事说明记忆系统的水平不只看召回准不准,知道自己不该回答什么同样重要。相关性判断这件事,交给概率引擎,结果比交给大模型更稳。
🐢 大模型打分 vs ⚡ 概率引擎决策| 🐢 大模型打分每次召回都跑 LLM判断标准会飘 | ⚡ 概率引擎只输出概率分延迟 0.93 秒 |
一个刚加上的东西
论文上线时有个明显的短板。Jev Decision API 是外部服务,决策内核没开源,开源客户端只能连它的接口。想完全离线跑,做不到。
9 月 27 日,项目加上了 Laya 支持。Laya 是可以本地跑的决策后端,切换过去之后记忆构建和召回都用本地模型判断,不需要 TypeSafe 的 API key。图结构、检索策略和 System Two 答案模型是共用的,换的只是决策那一段。
论文里的成绩全部来自 Jev,Laya 还没有对应的基准数据。
客观边界
有三件事得说清楚。事实文本的提取仍然依赖大模型,System One 判断的是"要不要存"和"准不准",至于把一段对话抽成一句结构化事实,这件事还是 System Two 在做。
本地跑起来有门槛。默认的 minilm 向量后端第一次使用要下载模型,装 Laya 还要额外拉权重。好在仓库自带一个离线 demo,不需要任何 API key 和模型下载就能跑通流程,只是它用确定性的模拟决策,不测答案质量。
基准成绩的范围有限。论文报的是 LoCoMo 上的结果,仓库里虽然带了 LongMemEval 的运行脚本,但论文没有声称对应成绩。数据规模也从几千条到几十万条不等,超大规模下的表现还需要更多验证。
值得记住的地方
"不用向量"这个说法其实不太准确。向量还在,只是退到辅助位置。
它做的是把记忆管理里的两类劳动分开。第一类问题的答案很短,是或否,或者一个分数,比如这条有没有关系,以及要不要停、该信谁。这类问题适合专用的轻量引擎。第二类问题的答案很长,要把证据写成一段通顺的结论,这才需要大模型。
现在大多数记忆系统把这两件事一起塞给大模型,于是每一次记忆操作都在烧大模型的算力。分开之后,省下来的是钱、延迟,还有判断的一致性。
记忆系统的水平,未必取决于背后那个模型有多聪明。它更取决于你把哪些活派给了不该干这活的那一方。
参考来源
- 论文:Jev-Mem: System-One-Controlled Agentic Memory for Efficient AI Agents,arXiv:2609.23986(2026-09-21)
- 代码:https://github.com/libingzheren/Jev-Mem
- 论文页:https://huggingface.co/papers/2609.23986