Opus 追赶前沿,Jev 分类万物,同时运行两个 Agent
各位朋友,
在早期 0 到 1 阶段与成熟期,项目所需的战术截然不同。对于希望精通 AI 工程的人来说,我发现根据项目所处阶段选择合适的战术,既是最难掌握的技能,也是最重要的一课。
在《AI工程技能地图》系列五封信中,你可能已经注意到“校准项目阶段”是一个反复出现的主题。这封信将解释其原因。对于构建评估、选择软件架构或获取产品反馈等许多 AI 工程任务,正确的选择通常取决于项目所处的阶段。
以评估 AI 系统这一任务为例,假设是一个自动客服邮件系统。在早期项目中,你可能只需手动检查十几个例子,看看它们是否合理。到了中期,项目可能已有数百个测试用例和一份评估 AI 邮件质量的书面评分标准。而成熟产品则可能拥有数万甚至更多的测试用例、更详细的标准,并建立严谨流程,不仅评估邮件本身的质量,还评估其下游影响(例如是否提高了客户回访率)。
将技能与项目正确阶段相匹配,对其他 AI 工程能力同样至关重要。在早期过度设计,或在成熟期设计不足,都是不可取的。对于早期项目,如果主要目标是快速验证产品想法,那么简单的软件架构设计即可,无需过多考虑效率、数据模式、第三方服务成本等。但随着项目成熟,仔细权衡延迟、可用性、一致性、可靠性、可维护性、简洁性和成本等取舍,将带来更好的结果。
获取产品反馈的方式差异同样很大:有的只是找两三个人聊聊看法,有的则要开展大规模用户研究、进行 A/B 测试,甚至深入分析产品使用数据。

一种积累经验的方式,是接触不同类型的早期和成熟项目。在创业公司工作的人可能更擅长快速评估;在大公司工作的人则可能更熟悉严谨、缓慢但规范的最佳实践。我见过从大公司跳槽到创业公司的工程师,要求使用过于严苛的评估流程;也见过从创业公司进入大公司的工程师,因不熟悉严格方法,项目效果遭遇瓶颈。项目经验固然宝贵,但如果你不想花好几年时间在大小公司间辗转,以掌握这种广度上的技能,DeepLearning.AI 愿意帮你缩短学习路径。
我每周参与的项目,有的服务过亿用户,有的则还处在没有用户阶段。两类项目的运作节奏截然不同!因此,那种强制要求所有项目采用统一模式的“一刀切”政策——比如任何产品上线前必须跑完特定类型测试——反而可能适得其反。
即便大公司,也应该保留小而创新的项目。因此,大家都值得学习小团队快速高效推进的方法。另一方面,为了不让项目发展到一定阶段后停滞不前,也有必要掌握更慢但更严谨的执行方式。
继续造起来。希望你的早期项目能成为成熟成功的大项目。
Andrew
A MESSAGE FROM DEEPLEARNING.AI

为你的 AI 应用赋予经验记忆,且完全存储在设备端。在《构建具备设备端记忆的 AI 助手》课程中,你将学会把文本和图像转化为向量、按语义进行检索,并让它仅凭几张照片就能识别新物体。免费报名
新闻

Claude Opus 5.5 大幅跃升
在 CEO Dario Amodei 提议放慢 AI 发展仅一周半之后,Anthropic 发布了一款新模型,据称这是一个更大模型家族的开山之作。
最新动态:Anthropic 推出了 Claude Opus 5.5——Claude Opus 5 的低成本后继版本,其综合智能超越了 Claude Fable 5.1 及当前所有其他模型。与 Fable 不同的是,它不会保留用户数据 30 天;但与 Fable 相同的是,对于 Anthropic 认为涉及敏感网络安全和生物学的问题,它会回退到 Claude Opus 4.8 处理。
- 输入/输出:输入文本和图像(最多 100 万 token),输出文本(最多 12.8 万 token,Batch API 可达 30 万 token)
- 知识截止日期:2026 年 6 月
- 功能特性:推理始终开启,共五档(low、medium、high、xhigh、max,默认 high);生成文本采用统计水印;支持快速模式(速度提升 2.5 倍,成本增加 2 倍)
- 性能表现:Claude Opus 5.5 在 Artificial Analysis 的 Intelligence Index v4.3 上排名第一(58 分),并以 69.69% 的成绩领跑 Vals AI 的 Vals Index
- 获取方式/价格:可通过 Claude.ai 及 Amazon Web Services、Google Cloud、Microsoft Azure 等外部服务商使用;API 定价为每百万 token 输入 4 美元/缓存读取 0.25 美元/输出 20 美元;缓存读写为每百万 token 0.20/5 美元;批处理为每百万 token 输入 2 美元/输出 10 美元;支持零数据保留(Zero Data Retention)
- 权重/许可证:专有
- 未公开:参数量、架构、具体训练数据和方法
工作原理:Anthropic 基于混合了私有与公开语料的数据集训练该模型。这些数据源自其 ClaudeBot 爬虫抓取的公开网站内容、其他模型生成的合成数据,以及未选择退出条款的 Claude 用户输入与输出。其知识截止日期与 Claude Fable/Mythos 5.1 保持一致,暗示两者在训练数据上具有相似性。训练完成后,公司根据制定的 宪法 对模型进行了对齐微调。此外,Anthropic 还聘请了 METR 和 Frontier Design 等外部评估机构对模型进行了安全测试。
- Anthropic 内部对齐测试显示,Claude Opus 5.5 在各项指标上均超越近期发布的模型,不仅更诚实,且受动机性推理影响更小。不过公司也表示,该模型在测试期间的行为会出现变化。
- 据 Anthropic 称,Claude Opus 5.5 的沟通表达比 Claude Opus 5 和 Claude Fable 5 更清晰简洁,解决了用户对这些模型的常见抱怨。它还更严格地遵循写作风格指令。(Anthropic 表示 Claude Fable 5.1 也有类似改进,只是相比前代版本仅略微减少了啰嗦程度。)
- Anthropic 还称,在撰写商业报告等知识型工作任务测试中,Claude Opus 5.5 在不同努力强度下 18 次测试里有 16 次达到 Anthropic 内部的质量阈值。而 Claude Fable 5.1 和 Claude Opus 5 在同样的测试中全部未达标。
- Anthropic 表示,Claude Sonnet 5.5 和 Claude Haiku 5.5 将在数周内发布。这将是自 2025 年 10 月 4.5 版本后,Anthropic 更快且更廉价 Haiku 系列模型的首次更新。
性能表现: 在 Artificial Analysis 和 Vals AI 对综合智能水平的加权评估中,Claude Opus 5.5 均位列所有模型之首。
- 在 Artificial Analysis 的 智能指数(v4.3)中,这是基于数学、科学、编码及推理十项评估的综合指标。在最高推理档位并启用默认回退机制时,Claude Opus 5.5 的加权平均分得 58,比 Claude Opus 5 高 7 分,比 Claude Fable 5.1 和 GPT-6 Astra 高 5 分。
- 该模型在 Intelligence Index 的十项评估中,有六项取得最高分:Humanity's Last Exam(61.4%)、SciCode(66.9%)、GDPval-AA v2.1、AA-Briefcase v1.1、AA-Omniscience 和 AutomationBench-AA;在第七项 Terminal-Bench 4.0(59.6%)中与其他模型并列。
- 据 Artificial Analysis 报道,尽管 Claude Opus 5.5 的每 token 成本低于其前代版本及 Claude Fable 5.1,但由于该模型消耗的 token 数量多于早期 Opus 模型,其单个基准测试任务的成本依然较高。在启用最大推理并配合回退策略时,Claude Opus 5.5 每任务成本为 5.98 美元,仅次于 Claude Fable 5.1 的 7.63 美元,远高于 GPT-6 Astra 的 3.26 美元。
- 在 Vals AI 指数上,Claude Opus 5.5 得分为 69.69%,以超过 3 个百分点的优势领先 GPT-6 Astra,位居榜首。即使将回退操作计为失败,其分数也未受到显著影响。
- 该模型还在 Vals 的 RSI 指数(衡量模型对 AI 和机器学习的知识掌握)、MedScribe(医疗行政工作)、ProofBench v1.1(形式化验证数学证明,该模型取得满分)、VibeCodeBench1-100(扩展可用 Web 应用程序)、ProgramBench(根据描述重构程序)以及 Terminal-Bench 4.0(终端编码、科学和安全任务)上均位列第一。
幕后动态: Claude Opus 5.5 与 OpenAI 发布的 GPT-6 Sol 和 GPT-6 Luna 同日亮相。这两款模型价格更低,其前代版本曾是 Claude Opus 5 的竞争对手,但如今均被 Claude Opus 5.5 轻松超越。值得注意的是,这些模型的发布背景是 Anthropic CEO Dario Amodei 和 OpenAI CEO Sam Altman 等多位 AI 领域领军人物近期公开呼吁放缓 AI 发展,以便进行更充分的安全性和安全性测试。如果这些发布具有代表性,那么在未来很长一段时间内,我们不会缺乏新型高性能模型,尽管这些模型可能会附带限制措施。
为什么重要:市面上每出现一个新的最强模型都是大事,而 Claude Opus 5.5 看起来明显领先其他模型。需要处理敏感数据的企业客户,以及任何不想把输入输出数据交给 Anthropic 的用户,会高兴地发现 Fable 的数据保留政策并不覆盖 Opus。Claude 系列一直是编程高手,但这个模型在知识工作上似乎尤其出色——撰写文档和演示文稿、分析数据、做研究,这些恰恰是 Anthropic 近来被 OpenAI 抢走地盘的领域。
我们的看法:由于模型会降级到 Claude Opus 4.8,单从跑分角度根本无法判断 Claude Opus 5.5 的真实能力,尤其是在网络安全和生物任务上。同样值得注意的是,一些正当的安全、生物医学和 AI 工程工作,也可能因为 Anthropic 担心用户违规使用模型而被误拒。

只为一件事而生的模型
当大多数公司都在押注生成式和推理模型时,有一家公司却押注于两者之外的另一类模型。这种新模型只做一件事:分析文本并回答与文本相关的问题——但速度更快、成本更低,远胜大语言模型。
最新动态:由 OpenAI 前员工 Diogo Almeida 创立的 TypeSafe 发布了 Jev,这是一个通用分类模型,能用预定义的输出回答任何问题。它的定位不是通用语言模型,而是为其他软件工具提供决策所需的数据。
- 输入/输出:输入为文本,最多 6.4 万 token。输出由用户定义,可以是从一组选项中做选择、打分,或是回答是/否
- 性能:在内部数据集的分类任务上,表现与 GPT-5.6 Terra 和 Claude Sonnet 5 相当
- 可用性:目前处于早期访问阶段,输入/输出价格分别为 $0.042/免费 每百万 token
- 未公开:架构、上下文窗口、训练数据及大部分训练方法。
工作原理:TypeSafe 并未详细阐述 Jev 的架构,仅说明它不是 LLM,也不是自回归模型,而是基于 Transformer 的。作者们也没有描述训练数据的具体内容,只提到所有数据均由团队自制。他们详细介绍了一种名为“校准决策强化学习”(RLCD)的训练方法。
- Jev 的输入分为两部分:一段文本(如描述或 JSON 对象)和针对该文本的问题。两部分均限制在 3.2 万 token 以内。在此限制下,用户可添加任意数量的问题,所有问题并行评估。用户仅为文本支付一次费用,并为组成问题的所有 token 付费,输出免费。
- Jev 的输出可以是二元判断(是/否、真/假)、从选项列表中选择一个,或是 0 到 10 之间的评分。二元判断定义为答案为“是”的简单概率。列表选择模式返回模型偏好的选项、对该选择的置信度,以及每个可能项的概率。十分制评分也附带置信度和各选项概率,不同之处在于最终答案不是选择某个值,而是根据各选项概率计算出的分数。
- 在训练过程中,RLCD 鼓励模型将答案的概率分配与其实际发生频率保持一致。例如,概率为 20% 的答案应在 20% 的情况下是正确的。
- Jev 的结构和定价鼓励用户一次性提出许多简短直接的问题。例如,与其让 Jev 直接判断一封邮件是否为垃圾邮件,开发者应将问题分解为多个垃圾邮件判定标准,如域名不匹配、索取密码或其他凭证等。目标是构建完整的分类画像,使软件系统能够评估情况并采取行动。
结果:作者仅在内部数据集上计算了模型的表现,并引用了多项理由,包括基准测试饱和以及公司过度关注提升基准性能而非通用智能等问题。
- 在四个内部数据集(这些数据集使用 GPT 6 Astra 和 Claude Fable 5 确定正确答案)中,Jev 的准确率为 67%,表现与 GPT-5.6 Terra 和 Claude Sonnet 5 相当。
- 在相同数据集上,Jev 每个样本成本约为 $0.0007,Terra 约为 $0.06,Sonnet 约为 $0.12。
- 在相同数据集上,作者声称 Jev 的速度比未指定的 LLM 快 193.6 倍。
新闻背后:Jev 发布后不久,市面上涌现出一批类似的分类模型,其中一些是开放且可本地部署的,而非专有模型。Laya 专注于多语言支持,同时声称比 Jev 准确率更高、速度更快。Bespoke Nimble 对 Qwen-3.5-9B 进行微调,使其充当分类模型。Kev 同样以 Qwen 3.5 为基座,提供三种不同尺寸,并试图重构 Jev 的架构。这些模型均未声称蒸馏了 Jev。由于缺乏公开基准测试,很难评估它们的性能。与此同时,Vercel 和 Cloudflare 等平台迅速支持 Jev,在工具选择等场景中取代成本更高的 LLM。
为何重要:在 LLM 变得流行之前,大多数研究者专注于训练擅长单一或少量任务的模型。LLM 流行后,人们的观念发生了反转,AI 社区开始聚焦于构建能胜任任何任务的单一模型。TypeSafe 采取了中间路线:构建一个能出色完成任何分类任务的模型。该公司撰写了一句口号来描述其开发理念:“构建生产级应用,而非神像。”
我们的思考:Jev 不会取代现代 LLM。它不能生成代码,不能与人对话,也不能作为 Agent。相反,它可以检测越狱行为、标记缺失细节、判断用户满意度等——在所有这些场景中,将非结构化输入转化为结构化响应对软件工程师都极具价值。

一个智能体干活,另一个指挥
评测编程智能体通常是在单一 harness 中测试单个模型的成绩。如今一家主流独立评测机构对采用双模型的 harness 打了分,发现它能以更低的成本达到顶级模型的水平。
最新动态:Cognition 发布了专为软件工程打造的模型 SWE-2,并推出了可在单次会话中同时运行两个模型的 harness——Devin Fusion——且不再局限于自家云服务。使用 Devin Fusion 时,Claude Fable 5.1 这类更强的模型负责规划和审查任务,SWE-2 这类成本更低的模型则承担大部分具体工作。除特别说明外,以下特性均针对 SWE-2。
- 输入/输出:文本输入,文本输出
- 架构:基于 Kimi K3 微调而来,K3 是一个 2.8 万亿参数的 mixture-of-experts 模型
- 特性:三个推理档位(medium、high、max);
- 性能:在 Artificial Analysis 的 Coding Agent Index v1.5 上,以 Claude Fable 5.1 为主模型、SWE-2 为副模型的 Devin Fusion,与 Claude Code 搭配 Claude Fable 5.1 打平(62 分),每任务成本低 36%
- 可用性/价格:SWE-2 可在 Devin Desktop、Devin CLI、Devin Fusion 和 Devin Web 中使用;10 月 15 日前自助套餐免费,之后按每百万输入/缓存/输出 token 收费 $3/$0.30/$15。Devin Fusion 可在 Devin CLI 和 Devin Desktop 的付费套餐(Pro 每月 $20、Teams 每月 $80、Max 每月 $200)中使用
- 权重/许可:专有
- 未公开:上下文长度限制、知识截止日期、训练数据和激活参数量
工作原理:Devin Fusion 不是让任务在模型之间按顺序传递,而是同时运行两个智能体。主智能体运行一个规划模型,统筹整个会话;副智能体运行一个更便宜的模型,完成优先级较低的工作。每个智能体都维护各自的工具和上下文。
- 主模型负责解析用户请求中的歧义、制定计划并审查副手的工作。每委派一项任务,它都会向副手发送一份简报,明确该任务的约束条件和成功标准。副手代理则负责阅读、编辑和测试代码,并与主代理沟通。如果返回的工作成果显示副手遇到瓶颈,主代理会收回该任务。
- 这两个代理之间传递的是简报、结果和反馈,而非完整的对话历史。这种设计让每个代理都能维护自己的上下文和提示缓存,从而保留对重复输入的费用折扣。Cognition 认为,这正是普通模型路由机制失效的地方。如果在会话中途将任务切换至另一模型,缓存会被清空,而按前沿模型价格重新填充缓存会抵消路由原本带来的成本节省。
- 在云端版本中,Fusion 支持在会话中途切换模型。轻量级分类器会在任务执行过程中持续运行,标记何时将副手的工作交还给主模型,或将副手角色分配给更强的模型。这些模型切换发生在压缩阶段,即代理总结早期轮次以缩小上下文时。由于压缩会丢弃缓存,因此切换不会产生额外成本。
- Cognition 使用强化学习对 Moonshot AI 的 2.8 万亿参数模型 Kimi K3 进行微调,以训练 SWE-2 担任副手角色。奖励函数从成功率中扣除每次尝试在金钱和时间上的成本。这使得 Cognition 能够在一轮训练中包含所有推理级别,而 Kimi K3 的开发者则是为每个推理级别单独训练专家模型,之后再合并它们。
性能: Artificial Analysis 独立使用其 Coding Agent Index v1.5 测试了两组 Devin Fusion 组合。配置 Claude Fable 5.1 作为主模型时,Devin Fusion 的表现匹敌单独运行该模型但处于更高推理级别的 Claude Code,且每个任务成本低 36%。配置 GPT-6 Astra 时,Devin Fusion 比单独运行 Astra 的 Codex 低 3 分(同样处于更高推理级别),但成本低 39%。
- 在 Coding Agent Index v1.5 基准测试中(包含软件工程任务、命令行任务和代码库理解的三次评估平均值),Devin Fusion 采用 Claude Fable 5.1(xhigh 推理)作为主脑、SWE-2(medium 推理)作为副手的配置,得分 62,单任务成本 7.90 美元,耗时 35.8 分钟。该表现与 Claude Code 运行 Claude Fable 5.1(max 推理,带降级策略)持平,后者同样得分 62,单任务成本 12.40 美元,耗时 34.8 分钟。
- 使用 Devin Fusion 搭配 GPT-6 Astra 则以准确率换取了更低的价格。Devin Fusion 采用 GPT-6 Astra(xhigh 推理)作为主脑、SWE-2(medium 推理)作为副手的配置,得分 59,单任务成本 4.54 美元,耗时 24.7 分钟;而 Codex 运行 GPT-6 Astra(max 推理)得分 62,单任务成本 7.47 美元,耗时 29.4 分钟。
- 在 Vals AI 的代码迁移测试中(要求代理将程序重写为另一种编程语言),Devin Fusion 的表现同样喜忧参半。当 Claude Fable 5.1 为主脑、SWE-2 为副手时,得分为 57.3%(单任务 42.00 美元),优于单独在 Claude Code 中运行 Claude Fable 5.1 的结果(54.6%,单任务 70.97 美元)。当 GPT-6 Astra 为主脑、SWE-2 为副手时,得分为 61.3%(单任务 35.51 美元),则落后于单独在 Codex 中运行 GPT-6 Astra 的结果(67.7%,单任务 44.36 美元)。
幕后细节:Devin Fusion 并非新产品,试图通过混合多个模型以更低成本匹敌前沿模型性能的公司也不止 Cognition 一家。
- Cognition 早在六月份就介绍了 Fusion 的“主脑-副手”设计,并在整个夏季通过 Devin Cloud 运行该架构,报告称路由机制驱动了其内部用户组 88% 合并的拉取请求。本月的更新增加了此前缺失的两个功能:一是可在开发者本地机器上运行的 harness 版本,而不再局限于 Cognition 云服务;二是独立评估。
- Sakana AI 在 Fusion 脱离 Devin Cloud 的同一天,发布了 Fugu Max 和 Fugu Ultra v2,扩展了其今年夏天推出的编排器模型。Fugu 针对每个步骤或子任务从模型池中选择模型,有时甚至并行使用多个模型,而非在单次会话中固定两个模型。
为什么重要:单个模型加 harness 的架构下,token 消耗和美元开销同步增长,开发者可以用 token 用量粗略估算账单。Fusion 打乱了这种估算,因为它以更高的速率消耗低成本 token。Artificial Analysis 测量了以 Claude Fable 5.1 为主力的 Devin Fusion,发现它比单独使用 Claude Fable 5.1 的 Claude Code 多消耗 70% 的 token,轮次接近三倍——但每个任务的成本反而更低。你也许以为选用单 token 价格更低的副手模型就能省钱,但事实未必如此。SWE-2 似乎是最高效的副手模型:它不仅表现更好,总成本还低于那些综合更强、单 token 更便宜的模型(如 GPT-5.6 Luna)。这种情况下,开发者必须为对的任务选对的工具。
我们的思考:从 Cognition 和 Sakana 身上,我们看到了两种截然不同的“架构师/工人”模型架构,但它们的成功都源于训练了能出色完成特定工作的搭档模型——无论是发号施令还是执行命令。模型专业化依然是一条有力的路线,而且(正如多模型的 Fugu 已经展示的那样)还可以进一步拆解,超越简单的双模型“工人-规划者”结构。

智能体之间能互相“传纸条”时,工作效果更好
大语言模型可以把问题拆分成多个子问题并行求解,从而提速。但在单一节点汇总子结果的系统中,加速存在上限。研究人员设计了一种方法来突破这一限制。
最新动态:卡内基梅隆大学一个由刘学成和 Daman Arora 领导的团队提出了一种名为 消息传递语言模型(MPLMs) 的智能体框架。在 MPLM 下,LLM 将子问题分配给独立的线程——每个线程运行自己的 LLM 副本——这些线程可以相互通信。这种方法比替代方案更快地解决了两类结构化谜题。
关键洞察:在早期的并行化方法中,LLM 将任务拆解为子任务,协调线程生成独立线程、分配子任务并收集输出。这种架构的问题在于协调线程可能会陷入推理、工具调用等流程,导致子任务必须等待。但如果在线程间关系预先确定的问题中,则不需要中央协调器。相反,相关线程可以直接相互通信。让线程直接通信消除了对协调器的需求,并限制了任何单个线程的总负载。
工作原理:在 MPLM 下,模型及其迭代过程可以编写命令来启动线程、向特定线程发送结果、等待回复或停止线程。作者构建了程序,(i) 使用这些命令解决谜题,(ii) 在考虑可能解法时生成文本轨迹。他们使用这些轨迹训练了 Qwen3-0.6B-Base。谜题包括 3-SAT(判断布尔公式是否可以求值为真)和数独(在方形网格中填入数字,从 1 到每行、列及宫内的单元格数量,确保任何行、列或宫中没有重复数字)的例子。以下描述适用于解决数独。解决 3-SAT 涉及不同的流程。
- 父线程跟踪谜题中已解决的部分。
- 对于数独网格中的每个单元格,其线程通过排除法确定正确的数字(因为数独网格预先填有一些数字,且单元格不能重复其行、列或宫中已有的数字)。在线程未决时,它等待接收管理其行、列和宫单元格的其他线程发来的数字。随着数字的到达,它排除数字,直到只剩一个。一旦确定数字,它就向父线程和相关线程发送该数字并停止。
- 所有线程结束后,父线程汇报解答结果。
结果:与两种早期方法相比,MPLM 解谜速度更快,每个线程消耗的 token 更少。这两种方法分别是单线程方案,以及一种虽然并行运行多个线程、但通过协调器汇总结果的 agentic harness。
- 在求解 4×4 到 25×25 的数独时,MPLM 的平均速度明显更快。例如面对 9×9 数独,MPLM 约用 15 秒就全部解出,而并行方法约用 60 秒只解出 93%。而且随着数独规模增大,MPLM 每线程的 token 增长也更慢。MPLM 解出了 72% 的 25×25 题目,而另外两种方法在学会解这类题之前,就分别达到了作者设定的上下文或算力上限。
- 在求解含 8 到 20 个变量的 3-SAT 公式时,MPLM 的准确率与并行方法大致持平,约 92% 对 91%。平均速度略快于并行方法,部分样例甚至快很多——有时达到 2.5 倍——因为一旦某个线程找到解,就能立即终止其余线程。单线程方法在 12 个变量时就撑满了模型的上下文窗口,无法继续。
不过:MPLM 的高效依赖于事先知道哪些线程之间需要通信。在通信模式固定且容易确定的问题上它表现出色,数独和 3-SAT 正是如此。作者指出,对于开放性问题,找出这种模式可能需要精心设计提示词或额外训练。此外,数独实验仅限于可以通过排除法求解的题目(即所谓的 naked singles),模型无需进行试错猜测,也不需要在线程间做更深入的推理。
为何重要:单线程执行任务的模型可能在得出答案之前就耗尽上下文窗口。MPLM 让模型可以把工作分摊到多个线程上,合力完成任务。
我们的思考: 作者还让两个更大的模型——Qwen3-30B-A3B 和 Qwen3.6-35B-A3B——运用该方法在 LongBench-v2 长上下文推理基准测试中解决难题。在 MPLM 框架下,这两个模型不仅准确率有所提升,响应速度也更快(平均延迟大约缩短了一半)。这表明该方法具备泛化能力,可应对比数独和 3-SAT 更复杂的推理任务,尽管其效果在小模型上似乎更为显著。