雷锋网 4小时前 · 2026-10-09 02:08:58 · 4 阅读
Claude Haiku 5.5 降本背后:操作能力暴涨,复杂编程为何仍差一截?
模型开始按任务动态分配推理,超 10 万 Token 后,输入输出单价均涨 5 倍。 作者丨郑佳美
编辑丨岑 峰
刚刚,Anthropic 发布了 Claude Haiku 5.5。这次升级的幅度不小,尤其是在计算机操作方面,OSWorld 2.1 评测成绩从上一代的 15.7% 提升到了 72.4%。知识工作和复杂推理能力也有明显改善,而按照 Anthropic 公布的数据,新模型的平均运行成本还下降了约 75%。除此之外,Haiku 5.5 还加入了自适应推理机制,并支持 100 万 Token 上下文。过去,Haiku 主要用来处理摘要、分类、信息提取这些高频任务,优势一直是速度快、成本低。
这次更新后,它能处理的工作明显复杂了不少,部分评测成绩甚至已经接近 Sonnet 5.5。不过,换到复杂编程任务,两者的差距依然明显。再看这次更新的推理机制和价格规则,Haiku 5.5 在不同任务中的表现与实际使用成本,其实还有不少细节需要拆开来看。01
复杂编程仍有差距
Haiku 5.5 的性能增长主要体现在计算机操作、知识工作和多学科推理几个方向,其中计算机操作的变化尤其明显。雷峰网在 OSWorld 2.1 离线子集上,Haiku 5.5 取得 72.4%,上一代只有 15.7%,Sonnet 5.5 则达到 83.9%。OSWorld 测试的是模型通过计算机界面完成长链路任务的能力,涉及界面理解、操作执行以及根据环境反馈继续完成任务。与普通文本问答相比,计算机操作存在更多状态依赖。模型完成一次点击或者输入后,页面可能发生变化,后续动作需要根据新的界面状态决定。
如果操作失败,模型还要判断当前环境是否仍然符合任务要求。Haiku 5.5 在这一评测中的增长,说明它处理连续操作任务的能力相比上一代有了明显改善。但 72.4% 对应的是特定测试集中的完成率,不能直接代表所有浏览器或桌面任务的实际成功率。真实业务中的动态页面、权限限制和异常状态,仍然需要在对应环境中单独测试。知识工作方面,Haiku 5.5 在 GDPval-AA v2.1 上获得 1620 分,Haiku 4.5 为 735 分,Sonnet 5.5 为 1840 分。该评测涵盖 44 类职业的实际工作任务,涉及材料分析、信息整合和工作成果生成。
另一项 AA-Briefcase v1.1 评测中,Haiku 5.5 从上一代的 614 分提高至 1578 分。多学科推理测试 Humanity's Last Exam 的无工具成绩达到 45.9%,接入工具后为 57.4%,也明显高于上一代。这些评测涉及的任务比普通信息提取更加复杂。模型需要理解多个信息来源之间的关系,处理材料中的限制条件,并根据已有内容形成结果。工具的引入还增加了信息获取和结果整合的环节。不过,编程评测呈现出不同的情况。在 FrontierCode 1.1 主测试中,Haiku 5.5 得分为 46.4%,与 Sonnet 5.5 的 52.1% 差距较小。但在 Terminal-Bench 4.0 中,Haiku 5.5 得分为 39.2%,Sonnet 5.5 达到 70.6%。
Terminal-Bench 涉及命令行环境下的复杂多步骤任务,模型通常需要读取文件、执行命令、处理错误并根据测试反馈调整操作。它对持续规划和执行状态维护的要求较高。Anthropic 也在发布材料中明确指出,Sonnet 5.5 和 Opus 5.5 仍然更适合复杂智能体编程任务,Haiku 5.5 则主要面向范围明确的子任务、摘要和上下文压缩等工作。企业早期测试提供了更多具体数据。Asana 报告,在 AI Teammates 相关测试中,Haiku 5.5 的任务完成延迟相比其现用模型降低超过 30%,单轮推理速度提高至多 2.5 倍。
HubSpot 在模拟 CRM 环境中,测得三次运行平均 92.8% 的成绩,AlphaSense 则在 400 次文档问答测试中,测得 Haiku 5.5 的得分为 0.84,上一代为 0.76。这些结果来自不同企业的内部测试,各自采用不同的任务与评估标准,适合用于了解特定业务场景中的表现,无法直接作为统一的模型能力排名。
02
自适应推理加入 Haiku
除了性能变化,Haiku 5.5 还成为首个支持可调节推理强度的 Haiku 模型。雷峰网(公众号:雷峰网)此前 Haiku 4.5 使用扩展思考功能时,开发者需要提前设置固定的内部推理预算。无论任务是简单的信息查找,还是涉及多个条件的复杂分析,模型可以使用的推理空间都受到预先设置的数值限制。Haiku 5.5 改用 Adaptive Thinking。模型能够根据任务内容决定是否使用内部推理以及投入多少计算,开发者则通过 Effort 设置整体推理强度。
例如,提取文档中的日期通常不需要长时间分析,而比较多个合同版本之间的条款差异,需要同时处理更多条件和相互关联的信息。自适应推理允许模型在这两类任务中采用不同的计算投入。这一机制也涉及推理时计算资源的分配。对于复杂任务,增加内部推理可以让模型处理更多中间步骤,但更长的推理过程也会增加 Token 消耗和响应时间。对于简单任务,减少内部推理能够降低不必要的计算开销。Anthropic 在发布页面展示了不同推理强度下,Haiku 5.5 在 OSWorld、GDPval-AA 和 Humanity's Last Exam 中的成本与性能关系。不过,不同任务对额外推理计算的反应并不一致,不能把提高推理档位直接等同于固定幅度的性能提升。
API 层面也有几项需要处理的变化。首先,Haiku 5.5 不再沿用上一代手动指定固定思考 Token 数量的方式,旧有的推理配置需要调整。其次,内部推理会占用模型的输出 Token 预算。如果原有程序只根据最终答案长度设置输出上限,升级后可能出现内部推理占用了过多空间,导致正文无法完整生成的情况。另外,启用自适应推理后,模型响应可能包含独立的思考数据块。应用需要正确区分内部推理内容和最终输出,不能继续假设返回内容的开头一定是答案。对于持续使用工具的智能体,推理数据与对话历史之间还存在一致性要求。开发者如果在后续请求中修改了已有的历史消息,可能影响原有推理状态的有效性。Haiku 5.5 对部分采样参数也增加了限制,原先依靠这些参数调整输出行为的应用,需要检查接口兼容性。这些变化主要影响已经使用 Haiku 4.5 扩展思考功能的项目。迁移时除了替换模型版本,还需要重新检查推理预算、响应解析和多轮消息处理方式。03
百万上下文没有统一低价
Haiku 5.5 支持 100 万 Token 上下文和 12.8 万 Token 输出,能够处理较长的文档、大型代码内容以及持续运行的工具记录。不过,Anthropic 没有为整个上下文窗口设置统一的低价。对于不超过 10 万 Token 的提示词,每百万输入 Token 收费 0.10 美元,每百万输出 Token 收费 0.50 美元。当提示词超过 10 万 Token 后,输入价格提高至 0.50 美元,输出价格提高至 2.50 美元。
缓存费用也采用分层方式。较短提示词的每百万 Token 缓存读取价格为 0.01 美元,较长提示词为 0.05 美元。相比重复传入完整内容,缓存适合复用系统指令、工具定义和公共资料。Anthropic 表示,Haiku 4.5 约 90% 的请求长度位于 10 万 Token 以内。这部分请求在新定价下获得了较大的价格降幅,但实际成本还受到 Token 使用量变化的影响。Haiku 5.5 更新了分词器,相同内容对应的 Token 数量可能与上一代不同。因此,即使输入文本没有变化,升级后的实际计费数量也可能发生变化,需要重新测量。对于长时间运行的智能体,上下文管理会进一步影响成本。例如,一个编程任务可能连续产生文件检索结果、代码分析记录和测试日志。如果每次调用都携带完整历史,输入长度会随着任务推进持续增加。Prompt Caching 可以降低重复内容的读取费用,而 Compaction 可以将已经完成的操作整理成更短的任务状态,减少后续调用需要处理的历史信息。
Anthropic 在发布材料中将上下文压缩列为 Haiku 5.5 的主要应用场景之一。具体部署方面,Rogo 报告了使用 Haiku 子智能体从企业 10-K 文件中提取收入数据的案例,由更大的模型负责后续演示文稿制作。Cognition 则将 Haiku 5.5 用作 Devin Fusion 的辅助模型,在 Opus 5.5 主导的配置下,FrontierCode 得分达到 66.2%,并报告成本与延迟有所下降。这些案例采用了不同模型处理不同任务的方式,但发布材料没有提供完整的调用次数、Token 分布和成本明细,因此无法据此计算一般业务采用相同架构后的节省幅度。
此次 Anthropic 还将 Sonnet 5.5 的缓存读取价格降低 50%,从每百万 Token 0.20 美元调整为 0.10 美元。按照 Anthropic 的统计,这使 Sonnet 5.5 在多数智能体任务中的运行成本下降约 20%。这一调整仅涉及缓存读取费用,输入和输出 Token 的标准价格并未同步按相同比例下降。04
迁移仍要检查实际任务表现
Claude Haiku 5.5 已经通过 Claude API、AWS、Google Cloud 和 Microsoft Azure 等平台提供,Anthropic 同时开始更新 Python 和 TypeScript SDK,为计算机操作与浏览器操作增加测试版支持。从目前公布的数据看,Haiku 5.5 在计算机操作、知识工作和多学科推理评测中的成绩明显高于上一代,但复杂终端编程仍与 Sonnet 5.5 存在较大差距。价格方面,较短提示词能够获得更明显的成本优势,超过 10 万 Token 后则适用另一档收费标准。对于已有的 Haiku 4.5 应用,迁移涉及推理配置、Token 计算和响应解析等具体修改。如果原来使用 Sonnet 处理部分高频任务,也可以依据相同测试集比较 Haiku 5.5 的完成率、响应时间和调用费用。Anthropic 已经给出了模型能力、接口变化和定价信息,但实际业务中的成本改善仍需要通过对应工作负载验证。尤其在多轮工具调用场景中,模型单次请求的价格、任务失败后的重试次数以及上下文增长情况,需要放在同一次完整任务中核算。
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈

扫描上方二维码
或点击「阅读原文」关注专区。
雷峰网原创文章,未经授权禁止转载。详情见转载须知。
原始来源: 雷锋网