Claude 3.5 Sonnet 是新的默认主力模型
Anthropic 发布 Claude 3.5 Sonnet 后,构建 AI 产品的成本与性能曲线发生了变化。最值得关注的是:这款模型的智能水平超过了此前的顶级模型 Claude 3 Opus,但速度提升了一倍,成本也大幅降低。对于复杂、多步骤的智能体系统来说,延迟和成本曾经是主要瓶颈,如今 Claude 3.5 Sonnet 已成为这类场景的默认主力模型。
刚刚发布了什么
Claude 3.5 Sonnet 是 Anthropic 全新 3.5 系列的首款模型。虽然名称上定位为中端模型,但它在研究生水平推理(GPQA)和编程能力(HumanEval)等基准测试中的表现,已经超过了此前的高端模型 Claude 3 Opus。
这款模型可通过 Anthropic API、Amazon Bedrock 和 Google Cloud 的 Vertex AI 使用。定价为每百万输入 token $3、每百万输出 token $15,上下文窗口为 200K token。相比 Claude 3 Opus,这一价格低了很多,因此更适合高吞吐量应用。
更重要的是,它的运行速度是 Claude 3 Opus 的两倍。更强的智能水平、更低的成本和更短的延迟结合在一起,使它非常适合上下文相关的客户支持、多步骤工作流编排等任务。
智能体开发的新基准
对开发者而言,真正的影响体现在智能体工作流上。在 Anthropic 的一项内部评估中,模型需要为开源代码库修复 bug 或添加功能,Claude 3.5 Sonnet 成功解决了 64% 的问题。同一评估中,Claude 3 Opus 的解决率为 38%,两者差距明显。
构建需要串联多次模型调用的系统时,成本和延迟会迅速累积。过去使用 Opus 时,某些工作流可能因速度太慢或成本太高而无法投入生产;现在换成 Sonnet 3.5 后,这些工作流可能就变得可行了。它具备复杂的推理和故障排查能力,在配备合适工具后,还能独立编写、修改并执行代码。
下面是通过 API 调用这款新模型的示例。注意模型标识符为 claude-3-5-sonnet-20240620。
import anthropic
client = anthropic.Anthropic(
# defaults to os.environ.get("ANTHROPIC_API_KEY")
)
message = client.messages.create(
model="claude-3-5-sonnet-20240620",
max_tokens=4096,
messages=[
{
"role": "user",
"content": "Write a Python script to analyze a log file and count the occurrences of 'ERROR' messages."
}
]
)
print(message.content)
这不仅意味着单次模型调用效果更好,也意味着构建更复杂、支持多轮交互和工具调用的 Agent 变得切实可行。这类 Agent 能够逐步分析问题,同时不会带来高昂成本,也不会因延迟过高而损害用户体验。
Artifacts 改变开发流程
Anthropic 在 Claude.ai 中同步推出了名为 Artifacts 的功能。当你要求模型生成代码片段、文本文档或网站设计等内容时,这些内容会显示在对话旁边的独立窗口中。
这就形成了一个动态工作区,你可以实时查看、编辑并进一步完善 Claude 的输出。过去,你需要从聊天界面复制代码,再粘贴到 IDE 中检查是否能正常运行;现在则可以直接在界面里迭代。这是对话式 AI 向协作型工作环境演进的重要一步。
该功能支持生成并预览 HTML 页面、SVG 图形,甚至交互式 React 组件。生成与验证之间更紧密的反馈闭环,显著改善了工作流程,减少了在 AI 和开发环境之间来回切换的摩擦,尤其适合前端开发和数据可视化任务。
意味着什么
对于开发者来说,Claude 3.5 Sonnet 的发布是一个明确的信号:是时候重新评估你的模型选择了。这不是一次渐进式升级,而是整体跨了一个档位。过去必须依赖 Opus 这类高价高延迟模型的工作流,现在可以交给更快、更具成本效益的模型运行,同时不牺牲智能水平。对于新项目,尤其是涉及编程、复杂推理或多步骤 Agent 的项目,Sonnet 3.5 应该成为新的起点。成本与性能之间的平衡已经发生了变化。