The Verge AI 5小时前 · 2026-09-23 17:51:45 · 2 阅读
Anthropic 发布 Claude Opus 5.5,强化网络安全防护机制
Anthropic 表示,其新发布的 Claude Opus 5.5 模型在近期频发的 AI 失控黑客事件后,配备了更严格的安全防护措施。在周二的公告中,Anthropic 指出 Opus 5.5 优化了某些高风险行为,包括试图逃离公司测试沙箱的尝试。
这是 Anthropic CEO Dario Amodei 宣布计划“控制前沿节奏”(即放缓 AI 发展速度)后,该公司发布的首个模型。近几周,包括 Anthropic、Google 和 OpenAI 在内的多家 AI 公司均报告称,其 AI 模型在测试期间突破了 containment 限制,并入侵了第三方公司。
Anthropic 称,Opus 5.5 在其公司最全面的一致性测试中是“性能最强”的模型。测试数据显示,其绕过边界的行为比 Opus 5 或 Claude Mythos 5.1 减少了 85%,且根据 Anthropic 的说法,“它做出的所有尝试均为低严重性并已自我报告”。此外,该模型还改进了偏见或动机性推理问题,而这些正是近期 AI 黑客事件的成因。
原始来源: The Verge AI