与 Accenture 合作开展嵌入式评估
与 Accenture 合作开展嵌入式评估
2026年9月18日我们正与 Accenture 合作,对前沿 AI 进行独立评估。这是践行我们 CEO 在文章《We Must Pace the Frontier》中所作承诺——在 Anthropic 内部引入评估人员——的重要一步。
这项合作将由 Accenture 旗下专业 AI 业务部门 Faculty 牵头,内容包括模型评估与红队测试、对齐评估,以及模型安全防护机制的测试。Accenture 帮助各行业的企业和政府部署 AI,他们对企业实际如何使用 AI 的理解塑造了其安全理念,他们也将把这一视角带入对我们模型的评估之中。
Anthropic 和 Accenture 各自预计在未来五年内至少投入 10 亿美元,用于建设这一领域的能力。
嵌入式评估是一种全新的模式,其具体运作方式的许多细节仍在制定之中。与如今的外部评估人员不同,嵌入式评估人员将在 AI 公司内部工作,拥有接近员工的访问权限。这种权限让他们能够观察模型在训练中如何成形,追踪决定模型构建和部署方式的相关决策,并与员工直接沟通。凭借这一独特视角,嵌入式评估人员可以评估一家公司的实际运作情况,验证其是否履行了安全承诺,并发现盲点。他们还可以报告安全事件,帮助公众更清楚地了解 AI 的收益与风险。
需要说明的是,独立的嵌入式评估人员并不会减轻我们的责任,而是让我们的责任更容易被验证。模型的安全性始终是我们的责任。
目前,关于嵌入式评估人员应获取哪些信息、应如何报告他们的发现,都还没有任何标准;独立评估的资金来源也没有成熟的机制。长期来看,我们认为资金应来自联合资金池或政府渠道,正如我们六月在Advanced AI Framework中所呼吁的那样。鉴于这两者目前都不存在,我们计划与不同的评估机构在不同资金安排下开展合作。
鉴于这项工作的重要性与紧迫性,Anthropic 将直接资助 Accenture 的相关工作。我们同时也在与 METR 及其他非营利评估机构接洽,拟利用其自有资金试点嵌入式评估的部分环节。我们坚信,前沿 AI 需要一个基于共同标准的评估者生态系统。
我们预计,前沿实验室将同时与多个组织合作。本项合作不具备排他性:Anthropic 将在未来几周内公布与其他评估机构的合作计划,而 Accenture 也将以类似身份与其他 AI 开发者展开合作。
我们将继续训练并发布前沿模型,并希望在开发过程中有独立的评估者与我们协同工作。我们在此分享这些早期工作,以便公众和其他 AI 开发者能够了解我们的流程。我们预计,随着领域的发展,我们的方法也将随之演进;随着工作的启动和更多评估者的加入,我们会进一步分享更多进展。