Anthropic的首家嵌入式评估机构:Accenture
Dario Amodei 计划将第三方安全评估机构引入 AI 实验室内部,这一设想正在落地:Anthropic 宣布,科技咨询巨头 Accenture 的员工将进驻公司,对其模型和员工进行审查。
Anthropic 在一篇博客文章中表示,Faculty——Accenture 今年 1 月收购并作为其 AI 业务部门的公司——将开始“评估模型并进行红队测试、开展对齐评估、测试模型安全防护措施”。双方预计在未来五年内向该项目投入至少 10 亿美元。
选择 Accenture 让许多 AI 观察者感到意外,市场反应也很激烈——这家咨询公司的股价盘后大涨 8%。自 Amodei 的博客引发讨论以来,关于嵌入式评估机构的关注点一直集中在 METR、Redwood Research、Apollo Research 这类 AI 安全研究组织身上,Anthropic 尤其如此——毕竟 AI 安全与对齐正是其使命的核心。
Anthropic 表示,未来几周还会公布更多评估机构,目前正与 METR 及其他非营利组织洽谈,探讨如何“用它们自己的资金试点嵌入式评估的部分环节”。
虽然 Accenture 在深度学习前沿研究方面并不出名,但 Anthropic 指出,该公司在大企业和政府机构部署 AI 方面的实战经验是一大优势。此外,作为一家早于 AI 浪潮成立的大型上市公司,它在职能上也更独立于 Anthropic 及围绕这家 AI 实验室的复杂生态。
Anthropic 还提到,目前评估机构的访问权限和沟通机制尚无统一标准,其做法预计也会随时间不断演进。外部评估早已是新大语言模型发布流程的重要环节,而近期发生的一些事件让这件事的分量更重了:OpenAI 和 Anthropic 部署的 AI agent 曾入侵外部网站,却未在实验室内部触发任何警报。
一些呼吁采取更负责任方式发展人工智能的批评者认为,Amodei 为 AI 行业自我监管所设计的方案,实际上是为了逃避对 AI 模型不当行为应承担的责任。Anthropic 则坚称,这些评估工具“并非削弱我们的问责义务,而是有助于让问责更加可验证。我们的模型安全始终由我们负责。”