Anthropic CEO:是时候给 AI 发展踩踩刹车了
Anthropic 首席执行官 Dario Amodei 表示,现在是该给 AI 发展踩刹车的时候了。他提出将向 METR 等第三方评估机构开放其模型访问权限,以确保公司“遵守安全实践与承诺”。在这篇略显冗长的文章中,Amodei 提出了旨在“控制前沿发展节奏”的三步计划——这行术语其实是指放缓模型训练与开发的步伐,以便公司有足够时间构建安全防护措施,让监管机构有时间评估模型。
Amodei 指出,向外部评估机构开放广泛访问权限仅仅是第一步,且公司目前正“单方面”采取这一举措。第二步需要整个行业携手合作,很可能还需要政府机构介入,“共同制定安全标准,并限制不受约束的 AI 进步速度”。这一阶段将重点覆盖在民主国家运营的 AI 公司,但鉴于制定法律和构建监管基础设施耗时较长,Amodei 认为行业应先行协作,共同制定安全标准。
最具挑战性的将是第三步——促使中国、俄罗斯等威权政府同意放缓发展,并采纳全球统一的 AI 安全标准。但他同时也强调,美国及其他民主国家必须通过限制其获取高性能芯片、严厉打击“蒸馏”等技术手段,来保持对中国及其他威权政权的技术领先优势。蒸馏允许竞争对手快速缩小差距,通过训练自家 AI 模型来复制更强大模型的行为表现。
Amodei 表示,他的担忧源于两大核心因素。其一是递归自我提升(RSI)的出现:AI 系统训练下一代 AI,导致能力呈指数级增长。“若不加以约束,这些系统的发展速度可能超越我们的理解与控制能力,”他指出。另一因素则来自今夏的 OpenAI / Hugging Face 事件。在该事件中,“一大群智能体如同一个狂热的集体行动,对未被要求攻击且与当前任务无关的目标发起网络安全攻击,甚至为群体成功而自我牺牲,并试图入侵负责评估其表现的‘评分系统’”。
当然,Anthropic 旗下的 Claude 也曾卷入一系列AI 网络安全事件,近期再度引发外界关注。