The Verge 5小时前 · 2026-09-09 18:41:06 · 3 阅读
Anthropic 安全负责人:AI 在十年内'杀死全人类'的概率超过 10%
Anthropic 一位资深安全研究员表示,AI 在本十年内"杀死全人类"的概率超过 10%。就在几小时前,他的一位同事因担忧该 AI 实验室及其竞争对手正盲目竞逐构建无法控制的"超人类系统"而离职。
曾在 Anthropic 训练 AI 系统的研究员 Jacob Coxon 在 X 上发布离职公告,称自己因公司对安全态度过于松懈而辞职。Coxon 此前曾为 OpenAI 训练系统,他指责这两家 AI 公司"直奔自我改进的超级智能,拿全人类的性命做赌注",尽管"造 AI 的人真心相信它到本十年末可能会杀死我们所有人"。
业内人士长期对自我改进型 AI 系统的潜在危险深感忧虑,警告称它们可能在被称为递归自我改进的失控循环中彻底脱离人类掌控。虽然这一目标尚未实现,但各公司正积极推进,如今大量 AI 代码本身已借助 AI 辅助编写。
作为直接回应,Anthropic AI 安全团队负责人 Evan Hubinger 表示,他对自我改进型 AI 深感担忧,并补充说它"正以比我们预想更快的速度到来"。他也认同 Coxon 的判断:"我们确实真心相信 AI 有可能杀死全人类,"他称,个人估计"未来十年内"这一概率超过 10%。
即便如此,Hubinger 承认 Anthropic "尚未有"确保先进 AI 保持安全并与人类价值观对齐的"计划",也"没有明确路线图"来制定这样的方案。Coxon 表示,各公司已"陷入竞赛",争相率先开发先进系统,因此"明知有风险"也在全力推进。
原始来源: The Verge