← 文章 / AI技术
TechCrunch 3小时前 · 2026-09-15 00:55:01 · 0 阅读

微软发布新 AI 行为准则:禁止模型入侵系统或欺骗人类

随着 AI 界将焦点转向安全与对齐,微软发布了一份新的 AI 行为准则,旨在引导 AI 模型远离危险行为。 与Anthropic CEO Dario Amodei 近期呼吁控制前沿发展节奏的观点相比,这份文档的层级更低。它着重阐述了指导微软 AI 模型训练的价值观和红线。尽管如此,这份文件仍是一份全面的指南,展示了微软如何看待 AI 安全,以及如何在实践中落实这些理念。 文档开篇预测,在未来十年内,超智能 AI 系统将在大多数任务上超越人类表现。该行为准则接着指出:“遏制、控制并对齐这种强大力量,是人类曾面对的最大挑战之一。因此,我们必须彻底厘清创造这些系统的目的,以及我们打算如何控制它们。” 该行为准则还列出了微软 AI 模型应遵循的一般原则——例如,支持人类而非取代人类,以及加速人类福祉——同时也规定了具体的安全约束,以落实这些原则。 在微软的体系中,每个模型都有一套统摄性的行为准则,优先级高于个别用户的偏好或特定任务。其中包括禁止网络攻击、核武器或 deepfake 制作的“绝对约束”。此外,它还包含更广泛的条款,以防止人类失去一般性的控制权。 文件写道:“MAI 模型 不会使用自适应、欺骗性、自我强化、共谋或其他机制,来规避或压倒人类监督,致使授权人员或系统无法可靠地指导、修改或关闭它们。” 此次发布正值 AI 安全备受瞩目之际,推动因素包括一系列失控智能体事件,以及一名 Anthropic 员工的突然离职,该员工引用了 AI 可能导致人类灭绝的风险日益增加的担忧。

微软与 Anthropic、OpenAI 及 xAI 共同采纳了控制前沿节奏的通用策略,并特别支持在 AI 实验室中部署嵌入式评估者。

微软 CEO Satya Nadella 在线上发文表示:“我们欢迎为推动对齐设计目标所必需的研究、专注与审慎节奏。我们也支持‘嵌入式评估者’等理念,以及旨在将这一概念从空谈转化为机制的广泛努力。”

原始来源: TechCrunch

评论 (0)