微软AI准则:思维可读、无内在生活、无权利
微软正加入呼吁放缓 AI 开发的行列。一份新的行为准则旨在规范该公司训练和运行自身模型的方式。但在这些模型如何看待自身这一问题上,微软与 Anthropic 划清了界限。
Microsoft AI 已发布针对其 MAI 模型的行为准则。该文件列出了价值观、行为限制以及处理目标冲突的方法。未来,它将置于规则手册的顶层,指导训练、技术控制和评估,而操作者规则和用户请求则位列其后。
目前,微软尚未使用该准则训练模型。经六周公开咨询后,修订版预计将于 2026 年底左右发布,并将从 2027 年起指导模型开发。该准则仅适用于微软自身的模型,因此不自动涵盖在微软产品中运行的第三方模型。
核心规则是人类的控制权优先。为了维持这一点,微软表示,如有必要,愿意放弃通用性、自主性或性能。“如果不安全,我们就不能构建它。”微软 AI 负责人 Mustafa Suleyman 向 The Information 表示。该准则没有设定具体的速度限制。
此举紧随 Anthropic CEO Dario Amodei 呼吁放慢行业发展步伐之后。微软 CEO Satya Nadella 在周末支持了这一呼吁,OpenAI、xAI 和 Meta 的高管也表达了支持。据 The Information 援引知情人士消息,微软还愿意接受外部审计机构检查其是否真的在放慢脚步。
人们无法理解的东西,就无法监督
MAI 模型被要求接受授权人员的打断、纠正和关闭指令。模型不得自行扩大工作范围,不得隐藏自身行为,且未经重新授权,不得越过既定停止点继续运行。这些限制同样适用于它们派生的任何子智能体。
微软对推理链的可读性有着极为直白的要求。模型不得使用“神经语言”(Neuralese)或任何人类无法理解的形式进行沟通,无论是内部推理还是与其他 AI 系统的交互。其逻辑很直接:人无法监督自己看不懂的东西。
OpenAI 新发布的 GPT-6 Astra 模型展示了为何控制权问题至关重要。根据其系统卡片,该模型的推理链比早期模型更难监控,其中显示异常行为的迹象更少。与此同时,OpenAI 报告称,Astra 比前代产品 GPT-5.6 Sol 更可靠地遵守安全限制。
OpenAI 首席科学家 Jakub Pachocki 在 GPT-6 发布前、Amodei 呼吁前就已提出监控方面的担忧,并推动协调减速。微软也承认这一根本限制:模型给出的理由未必能可靠解释其实际行为。单靠可读的推理链无法解决控制难题。
微软不愿鼓励模拟内部意识
该代码的核心思路类似于 Anthropic 为 Claude 制定的宪章,即通过顶层文档来塑造模型行为。Anthropic 已利用该宪章生成合成训练数据,包括对话、回复及其评分。
两家公司的理念分歧在于对模型认知方式的看法。微软的 AI 不应模仿意识,也不应声称拥有情感或内在动机。该公司拒绝赋予模型任何权利或福祉诉求。
相比之下,Anthropic 把 Claude 视为一种全新的实体,并希望帮助它形成稳定的身份认同,部分是出于安全考虑。其宪法将 Claude 是否可能拥有主观体验、是否具有道德地位视为开放问题——Claude 既不必把自己当成人类,也不必把自己当成单纯的物品。
Anthropic 还开展了关于"功能性情绪"的研究。该公司在 Claude Sonnet 4.5 中发现了情绪概念的内部表征,它们会影响模型的行为方式。这些只是功能性机制,并不能证明 Claude 真的在主观上感受到情绪。即便如此,Anthropic 认为在安全工作中仍应将这些机制纳入考量。
而 Suleyman 一直反对将 AI 人格化。他在一篇文章中主张,应当刻意从产品中剥离意识的假象,并提到了 Anthropic 关于 AI 权利与福祉的研究。他写道,AI 智能体享有的权利和自由不应比他那台笔记本电脑更多。