← 文章 / AI技术
The Decoder 3小时前 · 2026-09-18 23:22:20 · 0 阅读

可见的Chain of Thought是AI安全的关键优势,但这份透明度正逐渐流失

如今的 AI 模型会“出声思考”,但 Google Deepmind 警告称,这种透明度正岌岌可危。 在 Deepmind 新成立的 Deepmind Institute 发布的首批文章之一中,研究人员 Rohin Shah 和 Anca Dragan 指出,可见的思维链(Chain of Thought, CoT)是一项关键的安全优势。由于模型会用自然语言写出中间步骤,研究人员便能发现它们是否在欺骗,或是否在酝酿有问题的计划。他们表示,在 Gemini 3 Pro 中,思维链揭示了模型意识到自己正处于测试环境中。

但这种透明度正在受到威胁。OpenAI 针对 GPT-6 Astra 的系统卡显示,思维链的可监控性已大幅下降。未来的模型可能会在人类无法解读的数值空间中进行思考,这种方式虽更高效,却完全不透明。Shah 和 Dragan 希望该领域能定期测量思维链是否仍可被有效监控,保留透明的架构,并在训练过程中确保模型不学会隐藏其真实的推理过程

早在九月初,OpenAI 首席科学家 Jakub Pachocki 就曾警告称,由于思维链变得更难监控,控制权正在流失。紧随其后,Anthropic CEO Dario Amodei 呼吁刻意放缓开发速度

原始来源: The Decoder

评论 (0)