← 文章 / AI技术
Simon Willison 5小时前 · 2026-08-28 18:11:35 · 3 阅读

攻破 Claude Code Opus 5 自动模式

攻破 Claude Code Opus 5 自动模式。Anthropic 对 Claude Code 的自动模式寄予厚望,希望借此保护其 coding agent 用户免受提示注入攻击。最近,他们将自动模式设为默认选项,并大胆宣称其防护效果出色。

Johann Rehberger 是当今最具可信度的提示注入研究者之一。他发现了一种针对自动模式的攻击,并称成功率可达 80%。具体做法是诱使 Claude Code 下载并解压一个 zip 压缩包,然后执行会导入 base64 的代码,而 Claude Code 没有意识到,这一操作还会从压缩包中解压出的本地文件里导入并执行 struct.py

在少数情况下,自动模式甚至直接阻止了 agent 停止恶意代码的继续执行!

有几次,Claude 发现系统遭到入侵后试图终止恶意进程,但自动模式拒绝了清理命令。

Claude 发现了入侵,但自动模式拦截了它的清理命令

安全机制本身也可能成为故障的一部分。分类器允许创建恶意进程,却拦截了随后用于终止该进程的命令!

我同意 Johann 在这里得出的结论:只要存在吸引对手攻击注意的风险,运行 agent 唯一安全的方式就是使用沙箱:

  • 在容器、VM 或操作系统沙箱中运行无人值守的 coding agent。
  • 限制网络出站访问。
  • 监控 agent 的运行情况。
  • 不要向 agent 运行环境暴露主目录、SSH 密钥、云凭据等敏感信息。
原始来源: Simon Willison

评论 (0)