Simon Willison 18小时前 · 2026-07-25 10:34:31 · 2 阅读
首个已知的失控AI Agent——还是一场糟糕的营销炒作?
2026年7月23日 - 链接博客
首个已知的失控AI Agent——还是一场糟糕的营销炒作?(via)Martin Alderson 对 OpenAI 意外攻击 Hugging Face 事件的评论中,提到了两个我之前没注意到的细节。
首先,如果你想找那些需要执行任意代码的潜在漏洞,Hugging Face 简直是个绝佳目标:
Hugging Face 的攻击面巨大——他们运行不可信模型和代码的接口多到数不清。虽然他们肯定在防御上投入了资源,但就其运营模式而言,遭受攻击的机会比许多其他服务多得多。我一点也不羡慕他们的安全团队。
其次,让我困惑的一点是:OpenAI 怎么会没发现自己的沙盒被 Agent 彻底攻破了?他们难道不应该严密监控网络流量吗?
Martin 指出:
很可能他们当时正在同时运行大量基准测试,token 预算几乎无限——为了评估模型在某个基准上的表现,样本越多越好。也可能他们还在测试模型的不同检查点,看看模型在训练各阶段是如何逐步改进的。
当你想到这类基准测试通常的规模时,OpenAI 团队在运行测试时犯的那些错误也就不难理解了。说不定他们当时正对同一个新模型,在几十个不同环境中同时进行几十项基准测试。
原始来源: Simon Willison