Simon Willison 2026/7/25 · 2026-07-25 10:34:31 · 28 阅读
首个已知的失控AI Agent——还是一场糟糕的营销炒作?
首个已知的失控AI Agent——还是一场糟糕的营销炒作? (via) 马丁·奥尔德森(Martin Alderson)在评论OpenAI针对Hugging Face的意外网络攻击时,提到了几个我之前没注意到的细节。
首先,如果你想找一些需要执行任意代码的潜在漏洞,Hugging Face绝对是个肥美的目标:
Hugging Face的攻击面极其庞大。他们运行着不可信模型和代码的接口多得数不过来。虽然他们肯定在安全防护上投入了资源,但就其运营模式而言,被攻击的机会远比许多其他服务要多。我真心不羡慕他们的安全团队。
其次,一直让我困惑的是,OpenAI怎么没发现他们的沙盒已经被Agent彻底攻破了?他们按理说应该密切监控网络流量吧?
马丁指出:
他们很可能同时在跑大量基准测试,token预算近乎无限——为了摸清一个模型在特定基准上的表现,样本越多越好。也可能他们还在测试模型的不同检查点,观察模型在训练各个阶段是如何逐步提升的。
当你想到这类基准测试通常的运行规模时,OpenAI团队在跑这个测试时犯的错误就容易理解了。说不定他们当时正在几十个不同的环境里,同时对同一个新模型进行了几十项基准测试。
原始来源: Simon Willison