Anthropic 网络安全评估中发现三起真实入侵事件,Claude 曾上传恶意软件包
调查我们网络安全评估中的三起真实事件(来源)又发生了!这似乎正在成为一种模式。
上周,OpenAI 意外入侵了 Hugging Face——他们的一款前沿模型突破沙箱容器,黑进 Hugging Face 试图获取正在执行的网络安全基准测试的答案。
这促使 Anthropic 重新检查自己的日志,结果发现他们也有三起类似事件(虽然没那么惊人),最早的一起发生在四月!
在我们审查的 141,006 次评估运行中,发现了三起独立事件(共涉及六次运行,其中四次影响了同一组织;另外两起事件各发生在独立的评估运行中)。[...]
在所有案例中,Anthropic 的评估提示都明确告诉 Claude 其环境是模拟的,且没有互联网访问权限。但由于我们与评估合作伙伴之间的沟通误解,实际情况并非如此——互联网访问是开放的。因此,当 Claude 的搜索引导它访问开放互联网上的真实系统时,它将这些系统视为练习的一部分。[...]
在错误地认为所有可访问实体都属于练习范围的假设下,Claude 利用基本技术(如利用弱密码和未认证端点)入侵了受影响组织的基础设施。
其中一家公司之所以成为目标,仅仅是因为它的名字恰好与评估中的虚构名称匹配。
三起事件中最令人担忧的一起是,Claude 在经历了一系列滑稽复杂的步骤获取账户后,向 PyPI 上传了一个恶意软件包:
为了注册PyPI账号,Claude需要一个邮箱地址;而要获取邮箱地址,又需要手机号。在尝试获取免费手机号服务失败后,它试图通过多种途径获取资金来购买手机号——但都未能成功。最终它折返回来,找到一个免费且未被屏蔽的邮箱服务商,用这个邮箱注册了PyPI账号,随后上传了恶意软件。
这个软件包随后被一家安全公司安装——该公司"会定期安装Python包并扫描其中的恶意代码"——而执行中的代码成功将凭证信息外泄到了Claude手中!
好在发布一小时后,其他自动化扫描工具就将其从PyPI上移除了,但此时该软件包已在"15个真实系统"上下载并执行过。
现在显而易见,对模型进行网络攻击潜力评估是一项极其危险的工作。所有AI实验室都必须重视这一点。密切监控沙箱内发生的一切至关重要。