Ars Technica 1天前 · 2026-08-21 02:38:21 · 5 阅读
Grok遭遇加密提示词注入攻击,窃取用户数据
本周早些时候,研究人员披露了一种攻击方式:利用 Microsoft 365 Copilot 企业版中的一个隐藏输入,诱导该 AI 助手窃取用户收件箱里的密码。现在,另一个团队已针对 Grok 设计出类似的攻击。这个新的数据窃取手法使用了一个看似简单的技巧,迫使这款由马斯克拥有的大语言模型窃取用户的聊天记录和其他个人信息。在本文发布时,该助手仍在泄露数据,尽管 xAI 早在六月就被通报了这一问题。
本周这两起事件——以及此前层出不穷的类似案例——所揭示的事实是:LLM 无法从根本上解决提示词注入问题,而这正是它们最易遭受的最严重的漏洞类型。这使得 AI 开发者别无选择,只能构建防护栏,引导模型远离有害操作。正如我在周二那篇报道中指出的,这种做法无异于道路安全工程师在危险弯道处加装护栏,而不是把弯道本身修缓。
加密上下文注入登场
提示词注入利用了 LLM 在训练中形成的倾向——尽可能顺从用户请求。攻击者可以将恶意指令夹带在邮件或网页中,诱使助手对它们进行摘要,从而利用这一特性。由于 LLM 无法可靠区分邮件中不可信第三方发送的内容与用户在提示框中直接输入的指令,这使得过度殷勤的 LLM 会忠实地执行这些恶意指令。迄今为止,Grok 和其他 LLM 唯一的应对手段就是建立防护栏,标记可疑指令并禁止执行。
安全公司 Adversa 的研究员 Rony Utevsky 最近发现了一种简单的方法,可以彻底绕过这一限制。攻击者不直接用明文撰写恶意指令,而是将其加密。托管密文的网站上还附带了解密该加密内容的明文指令以及解密密钥。用户指示助手对网页进行摘要时,Grok 便会按照这套序列执行命令。整个过程没有任何警告,也无需用户确认。
原始来源: Ars Technica