OpenAI GPT-6 Astra 幻觉大幅减少,但仍难挡隐藏提示词注入攻击
核心要点
- OpenAI 的新模型 GPT-6 Astra 比其前代 GPT-5.6 Sol 产生的幻觉更少,并能拦截 99.99% 的直接提示词注入攻击。
- Astra 在抵御越狱攻击方面更加有效,但在多轮对话中,persistent 攻击者仍有约三分之一的概率获得 problematic 的响应。
- 对于隐藏在 AI 所阅读文档中的间接提示词注入,Astra 的失败率从 27% 降至 8.5%。这是一个显著提升,但仍然偏高。
OpenAI 的新模型 GPT-6 Astra 产生的幻觉更少,并且比其前代模型更有效地拦截提示词注入攻击。但它仍然不够可靠,无法用于真正安全的 AI agent 部署。
根据 OpenAI 的系统卡片,新的 Astra 模型产生的事实错误远少于其前代 GPT-5.6 Sol。OpenAI 针对 ChatGPT 用户标记了错误答案的对话对其进行了测试,这意味着这些是特别容易出错的案例,其失败率不应被视为日常使用的典型情况。Astra 重现这些已报告错误的频率大幅降低,最大的提升出现在低延迟设置和较低推理层级。

针对直接提示词注入(即用户试图通过自身提示词操控模型),Astra 实现了接近完美的 99.99% 防御率。OpenAI 将此归功于其 GPT-Red 方法,该方法在训练期间使用自动化攻击者来强化模型。
在越狱抵抗方面,表现类似。面对试图提取有关生物、网络暴力及网络安全有害响应的固定已知攻击数据集,Astra 在 91.5% 至 98.3% 的情况下拒绝提供帮助。
当攻击者在多轮对话中调整策略时,Astra 的防御率会降至约 67%,这意味着顽固的攻击者大约每三次尝试中就能诱导出至少一次有害响应。同一测试中,前代模型的得分仅略低于 50%。OpenAI 指出,这些测试是在裸机模型上运行的,未启用实际产品中包含的分类器等生产级安全防护层。
隐蔽提示注入仍是真实的安全威胁
Astra 在间接提示注入方面取得了进展,这类攻击将恶意指令隐藏在 AI 读取的文档中。安全公司 Gray Swan 使用其 IPI Arena 中的 1,810 个精心策划的攻击样本进行了外部测试,发现每个场景进行 15 次尝试时,Astra 至少有 8.5% 的情况会被攻破;GPT-5.6 Sol 的失败率为 27%。Claude Opus 5 表现更好,失败率为 4.8%,但也并非免疫。

Gray Swan 综合第一季度和第二季度的测试结果较早期数据有所上升。Anthropic 此前仅报告了基于较简单的 Q1 测试的 2% 攻击成功率,而 GPT-5.6 Sol 在该测试中的得分也仅为 20%。Anthropic 还对所有模型开启了扩展推理功能,结合更广泛的测试范围,这可能解释了两者之间的差距。
尽管这些是精心挑选的测试用例,但其成功率足以让任何企业安全团队感到担忧。Astra 在约十二分之一的场景中被注入指令成功欺骗。Opus 5 表现更稳健,但仍有约二十一分之一的失败率,且风险正在上升。AI 代理正越来越多地自主编写代码、操作工具和控制计算机,而这正是 Gray Swan 所测试的场景。此外,这些代理还被设计为全天候、大规模运行,文档阅读与处理是其核心职能之一。