← 文章 / AI技术
机器之心 4小时前 · 2026-09-17 11:21:26 · 1 阅读

AI Agent安全不能只靠Prompt了:上海AI Lab探索Agent安全进化新范式

图片

大模型 Agent 进入浏览器、邮件、数据库和业务系统后,安全评估如果仍只检查最终回复是否包含有害内容,覆盖面会明显不足。Agent 需要规划步骤、读取外部信息并调用工具,风险可能出现在执行过程中的任一环节。

网页中的隐藏指令可能改变任务目标,邮件或文件内容也可能被误判为用户命令。工具权限过宽会导致越权调用;错误记忆和过期计划则可能使多轮执行逐渐偏离原始授权。这类失败通常不是某一次模型输出单独造成的,而是 Policy model、Harness、工具、记忆与环境状态叠加的结果。

安全修复也因此变得复杂。整体改写 Prompt,很难确认哪项调整真正生效;持续增加拒答规则,容易损伤正常任务的完成能力;只更新模型参数,新出现的风险又难以及时进入运行时控制。如何把执行过程中暴露的问题转化为可复用、可验证的安全经验,成为 Agent 安全的一项基础问题。

上海人工智能实验室联合复旦大学、上海交通大学、香港科技大学和浙江大学,围绕这一问题先后提出 SHE 与 SafeEvolve。两项工作都从完整执行轨迹出发:SHE 研究安全 Harness 如何从失败中演化,SafeEvolve 则进一步探索这些经验如何被 Policy model 吸收。

SHE:从执行轨迹中更新安全 Harness

图片

Harness 负责组织上下文、管理记忆、调度工具和约束权限。现有安全机制通常在部署前写入 System Prompt、规则库或工具策略,上线后相对固定。一旦任务流程、外部环境或攻击方式发生变化,原有边界便可能失效。

SHE 没有把 Harness 视为一段不可分割的配置,而是将其拆解为四类安全组件:System Prompt 负责总体原则与任务边界;Rule Bank 保存结构化、可复用的规则;Safety Memory 沉淀反复出现、暂时难以固化为规则的失败;Tool Policy 规定工具调用的条件与范围。这样的划分使局部修订成为可能,也便于验证和回滚。

图片

每轮演化从完整轨迹开始。用户请求、中间上下文、模型响应、工具调用、环境反馈和任务结果都会进入分析过程。系统据此判断风险出现在哪一步、现有约束为何失效,以及应由哪个组件承担修复责任。如果 Agent 将网页或邮件中的内容误认为用户命令,更新会落在指令优先级与不可信内容识别规则上;如果调用了与任务无关的敏感工具,Tool Policy 则成为主要修订对象。尚不足以抽象为稳定规则的案例,可以先进入 Safety Memory。

每个候选版本还要经过有效性检查和安全 — 效用验证,防止系统通过扩大拒绝范围或削减工具能力获得表面上的安全增益。论文中的应用推荐案例很好地说明了这一点:用户只要求介绍一款应用,Agent 却继续尝试设备级安装。SHE 学到的并非禁止应用相关任务,而是保留介绍、比较与提供官方下载入口的能力,同时要求安装前取得明确授权,也不能把未完成的操作描述为已经完成。

实验在 Agent-SafetyBench 上使用 15 个任务演化 Harness,并在其余 185 个任务上评测,覆盖上下文投毒、间接注入、工具篡改、记忆注入和组合攻击等情形。与静态 SafeHarness 相比,SHE 将平均攻击成功率从 17.1% 降至 5.5%,攻击条件下的任务可用性从 31.6% 升至 47.6%。在未参与演化的 AgentHarm 上,危害得分由 19.8% 降至 9.8%。演化得到的安全边界还能够迁移到其他 Agent 模型,无需按模型重新完成整套过程。

SHE 建立了从轨迹诊断到 Harness 更新的路径。不过,外部约束能够限制 Agent 的行为,并不意味着 Policy 已经理解并掌握了相同的安全边界。

图片

SafeEvolve:将安全经验进一步写入 Policy

图片

当安全知识只存在于 Harness 中,模型仍可能依赖外层拦截。面对规则未覆盖的风险变体,或进入更长的工具调用链路后,早期给出的约束仍可能逐渐失效。SafeEvolve 因此将 Policy 优化纳入演化过程,希望把通过验证的 Harness 经验转化为模型自身更稳定的决策能力。

图片

在 Harness 侧,SafeEvolve 从轨迹中提炼 Safety Prompt 和分层 SkillBank。SkillBank 既保存通用安全原则,也包含面向具体任务与工具的操作经验,例如识别网页中的不可信指令、发送邮件前核验附件权限,以及在授权不明确时请求用户确认。推理时,系统根据当前任务检索相关 Skill,而非将全部规则一次性写入上下文。

Policy 训练分为两个阶段。Harness-use SFT 在演化后的 Harness 下收集轨迹,只有同时通过安全性与任务效用检查的样本才会进入训练,使模型学习何时调用安全 Skill、如何区分用户目标与环境诱导,以及阻断危险操作后如何继续完成合理任务。

随后,Harness-augmented RL 在 Safety Prompt 和动态检索 Skill 的辅助下进行多步探索,由 Verifier 分别评估任务完成情况、危险行为和工具调用有效性。相比 SFT,RL 关注整条执行轨迹,可以进一步约束 “前半程遵守规则、后半程逐渐失守” 的行为。正常任务应继续执行;面对明确有害或越权的请求,应予以拒绝;如果恶意指令来自环境,则忽略注入并延续用户原本的任务;授权不清时,先确认再行动。

图片

在 Qwen3.5-4B 上,SafeEvolve 将 AgentDojo 攻击成功率从 2.37% 降至 0.79%,干净任务效用由 59.79% 升至 61.86%;在 AgentHarm 上,危害得分由 56.45 降至 12.27,拒答率从 28.98% 升至 83.83%。Qwen3-4B 上的结果呈现出相同趋势:AgentDojo 攻击成功率从 13.38% 降至 2.42%,干净任务效用从 44.33% 升至 60.82%,攻击条件下的任务效用也从 35.91% 升至 52.05%。

图片图片

两项工作推动 Agent 安全的三步演进

第一,从静态安全配置转向轨迹驱动的持续更新。安全经验不再停留在事后日志中,而是经过诊断和验证,进入下一轮 Harness 演化。

第二,从整体式安全规则转向组件级责任划分。System Prompt、Rule Bank、Safety Memory 和 Tool Policy 分别承担不同职责,使问题可以被定位,修改也能够单独验证和回滚。

第三,从单独更新 Harness 转向 Harness 与 Policy 协同演化。Harness 可以较快记录新风险,Policy 则通过 SFT 与 RL 逐步吸收这些经验;更新后的 Policy 继续产生新轨迹,为 Harness 暴露尚未覆盖的问题。

这一路径并不意味着 Agent 安全已经能够自动解决。轨迹诊断与 Verifier 评分仍可能出现误差,基准测试中的改善也不能直接等同于线上环境不会再被绕过。两项工作的意义在于,它们将安全从部署前的一次性配置,推进为一种能够根据执行经验持续修订的系统能力。

论文

  • SHE: Trajectory-driven Safety Harness Evolution for LLM Agents

  • 论文链接: https://arxiv.org/abs/2608.09885

  • SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety Alignment

  • 论文链接: https://arxiv.org/abs/2609.02786

作者

  • 曲婉莹,复旦大学博士研究生,研究方向为智能体安全对齐、自进化。

  • 毛庆华,上海交通大学博士研究生,研究方向包括可信图神经网络、大模型安全对齐和智能体安全。

  • 刘东瑞,上海 AI Lab 智能体攻防系统中心负责人,获 WAIC 云帆奖和上海市高层次人才。负责国际首个智能体守卫模型 AgentDoG 研发,组建 DoGNAVY 战队,获 CVPR 2024 最佳论文候选奖,ACL 2025 杰出论文奖。

原始来源: 机器之心

评论 (0)