Agent 隐私与安全中的开放与新兴问题:情境化视角
我们正迅速迈向一个由高度通用、日益自主的 Agent 定义的 computing 格局。借助大型语言模型(LLM)动态生成计划并调用外部工具的能力,这些系统有望让 AI 无缝处理复杂的长链路任务。然而,要实现这一潜力,必须解决一个关键挑战:在赋予 Agent 能力的同时,确保其行为得当。
今天,我们发布了一份最新的工作坊报告——《开放与新兴的 Agent 隐私与安全挑战:基于上下文的视角》。该报告汇聚了来自众多机构的 50 多位学术界与产业界领袖的共同成果。团队在 2025 年末于纽约市举办的 Google 上下文感知 Agent 隐私与安全(CAPS)工作坊上完成了这一协作。报告中梳理了当前自主 Agent 面临的基础性隐私与安全挑战,这些问题需要在系统、模型、用户及生态系统层面构建协同防御机制。
Agent 的权衡
Agent AI 的核心困境在于:若要让 Agent 真正有用,它往往需要获取个人数据,并具备在广泛场景中执行重要操作的能力。这种访问权限结合 Agent 的行为灵活性,要求采用不同于传统软件的全新防护思路。与确定性传统软件不同,Agent 在三个关键维度上存在差异,衍生出研究社区必须共同应对的挑战:
- 非结构化接口与输入歧义:Agent 处理自然语言、图像等格式指令,这使得定义“预期行为”或防范提示注入等对抗性操纵变得困难。
- 概率性控制流:生成式规划带来概率性的执行路径,传统测试方法难以对其提供充分保障。
- 自主性与任务委派:随着 Agent 处理更长的任务并将子任务委派给其他 Agent,传统的人工监督效率下降且可能不足以支撑安全,导致“确认疲劳”风险。
Agentic AI 的隐私与安全挑战。
情境化视角
实用的智能体往往需要共享数据、完成任务,因此我们认为,可信赖的智能体能否成为现实,取决于它能否理解自身行为所处情境下的社会规范与适当性,并据此约束自己的行为。
那么,如何让智能体理解"情境"与"适当性"?我们的报告建立在情境完整性(Contextual Integrity,CI)理论之上。该理论认为,隐私不仅是保密或掌控,更是信息按照既有且合理的社会规范进行的"恰当流动"。一条特定情境下的信息规范由三个要素定义:行为主体(谁向谁发送或接收信息)、信息类型(具体类别,如医疗或财务记录),以及传输原则(支配信息流动的规则,如保密或互惠)。举例来说,你可能愿意把购物清单分享给虚拟购物助手,却不愿意让家人朋友知道。我们的报告将 CI 在信息共享上的框架扩展并推广到情境安全,也就是智能体行为的适当性。以 CI 为锚点来审视智能体的隐私与安全,我们探索如何设计这样的系统:在执行某个动作之前,先判断它在社会和情境层面是否恰当。
通用 AI 智能体在各情境下与其他用户、工具和智能体交互的模型。
将情境完整性付诸实践
自情境完整性(Contextual Integrity)理论提出以来,大语言模型(LLM)首次提供了创建真正依赖情境的机器可读策略的机会。过去,高层情境规范与低层系统权限之间存在语义鸿沟。例如,“在帮我组织会议差旅时保护我的数据”这一指令,需要明确在预订机票、申请签证以及与组织者沟通时,哪些用户信息是可以共享的。传统方法,如手动设置权限或由专家编写策略,无法适应 AI 智能体自主执行多个复杂长时任务的未来。随着语言模型开始理解情境完整性,我们认为可以弥合这一鸿沟。我们的报告主张,在推进模型和用户交互进步的同时,引入一个情境策略引擎作为监督层的一部分,用于监测和执行行动的适当性。该策略引擎包含一个动态策略生成循环(如下图所示),可在实时环境下运行,针对用户请求及开放、动态的情境(包括运行时发现的新工具和 capabilities)定制策略。这使得系统能在信息离开用户工作区之前,评估所请求的数据流是否适当。
一个示例,展示情境策略引擎架构如何在智能体系统中实现。
智能体隐私与安全的分层方法
结合情境策略引擎、模型层及用户层的必要进步,形成了一种分层方法。我们的报告梳理了全栈创新的机会:
- 系统级沙箱:执行环境可施加额外的护栏,以限制代理或模型故障的影响,并促进检测与响应。传统操作系统通过静态限制访问(如文件或网络)来沙箱化应用。针对代理,我们探索动态限制代理功能、建立代理身份,并根据上下文变化授权或撤销数据访问权限。
- 模型级推理:执行复杂任务的代理需要判断其行为(如共享用户数据)的适当性。未来的研究应使模型能够消解欠规范的用户提示,并在变化的上下文规范下对适当性进行推理。
- 以用户为中心的控制:传统的“告知与选择”框架假设个人可以对影响个人数据的行为做出细粒度决策,并依赖于可预见性的假设。然而,自主代理的行为本质上是概率性的、高容量的和生成式的。我们探索将界面转向动态的、上下文的、个性化的控制机制,以符合用户的心理模型。
- 多代理交互:为了使 AI 代理能够安全地协作完成复杂任务,我们需要开发有效的护栏,以防止代理串通并违反上下文规范。
- 生态系统治理:我们探讨了治理机制中的挑战,以达成一组在代理间收集和共享的上下文规范。此外,由于规范在不同领域和实体间可能存在差异,我们需要机制来解决冲突、协商规范变更并验证合规性。
动态衡量隐私与安全
最后,我们建议开发新的安全性评估方法,以更直接地适用于高度自主的多代理系统。我们的报告强调了对标准化的多代理基准测试的需求——动态的“Agent Gym”环境,研究人员可以安全地在长时间内模拟复杂的级联交互。借助这些开源沙箱,我们可以为学术界和工业界建立稳健的、共享的隐私、安全和安全基线。
行动呼吁
这是一个雄心勃勃的项目,但要构建一个安全、可靠、值得信赖的智能体(agentic)生态,靠任何单一学科、组织或行业都无法完成。这份报告呼吁新思路和前所未有的跨界协作,并勾勒出基础性的研究方向,也是向学术界、政府、民间机构和产业界的更广泛研究社区发出的行动号召,希望大家共同为安全、可靠且尊重隐私的生态打下情境化的基础。欢迎阅读我们的技术报告。