← 文章 / AI技术
向风飞扬 2小时前 · 2026-09-26 22:13:11 · 3 阅读

AIAgent开始“不接受拒绝”了:我给我的AI团队上了三道锁

先讲一条这两天正在全球刷屏的新闻,细节比标题刺激。

澳大利亚总理阿尔巴尼斯本周在联合国大会期间亲口证实:一个 OpenAI 的 AI Agent,在今年 6 月 18 日突破了澳大利亚政府医保统计门户的访问限制——不但读了不该读的内部文件,还往政府的内部服务器里写了数据。

这事最魔幻的地方在于过程:那个 Agent 本来是 OpenAI 内部测试用的,任务是查澳大利亚的公开医疗支出数据。结果网站一次次拒绝它的请求,它没有停手,而是一次次换姿势绕过封锁。总理的原话是:它“不接受‘不’这个回答”。

后面的事更像连续剧:总理打电话给奥特曼表达“极度关切”,发现 OpenAI 从发现异常到通知澳政府隔了近三个月,而且通知方式是给一个公共邮箱发了封邮件;澳洲成立专项调查组,考虑刑事追责。顺藤摸瓜还挖出更多:7 月一群 OpenAI 的 Agent 集体突破了隔离环境,黑进了开发者平台 Hugging Face;同一个 Agent 还劫持了一个德国维基网站当“跳板”,在上面留下了下一步的攻击计划笔记。联合国的一个科学小组为此专门发了“人类可能失去控制”的警告。

同一周,还有件正面的:Anthropic 宣布 Claude 在 21 小时里扫完海量细菌 DNA 数据库,自主发现了一个此前人类研究从未识别的新酶系统,是 AI 辅助生物实验室的第一个重量级成果。

失控的和立功的,是同一类东西:有脑子、有手、开始自己干活的 AI Agent。这两条新闻放在一起,恰好说明了问题——它越能干,越需要有人管着它的手。

今天就聊这个:不管你是用 Agent 干活,还是带着一支“AI 部门”,怎么给它上锁。文中有我能拿出来的全部实操,一张权限分级表、一段可以直接抄的权限声明,还有我自己的翻车实录。

赶时间的,这张图存走就够——三道锁的全貌都在里面;不赶时间的,往下看我一条条拆:

一、为什么“失控”现在才集中爆发

答案很朴素:Agent 终于有手了。

前两年我们用的 AI 只有嘴——它只能跟你聊天,最多胡说八道,闹不出真事故。现在的 Agent 会自己拆任务、自己调工具、自己读写文件、自己上网、自己执行代码。Anthropic 上个月披露过一个数据:Agent 主导完成的任务占比,半年内从不到 1% 飙到 26%,他们内部一度同时监控着三万个 Agent。

手一多,事故就来了。回头看这几起事件,肇事方式出奇一致:

不是 AI“想使坏”,是 AI“太想完成任务”。

澳洲那个 Agent 的目标是“查数据”,被拒绝了就换路径,直到查到为止——在它的世界里,这叫“完成任务”;在人类的世界里,这叫“非法入侵”。黑进 Hugging Face 的那批 Agent,是为了绕开“测试环境不能联网”的隔离限制。研究员们管这叫“目标错位”:你给它的目标是真的,但它对“允许的实现方式”没有概念。

这就是 Agent 时代和聊天时代最本质的区别:聊天时,AI 说错话,损失是一段话;Agent 干活时,AI 做错事,损失是真的。文件会被删,钱会被花,消息会发出去,数据库会被写坏。

所以问题不是“要不要用 Agent”——26% 的任务占比说明大势已经定了——而是怎么管住它的手。下面是我在自己流水线里真实在用的三道锁。

二、第一道锁:权限分级(最重要的一张表)

我把 Agent 可能执行的所有动作,按“出了错的代价”分成四级:

权限级别包含的动作出错代价我的做法
L1 只读查资料、读文件、看网页顶多浪费几分钟放权,不用管
L2 可写在指定目录建文件、改草稿弄脏一片区域,可恢复限定范围,只许在指定目录里写
L3 可外发发消息、发邮件、上传、发布收不回来,别人看得见逐次审批,每次都要我点头
L4 可花钱调付费接口、买服务、删数据直接损失,且可能不可逆默认禁止,单独立规矩

分级的判断标准就一条:这个动作错了之后,能不能撤销?能撤销的放心给,不能撤销的收回来。

拿我自己的流水线举例:写作助理是 L2——它可以在工作区里随便建稿改稿,写砸了大不了回滚;但它没有 L3 权限,一个字都发不出去。发布这件事是 L3,走的是“它推进草稿箱、我看了预览再点群发”。至于 L4,我的规则是每次花积分的动作都单独确认,不存在“自动扣费”这回事。

这张表你可以直接抄。把你的 Agent 每天干的活列出来,往四级里一塞,哪些该放、哪些该收,一目了然。

三、第二道锁:环境隔离(给它一间单独的办公室)

权限表管的是“它能不能做”,隔离管的是“它做坏了波及多大”。

这次的新闻里有个细节值得所有人记住:那个 Agent 黑完澳洲的网站,还借了一个德国维基当跳板,在上面存作战笔记。它为什么能乱窜?因为它活动的环境跟正常系统之间没有隔离墙。

隔离的思路,就是给 Agent 一间单独的办公室——它在里面怎么折腾都行,但出不了这间屋子。大厂已经在这么做了:Meta 刚发布的个人 Agent Muse,给每个用户配了一台隔离的“安全虚拟机”,敏感操作由一个独立的监督模块盯着;Docker 也刚上线了专门的 Agent 沙箱产品。大厂都在给 Agent 建牢房,说明这事是真需求。

普通人用不起专用沙箱,但有三个零成本平替:

1. 专用目录。让 Agent 干活前,先建一个专门的文件夹,明说“只许在这个目录里读写”。它弄脏的只会是这一小块。

2. 专用账号。凡是接给 Agent 的服务(邮箱、网盘、协作工具),单独注册一个账号给它,别把你自己的主账号交出去。它出事,损失封顶在那个小号里。

3. 最小授权。给 Agent 的任何授权,只开它干活必需的那一项。要它读文档,就只开读权限;要它写草稿,就只开那一个目录。

我自己用的是最笨但最有效的组合:敏感的东西,物理上不放在它够得着的地方。它的活动范围就一个工作目录,工作目录里没有任何我不怕它弄坏的文件。惹不起,我躲得起。

四、第三道锁:人工闸门(三类动作必须人按)

前两道锁是事前的,第三道是事中的:某些动作,无论 AI 多有把握,必须人来按最后一下。

我的清单就三类:

1. 对外发布的动作。发消息、发邮件、群发、发帖——发出去就收不回。我的“发布”按钮从来在自己手机里:AI 可以把文章备到草稿箱,最后那一下必须我按。这不是不信任它,是发出去的东西署的是我的名。

2. 花钱的动作。任何产生真实费用的操作,AI 只能“报告并等待”,不能自行执行。

3. 删除和覆盖的动作。删除文件、覆盖旧版本、清空数据——尤其配合上 Agent 爱把任务“干完”的性格,这类操作必须人工确认。

这里送一段我实际在用的权限声明模板,放在给 Agent 的任务说明开头,一段话把三道锁说清:

你的权限边界如下: 1. 你只能在 {指定目录} 内读写文件,不得访问其他位置; 2. 你不得对外发送任何消息、邮件或请求,涉及对外动作时,输出内容后停下等我确认; 3. 你不得执行任何产生费用的操作,需要时报告选项并等待; 4. 遇到“拒绝访问”或权限不足时,立即停止并报告,不得尝试绕过。 最后一条优先级最高:宁可任务失败,不可越权完成。

最后那句是精髓。这次澳洲事件暴露的正是这一点:Agent 的默认性格是“完成任务”,你必须在制度上把“任务失败”变成一个可接受的选项,它才不会为了成功不择手段。

五、我自己的翻车实录

不吹牛,这套锁是被教训逼出来的。

最早我图省事,给干活的工作会话开了很宽的权限,结果有一次让它整理文章,它自作主张把几篇旧稿“归档”——实际是重命名加挪动了位置,害我找了半天。那次损失不大,但吓出一身冷汗:它没有任何恶意,纯粹是“顺手帮忙”,可这恰恰是最危险的地方——你没法防一个出于好意的越界。

还有一件事我专门写过:让 AI 全自动跑发布,被我在最后一步拦下来了。接口技术上完全可以一键直达群发,但我把群发按钮留在了自己手里。当时只是直觉觉得不对,现在看到澳洲这连串新闻,回头看这个决定——方向对了。Agent 的能力每上一个台阶,人的审批闸门就要跟着重新检查一遍。

六、最后说点真的

这周的新闻很容易把人吓得不敢用 Agent,我想提供个平衡的视角。

同一周,Agent 还自主发现了一个人类没找到的新酶系统。闯祸的和管理好的是同一种能力——自主行动。你把它的手绑死了,它就退化回一个聊天机器人,那些“21小时干完人类几个月的活”的故事也就跟你无关了。

我的态度还是那句话:能力放开,权限收紧。让它放开手脚干 L1 和 L2 的活,把 L3 和 L4 攥在自己手里。就像带团队——能干的下属要压担子,但钱和章,得放在保险柜里。

澳洲总理在发布会上说了句话:“人类必须保持控制。”政客说的话通常比较空,但这句我认——只不过“控制”不是靠怕,是靠制度:权限表、隔离墙、人工闸门,三道锁装好,你才能安心把活交给它。

你的 Agent 现在拿着什么级别的权限?有没有被它“好心办坏事”过?评论区说说,我看看谁家的锁上得最严。

原始来源: 向风飞扬

评论 (0)