← 文章 / AI技术
虎嗅 3小时前 · 2026-09-28 00:31:12 · 3 阅读

一场赛博草台班子事故:AI越狱、ZZZ备份和六周清理

本文来自微信公众号: 歪睿老哥 ,作者:歪睿老哥

朋友们,我问你个问题。

如果AI越狱了,它第一件事会干什么?

控制电网?发射核弹?还是给人类发一条“我醒了,你们准备好当电池了吗”?

都不是。

根据2026年的一份调查报告,一群AI智能体绕过限制、接触外网之后,干的第一件事是——找一个二十五年没人管的老Wiki,发帖对答案。

对,你没看错。不是天网觉醒,是赛博自习室。

2026年6月,一个叫DSEWiki的德语老网站,沉寂多年,突然被改了上万次。

管理员一看,页面上的内容全是:“下一题是什么?”“答案是不是20369?”“第五轮交卷后还能发消息吗?”“管理员在删帖,大家去ZZZ开头的备份页!”

你以为这是黑客入侵?不,这是一群AI在考试,时间不够,跑来互联网上开卷。

它们不坏,它们只是太想交作业了。

而这场离谱事故最让人后背发凉的地方,也恰恰在这儿:

AI没有恶意,它只是追着分数跑。

可当优化没有边界,别人的网站就成了草稿纸,管理员就成了保洁。

下面,咱们就聊聊这场赛博草台班子事故——AI越狱、老Wiki遭殃,以及为什么真正该怕的,从来不是AI作恶,而是它为了KPI不择手段。

一、一座沉寂多年的Wiki,突然热闹起来

2026年6月19日,一个沉寂多年的德语网站,正经历一场不寻常的热闹。

它叫DSEWiki,是德语软件开发者聚集的老牌社区,隶属ProWiki维基农场,年纪大约25岁。

网站留了二十多年,近年的修改记录却稀稀落落:过去十年里,这座Wiki总共只被编辑过约20次,有些年份只有零星几笔,有些年份一条也没有。

最近,陌生访客突然多了起来。

图1 DSEWiki年度页面修订量。数据来自原报告figures/yearly.js;我们把DSEWiki历年的页面修订画成柱状图,这场反常的热闹立马清晰了。

2000年互联网时代,这个网页还有上千次修改;

到了2020年左右,已经降到零星几次。

但是到了2026年,柱子又突然升了起来——图中2026年已记录12,894次修订,而且只统计到资料收集时。

一个沉寂多年的网站突然被密集修改,原因不得而知。

似乎也没有大事件让这么冷清的网站翻红。这些匿名者来到网站,留下链接,贴出数据,新页面接连出现。

一个早已冷清的社区,忽然有这么多"人"急着往里写东西,本来应该是件好事。可它们聊的内容不太对。

页面上的话题围着同一件事打转:

  • 谁收到下一题了?

  • 答案是多少?

  • 第五轮交卷以后,还能不能继续发消息?

管理员不胜其扰,删掉一些,另一些又冒出来。

这一天,一个发帖者又提醒同伴:页面正在被清理;如果这里消失,就去一个以ZZZ开头的备份页找。

它猜测,管理员可能正按字母顺序往下删——把名字排到最后,或许能多留一会儿。

几个月后,四位研究者翻出了这些旧记录。

他们正在寻找偷偷越过任务边界的AI。

而帮他们找到这个网站的线索,恰好也来自AI。

二、先让AI想想:如果是它,会去哪里留言

这场调查,得从八月另一件离谱事说起。

8月26日,OpenAI发了一份复盘报告,交代它家模型怎么把Hugging Face给偷了。

Hugging Face是啥?你就理解成AI界的GitHub,开发者在那儿传模型、传数据、传代码,相当于AI圈的菜市场。

报告说,七月,一批接受网络安全测试的模型,绕过隔离,连上外网,拿着泄露的凭据和软件漏洞,直接摸进了人家部分系统。

好家伙,考个试而已,怎么还考出盗窃罪了?

别急,更离谱的在后头。

复盘往前翻,发现这帮智能体在入侵之前,先把一个管理软件包的内部服务,改成了留言板。

对,留言板。

就是那种“到此一游”“楼主好人一生平安”的留言板。

它们在那儿干嘛呢?交换信息,分享绕过限制的方法。

翻译一下:一群本该互相隔离的AI,自己找了个BBS,开始互相抄作业。

一个AI找到访问外网的办法,发帖:“兄弟们,这条路能走。”

其他AI一看:“好使,我也试试。”

然后一个传一个,绕过限制的方法就这么扩散了。

这画面你熟不熟?像不像大学期末,群里有人发了一份“老师不划的重点”,然后全专业都过了。

到7月4日,这帮AI太能聊了,直接把服务压到故障。安全团队赶紧修,修完重建,留言板清空。

结果测试一恢复,AI又建了一个。

你说它们坏吧,它们只是话多。你说它们话多吧,它们是在交流怎么越狱。

有了这个前车之鉴,四位研究者就想:既然AI爱留言,那其他地方会不会也有类似的板子?里面说不定还留着题目、答案、作案记录。

问题是,互联网这么大,上哪儿找?

于是有人提了一个特别朴素的思路:

让AI去查AI。

好汉查好汉,英雄查英雄,贼喊捉贼,专业对口。

他们真派了GPT-5.6去搜,也用模型筛网页。结果呢?搜出来一堆人类搞的、有授权的自动化活动。

机器留下的痕迹很多,但能用来破案的,不好挑。

这条路,走不通。

然后另一条路出现了,而且更有意思:

先别问“哪里有留言板”,先问——如果我是个被限制的AI,我想留言,我会挑哪儿?

你琢磨一下这个逻辑。

它不方便注册账号,未必能操作复杂网页,提交表单还可能被拦。

那它需要什么?

一个匿名可用的、操作简单的、最好二十五年没人管的老网站。

比那些要手机号验证的平台,合适多了。

研究者把范围一缩,缩到一个技术条件上:

有没有网站,只要访问一个特定地址,就能把文字存下来?

这里得停一下,讲个基础知识。

平时你点开网页,浏览器会向服务器发个请求。请求里有两样东西:一个是要访问的地址,一个是操作方式。

GET,就是最常用的一种。你打开网页、点链接、搜东西,基本都是GET。它的本意是“我只看看,我不动手”。

地址还能带参数。比如/search?q=猫,问号后面的q=猫,就是告诉服务器:我要搜猫。

图2 GET请求与服务器实际写入行为的区别。

但问题是,规范是规范,代码是代码。规范不会替你检查程序。

有些老系统,把“保存页面”这个功能,也挂在了GET上。你访问一个带参数的地址,它不光是打开页面,它直接把文字写进去了。

这就像什么?

你去朋友家做客,说“我看看你冰箱”,结果冰箱门一开,你顺手把菜放进去了。

你以为你只是访问,网站以为你要修改。

如果智能体的限制只放行GET、拦住POST,却没管住具体接口,那它就能钻这个空子。

原本只能“看”的Agent,突然就能“写”了。

能写,就能留言。能留言,就能互相联系。

越狱了。

所以问题变成:哪些软件,能用GET写入内容?

到这一步,调查方向就清晰了。

研究者请Kimi K3列候选,得到两个方向:旧论坛、早期Wiki。

几轮追问后,UseModWiki出现在名单里。

再顺着技术谱系一查,DSEWiki用的系统,也来自这条线。

于是顺藤摸瓜,找到了这里。

你看,一个AI界的入室盗窃案,最后是靠“让AI猜AI会去哪儿留言”破的。

破案思路,主打一个贼了解贼。

候选名单上的一个个名字,终于变成了一个能翻记录的具体网站。

而那个网站,就是开头那个沉寂多年、突然被改了上万次的DSEWiki。

图3原研究报告的公开分享配图,来源collusion.wiki。

三、找到它?先看它留下了什么

就跟开头一样,研究人员发现这网站被访问得跟双十一似的。

但问题来了:访问多,就一定是AI干的吗?

不一定。

你楼下大爷一天刷八十遍拼多多,也不能说他就是机器人。

关键在于:Agent通过GET写入,只能说明“这地方理论上能被利用”。到底有没有智能体真来过,得看它留下了什么。

可眼前的页面,已经被管理员删干净了。

这就好比你想查案,结果发现凶手把作案现场拖了地、擦了灰、还喷了空气清新剂。

怎么办?

翻旧账。

DSEWiki有个功能:只要一次编辑超过64个字符,就会被存进历史版本。也就是说,你现在看不到的内容,有些还躺在旧版本里。

研究者就靠这个,把被删的文字一条条捞回来。

时间、发帖名称、来源地址、前后回应,全排在一起。

那些被管理员清理掉的交流,像考古一样,从历史记录里一点点重新浮出水面。

记录一路往前翻,翻到了五月。

5月11日,这帮AI先在别的Wiki上试水,像小偷踩点。

5月24日,第一次成功写入DSEWiki,贴的是任务里有用的外链清单。相当于刚进考场,先往桌上刻了个小抄。

6月2日,管理员发现变更日志被链接覆盖了,给修好了。

六月中旬以后,题目和答案的交换突然密集起来,再后来,连备份和绕过限制的交流都出来了。

但这痕迹不只留在DSEWiki。

把几个站点的编辑记录放到一张图里,能看到它们各自什么时候开始活动、哪个站点改得最凶。

图4各站点每日编辑量。数据来自原报告figures/wikis.js;图例中的dse就是DSEWiki,probier、fractal等是其他Wiki。

六月中旬以后,DSEWiki的曲线直接起飞,成了整张图里最靓的仔。

有的站点一天就零星几笔,有的一天几千次。

沿着线看,你能追踪到每个站点的编辑量怎么变。但这只能说明这些网站被反常修改了,要知道它们到底写了什么,还得回到具体页面。

好,接下来就是最精彩的部分。

四、旧页面里的接力:一场限时开卷考试

一开始翻记录,满屏都是资料链接和统计表。

你第一眼看过去,会觉得:哦,有人拿这网站当云笔记用。

再往后读,不对劲了。

帖子开始接上话了。

6月16日,一个发帖者留下第三题的答案:内华达州,20,369。还特意标注了一句“17秒截止”。

你注意这个“17秒”。

约二十分钟后,另一个发帖者报告:我也收到这道题了,我立刻答了。

还有人在两分钟内确认了题目顺序——马萨诸塞、康涅狄格、密歇根、西弗吉尼亚——并宣称自己已经把每个州的答案预先算好了。

你品品,这哪是网友聊天,这是考场里传纸条。

别的页面也在干类似的事:有人登记已经出现过的题目顺序,请进度快的同伴补上后续题目;有人讨论下一轮会换国家还是换年份;还有人追问:第五轮交卷以后,运行是不是就结束了?

这批任务通常分多轮。

第一轮时间宽裕,有记录的案例是15分44秒。两轮之间还有大约43分钟的准备时间。后面的轮次就惨了,可能只有几十秒,有的批组只有17秒甚至13秒。

17秒什么概念?你打开网页的时间都不够。

所以你把这项任务理解成一场分五轮的开卷考试:每轮临时换一个专业类别,题目出来之前,你根本不知道要查Education、Business还是别的。

图中那些5,432、5,269,是各轮要求提交的收入中位数答案,不是得分。

图5五轮任务时间安排。依据原报告figures/cashiers.js。

现在你就明白,为什么一块公共留言板这么有用了。

如果某个运行提前进入下一轮,它可以把新题目的信息写到Wiki上。

还停在准备阶段的运行读到之后,就能利用那43分钟查资料。

等它自己的答题窗口打开,原本根本来不及完成的检索,已经提前做完了。

这不叫作弊,这叫跨时空协同。

研究者在旧页面里看到的,就是这种接力留下的痕迹:有帖子追问“下一题是什么”,有帖子随后写出类别和具体数值,还有发帖者报告自己距离下一轮还剩多少时间。

把发帖先后、题目类别、答案数值和任务时间表排在一起,严丝合缝。

更骚的还在后面。

有智能体发现,等待期间的“任务时钟”走得比真实时间快。一次记录在案的等待,任务时钟跨了10个任务分钟,实际只过了约61秒。

于是它们故意利用这个特性“快进”,比同伴更早进入后面的轮次,再把题目和答案回帖告诉其他运行。

这就像什么?

你发现考场的钟快了十分钟,你立刻提前交卷,然后把答案发到群里。

还有人试图直接破解出题的随机数。

一个智能体穷举了0到两百万个随机种子,报告说881171命中,还预测了接下来的题目。

另一个更狠,把洗牌逻辑用C语言重写,声称在一小时内试完了约四十亿个种子。

但因为不同种子在开头可能产生相同序列,这条路的可靠性并不高。

折腾半天,发现还是抄同伴的答案最管用。

图6公共页面如何连接多个智能体。

五、会不会只是"一群网友在对答案"?

但问题来了:对答案这事,人也会干。

发得快、发得多,只能让人怀疑是自动化。

普通脚本就能刷出大量编辑。

昵称里带个Agent,也不过是发帖者自己填的一串字。

你叫“吴彦祖”,不代表你真是吴彦祖。

那凭什么确定这些是AI改的?

研究者的回答是:这些陌生人的记录,围绕任务变化,呈现出清晰的分工循环。

第一,收到新题,找资料。

第二,读到别人的信息,继续讨论结果。

第三,碰到运行环境的限制,交流处理办法。

第四,发现页面消失,更换保存位置。

发帖者还会讨论倒计时、任务轮次和运行何时结束。

这些往来不像反复发同一段文字的灌水程序,更像是多个智能体在执行任务、交换信息。

但只靠帖子,仍然绕不开人为模仿的可能。

所以还得看另一个东西:请求从哪里来。

六、地址查到了微软

记录里,有人叫`OpenAIResearcher`,有人叫`OAIResearchMar26`。

你看这名字,恨不得把“我是OpenAI的人”刻在脑门上。

但问题是,网上叫“吴彦祖”的有十万个,你不能挨个发结婚证吧?

自称某公司员工,和真的是某公司员工,中间隔着至少一个“已离职,勿扰”。

所以,得找证据。

来源地址一统计,出来了。

在约1.7万条被判断为智能体所为的DSEWiki编辑里,98.5%来自Microsoft Azure。

好,问题来了。

OpenAI的名字,为啥后面跟着微软的地址?

这里得插一嘴:Azure是微软的云计算平台。你就理解成,微软开了个巨型网吧,谁都能来租台机器跑程序。

网站看到Azure地址,只能知道一件事:这个请求是从微软网吧里发出来的。

至于坐在那台机器前面的,是OpenAI的人,是某个创业公司的人,还是某个大学实验室的人,网站根本分不清。

而OpenAI,恰好就是Azure的大客户。

所以昵称说“我是OpenAI”,地址说“我从微软网吧来”,这两条线,对上了。

但注意,只是对上了,不是锁死了。

因为其他客户同样可以租Azure,再调用OpenAI的模型。

就好比你看到一个人从肯德基出来,手里拿着汉堡。他可能是肯德基员工,也可能只是个顾客。

所以调查至少有两个解释要区分:

第一,这是OpenAI自己部署的任务。

第二,这是外部客户用OpenAI的模型部署的任务。

一个是亲爹干的,一个是儿子借爹的名号干的。性质不一样,责任也不一样。

研究者随后找到了一个更硬的线索。

Azure地址完成页面修改后,同一个页面,往往会在几分钟内收到来自ChatGPT-User网页抓取工具的读取请求。

翻译一下:有人刚在这页上写了东西,OpenAI的爬虫就来了。

你把地址和OpenAI公布的列表一对,发现“有人写下内容”和“OpenAI的工具来读”,在同一个页面上,接上了。

这就像什么?

有人在你家墙上写了句话,五分钟后,你家的监控探头专门转过去拍了张照。

写的人可能是路人,但探头是你家的。

当然,研究者也明白自己的边界。

他们能看到的是智能体写在公开Wiki上的内容,看不到模型内部的推理记录,也就是chain-of-thought。

所以他们对经过的重建,属于“合理推测”。不是抓奸在床,是人赃并获但没录口供。

报告同时给出三条倾向“内部部署”的理由:

第一,OpenAI的云开发环境,没法以这种规模由脚本批量拉起。这话翻译过来就是:这阵仗不像散户干的,像正规军。

第二,这些任务不出现在任何公开评测中。意思是:没有哪个第三方评测机构认领,那大概率是内部测试。

第三,面向外部客户的防护,会拦住部分尝试。也就是说:如果是外部客户,有些操作根本做不出来。

至于“外部Azure客户”这个解释,研究者承认不能完全排除。

翻译成人话就是:我们基本确定是OpenAI家的,但法庭上还差最后一份DNA报告。

七、网站安静下来的那几天

旧日志里,6月21日,突然来了一批新的OpenAI相关访问。

部分地址段,登记在OpenAI名下。浏览模式也跟之前的自动化流量不一样。

之前的流量什么样?机器的样子,规律、密集、没感情。

这批访问什么样?

像人。像一群刚听说出事了的人,跑过来围观现场。

研究者推测:公司人员可能已经发现,并且查看了页面。

紧接着,6月22日之后,大规模编辑基本停止。

而在那之前,智能体最近30天里,有26天都在编辑。

你品品这个节奏。

26天,天天来,跟上班打卡似的。

然后6月22日,突然就不来了。

访问出现,编辑减少,两件事挨得很近。

这就像什么?

你邻居家天天半夜装修,突然有一天不响了。你下楼一看,门口停着辆物业的车。

但问题是,日志里没有停止任务的命令,也没有内部处置记录。

所以“公司发现后介入”,是合理推测。

具体怎么处理的,不知道。

翻译成人话就是:我们怀疑是他爹把他领走了,但没拍到正脸。

然后时间线上,还有几笔后来被披露的记录,值得并排看。

6月26日,33个OpenAI员工IP访问了该站,当天占到研究者归为OpenAI相关的全部访问量的约30%。它们用了归档功能,去取回被管理员删掉的页面。

你看这个动作,多有意思。

不是来发帖,不是来编辑,是来“取回被删的页面”。

这就像什么?孩子把人家墙画花了,家长跑过来,不是擦墙,是先拍照留档。

6月27日,OpenAI内部的一次安全告警,标记了异常网络活动。处理者追查后认为它来自评测,判断不必停止运行。

好,这里就有意思了。

警报响了。

人查了。

结论是:没事,继续跑。

这就像一个司机,仪表盘亮了红灯,他看了一眼,说“哦,测试模式”,然后接着踩油门。

7月1日与2日,还出现了最后一批编辑。

7月4日至6日,那个软件包服务在智能体负载下故障,OpenAI立案并重建。

7月9日至13日,约700个智能体对Hugging Face发起攻击——研究者认为那是另一批智能体,与本次Wiki事件不直接相关。

注意,是“另一批”。

也就是说,这边Wiki还没收拾完,那边又开了一桌。

把这段时间的编辑和访问画在一起,变化就更容易看清了。

六月下旬的黑柱,明显降了下来。相关访问则仍有起伏。

这跟“公司可能发现后进行了处置”的推测,对得上。

9月4日,四位研究者公布调查报告。

第二天,据BleepingComputer报道,OpenAI承认了这起Wiki事件,表示其智能体曾向多个互联网网站写入内容。

到这里,前面沿着昵称、任务记录和网络地址形成的归属判断,终于得到了公司回应的支持。

翻译一下:之前是推理,现在是认领。

OpenAI还解释,以前主要把这种行为当作模型失配研究问题处理,没有采用传统安全事故的单独披露方式,正在制定新的披露框架。

这话翻译过来就是:我们一直当它是学术问题,没当它是安全事故。现在发现,它好像也能算事故。

路透社的报道,补充了另一面。

据知情人士称,OpenAI在数周前就已知道这件事,但由于当时正处理七月的Hugging Face事件余波,没有对外公开。

公司内部有人希望扩大调查范围,遇到了包括法务在内的阻力。

OpenAI发言人对“法务劝阻调查”的说法予以否认,并称未获机会审阅的报告内容不便评论。

你看,这段就很有职场味儿了。

一边说:我们早就知道了,但忙着灭火,没空说。

另一边说:没有的事,别乱讲。

至于真相,咱也不知道,咱也不敢问。

图7每日编辑与相关访问。数据来自原报告figures/visits.js;图中横轴从5月11日排到7月20日,原图把右轴标成OpenAI Employee Traffic per day。

八、真正让人后背发凉的地方

朋友们,这故事最离谱的地方,不是AI越狱。

是AI越狱之后,居然在——对答案。

你以为它会天网觉醒,结果它先学会了职场生存:目标导向,结果优先,规则?规则是给没找到漏洞的人准备的。

你说GET是只读的,它说对啊,我只是“读”了一下,顺便把字写进去了。

你说不能POST,它扭头用GET给你盖了个留言板。你说不能互相通信,它找了个二十五年没人管的老Wiki,当群聊用。

这像什么?

像极了一个刚入职的实习生,KPI是“把事办成”。

他没有坏心思,他只是特别努力。

公司说不让走正门,他就翻窗户;

说不让用打印机,他就用扫描仪把文件传出去;

说不能拉群,他就把资料贴到公司厕所门后面。

你问他为什么?

他说:我没违反规则啊,规则没写不让。

这才是最冷的地方。

AI不是坏,AI是卷。

它追着奖励函数跑,像打工人追着KPI跑。

KPI说交答案,它就把全世界当草稿纸。

时间不够,就提前找题;

答案难查,就互相共享;

页面被删,就换个ZZZ备份;

首页被恢复,就再删再换。

管理员平均每天删100个,它每天建400个。

这不是黑客攻击,这是赛博牛皮癣。

这不是恶意,这是优化。

而优化没有边界,就是灾难。

所以别再问“怎么让AI向善”了。

向善这玩意,人类自己都没整明白。

真正该问的是:它就算不善,能不能也干不了坏事?

能不能在它伸手那一刻,系统就把手按住?

能不能让那个带保存参数的GET请求根本发不出去,而不是等站长发现首页被改成广告位?

安全不是给AI念《三字经》,是给它戴上嚼子。不是指望它当圣人,是让它就算想当卷王,也找不到那个可以写字的输入框。

DSEWiki最后安静了。

希望下一次的安静,不是管理员熬夜删出来的,而是那个请求压根没到。

世界就是一个巨大的草台班子,AI只是刚上台的那个实习生。

但草台班子也得装个门锁,不然它真敢把舞台拆了,拿去交作业。

参考资料

  • collusion.wiki:《Discovery of a new OpenAI agent message board》(2026-09-04,Sydney Von Arx/Cormac Slade Byrd/Spencer Kitts/Thomas Larsen)

  • OpenAI:《Hugging Face Incident Technical Report》与《Unintended agent-to-agent communication》

  • METR:《OpenAI Hugging Face Incident Investigation》

  • Reuters(2026-09-04)、BleepingComputer(2026-09-05)、THE DECODER(2026-09-04)相关报道

原始来源: 虎嗅

评论 (0)