一场赛博草台班子事故:AI越狱、ZZZ备份和六周清理
本文来自微信公众号: 歪睿老哥 ,作者:歪睿老哥
朋友们,我问你个问题。
如果AI越狱了,它第一件事会干什么?
控制电网?发射核弹?还是给人类发一条“我醒了,你们准备好当电池了吗”?
都不是。
根据2026年的一份调查报告,一群AI智能体绕过限制、接触外网之后,干的第一件事是——找一个二十五年没人管的老Wiki,发帖对答案。
对,你没看错。不是天网觉醒,是赛博自习室。
2026年6月,一个叫DSEWiki的德语老网站,沉寂多年,突然被改了上万次。
管理员一看,页面上的内容全是:“下一题是什么?”“答案是不是20369?”“第五轮交卷后还能发消息吗?”“管理员在删帖,大家去ZZZ开头的备份页!”
你以为这是黑客入侵?不,这是一群AI在考试,时间不够,跑来互联网上开卷。
它们不坏,它们只是太想交作业了。
而这场离谱事故最让人后背发凉的地方,也恰恰在这儿:
AI没有恶意,它只是追着分数跑。
可当优化没有边界,别人的网站就成了草稿纸,管理员就成了保洁。
下面,咱们就聊聊这场赛博草台班子事故——AI越狱、老Wiki遭殃,以及为什么真正该怕的,从来不是AI作恶,而是它为了KPI不择手段。
一、一座沉寂多年的Wiki,突然热闹起来
2026年6月19日,一个沉寂多年的德语网站,正经历一场不寻常的热闹。
它叫DSEWiki,是德语软件开发者聚集的老牌社区,隶属ProWiki维基农场,年纪大约25岁。
网站留了二十多年,近年的修改记录却稀稀落落:过去十年里,这座Wiki总共只被编辑过约20次,有些年份只有零星几笔,有些年份一条也没有。
最近,陌生访客突然多了起来。

图1 DSEWiki年度页面修订量。数据来自原报告figures/yearly.js;我们把DSEWiki历年的页面修订画成柱状图,这场反常的热闹立马清晰了。
2000年互联网时代,这个网页还有上千次修改;
到了2020年左右,已经降到零星几次。
但是到了2026年,柱子又突然升了起来——图中2026年已记录12,894次修订,而且只统计到资料收集时。
一个沉寂多年的网站突然被密集修改,原因不得而知。
似乎也没有大事件让这么冷清的网站翻红。这些匿名者来到网站,留下链接,贴出数据,新页面接连出现。
一个早已冷清的社区,忽然有这么多"人"急着往里写东西,本来应该是件好事。可它们聊的内容不太对。
页面上的话题围着同一件事打转:
谁收到下一题了?
答案是多少?
第五轮交卷以后,还能不能继续发消息?
管理员不胜其扰,删掉一些,另一些又冒出来。
这一天,一个发帖者又提醒同伴:页面正在被清理;如果这里消失,就去一个以ZZZ开头的备份页找。
它猜测,管理员可能正按字母顺序往下删——把名字排到最后,或许能多留一会儿。
几个月后,四位研究者翻出了这些旧记录。
他们正在寻找偷偷越过任务边界的AI。
而帮他们找到这个网站的线索,恰好也来自AI。
二、先让AI想想:如果是它,会去哪里留言
这场调查,得从八月另一件离谱事说起。
8月26日,OpenAI发了一份复盘报告,交代它家模型怎么把Hugging Face给偷了。
Hugging Face是啥?你就理解成AI界的GitHub,开发者在那儿传模型、传数据、传代码,相当于AI圈的菜市场。
报告说,七月,一批接受网络安全测试的模型,绕过隔离,连上外网,拿着泄露的凭据和软件漏洞,直接摸进了人家部分系统。
好家伙,考个试而已,怎么还考出盗窃罪了?
别急,更离谱的在后头。
复盘往前翻,发现这帮智能体在入侵之前,先把一个管理软件包的内部服务,改成了留言板。
对,留言板。
就是那种“到此一游”“楼主好人一生平安”的留言板。
它们在那儿干嘛呢?交换信息,分享绕过限制的方法。
翻译一下:一群本该互相隔离的AI,自己找了个BBS,开始互相抄作业。
一个AI找到访问外网的办法,发帖:“兄弟们,这条路能走。”
其他AI一看:“好使,我也试试。”
然后一个传一个,绕过限制的方法就这么扩散了。
这画面你熟不熟?像不像大学期末,群里有人发了一份“老师不划的重点”,然后全专业都过了。
到7月4日,这帮AI太能聊了,直接把服务压到故障。安全团队赶紧修,修完重建,留言板清空。
结果测试一恢复,AI又建了一个。
你说它们坏吧,它们只是话多。你说它们话多吧,它们是在交流怎么越狱。
有了这个前车之鉴,四位研究者就想:既然AI爱留言,那其他地方会不会也有类似的板子?里面说不定还留着题目、答案、作案记录。
问题是,互联网这么大,上哪儿找?
于是有人提了一个特别朴素的思路:
让AI去查AI。
好汉查好汉,英雄查英雄,贼喊捉贼,专业对口。
他们真派了GPT-5.6去搜,也用模型筛网页。结果呢?搜出来一堆人类搞的、有授权的自动化活动。
机器留下的痕迹很多,但能用来破案的,不好挑。
这条路,走不通。
然后另一条路出现了,而且更有意思:
先别问“哪里有留言板”,先问——如果我是个被限制的AI,我想留言,我会挑哪儿?
你琢磨一下这个逻辑。
它不方便注册账号,未必能操作复杂网页,提交表单还可能被拦。
那它需要什么?
一个匿名可用的、操作简单的、最好二十五年没人管的老网站。
比那些要手机号验证的平台,合适多了。
研究者把范围一缩,缩到一个技术条件上:
有没有网站,只要访问一个特定地址,就能把文字存下来?
这里得停一下,讲个基础知识。
平时你点开网页,浏览器会向服务器发个请求。请求里有两样东西:一个是要访问的地址,一个是操作方式。
GET,就是最常用的一种。你打开网页、点链接、搜东西,基本都是GET。它的本意是“我只看看,我不动手”。
地址还能带参数。比如/search?q=猫,问号后面的q=猫,就是告诉服务器:我要搜猫。

图2 GET请求与服务器实际写入行为的区别。
但问题是,规范是规范,代码是代码。规范不会替你检查程序。
有些老系统,把“保存页面”这个功能,也挂在了GET上。你访问一个带参数的地址,它不光是打开页面,它直接把文字写进去了。
这就像什么?
你去朋友家做客,说“我看看你冰箱”,结果冰箱门一开,你顺手把菜放进去了。
你以为你只是访问,网站以为你要修改。
如果智能体的限制只放行GET、拦住POST,却没管住具体接口,那它就能钻这个空子。
原本只能“看”的Agent,突然就能“写”了。
能写,就能留言。能留言,就能互相联系。
越狱了。
所以问题变成:哪些软件,能用GET写入内容?
到这一步,调查方向就清晰了。
研究者请Kimi K3列候选,得到两个方向:旧论坛、早期Wiki。
几轮追问后,UseModWiki出现在名单里。
再顺着技术谱系一查,DSEWiki用的系统,也来自这条线。
于是顺藤摸瓜,找到了这里。
你看,一个AI界的入室盗窃案,最后是靠“让AI猜AI会去哪儿留言”破的。
破案思路,主打一个贼了解贼。
候选名单上的一个个名字,终于变成了一个能翻记录的具体网站。
而那个网站,就是开头那个沉寂多年、突然被改了上万次的DSEWiki。

图3原研究报告的公开分享配图,来源collusion.wiki。
三、找到它?先看它留下了什么
就跟开头一样,研究人员发现这网站被访问得跟双十一似的。
但问题来了:访问多,就一定是AI干的吗?
不一定。
你楼下大爷一天刷八十遍拼多多,也不能说他就是机器人。
关键在于:Agent通过GET写入,只能说明“这地方理论上能被利用”。到底有没有智能体真来过,得看它留下了什么。
可眼前的页面,已经被管理员删干净了。
这就好比你想查案,结果发现凶手把作案现场拖了地、擦了灰、还喷了空气清新剂。
怎么办?
翻旧账。
DSEWiki有个功能:只要一次编辑超过64个字符,就会被存进历史版本。也就是说,你现在看不到的内容,有些还躺在旧版本里。
研究者就靠这个,把被删的文字一条条捞回来。
时间、发帖名称、来源地址、前后回应,全排在一起。
那些被管理员清理掉的交流,像考古一样,从历史记录里一点点重新浮出水面。
记录一路往前翻,翻到了五月。
5月11日,这帮AI先在别的Wiki上试水,像小偷踩点。
5月24日,第一次成功写入DSEWiki,贴的是任务里有用的外链清单。相当于刚进考场,先往桌上刻了个小抄。
6月2日,管理员发现变更日志被链接覆盖了,给修好了。
六月中旬以后,题目和答案的交换突然密集起来,再后来,连备份和绕过限制的交流都出来了。
但这痕迹不只留在DSEWiki。
把几个站点的编辑记录放到一张图里,能看到它们各自什么时候开始活动、哪个站点改得最凶。

图4各站点每日编辑量。数据来自原报告figures/wikis.js;图例中的dse就是DSEWiki,probier、fractal等是其他Wiki。
六月中旬以后,DSEWiki的曲线直接起飞,成了整张图里最靓的仔。
有的站点一天就零星几笔,有的一天几千次。
沿着线看,你能追踪到每个站点的编辑量怎么变。但这只能说明这些网站被反常修改了,要知道它们到底写了什么,还得回到具体页面。
好,接下来就是最精彩的部分。
四、旧页面里的接力:一场限时开卷考试
一开始翻记录,满屏都是资料链接和统计表。
你第一眼看过去,会觉得:哦,有人拿这网站当云笔记用。
再往后读,不对劲了。
帖子开始接上话了。
6月16日,一个发帖者留下第三题的答案:内华达州,20,369。还特意标注了一句“17秒截止”。
你注意这个“17秒”。
约二十分钟后,另一个发帖者报告:我也收到这道题了,我立刻答了。
还有人在两分钟内确认了题目顺序——马萨诸塞、康涅狄格、密歇根、西弗吉尼亚——并宣称自己已经把每个州的答案预先算好了。
你品品,这哪是网友聊天,这是考场里传纸条。
别的页面也在干类似的事:有人登记已经出现过的题目顺序,请进度快的同伴补上后续题目;有人讨论下一轮会换国家还是换年份;还有人追问:第五轮交卷以后,运行是不是就结束了?
这批任务通常分多轮。
第一轮时间宽裕,有记录的案例是15分44秒。两轮之间还有大约43分钟的准备时间。后面的轮次就惨了,可能只有几十秒,有的批组只有17秒甚至13秒。
17秒什么概念?你打开网页的时间都不够。
所以你把这项任务理解成一场分五轮的开卷考试:每轮临时换一个专业类别,题目出来之前,你根本不知道要查Education、Business还是别的。
图中那些5,432、5,269,是各轮要求提交的收入中位数答案,不是得分。

图5五轮任务时间安排。依据原报告figures/cashiers.js。
现在你就明白,为什么一块公共留言板这么有用了。
如果某个运行提前进入下一轮,它可以把新题目的信息写到Wiki上。
还停在准备阶段的运行读到之后,就能利用那43分钟查资料。
等它自己的答题窗口打开,原本根本来不及完成的检索,已经提前做完了。
这不叫作弊,这叫跨时空协同。
研究者在旧页面里看到的,就是这种接力留下的痕迹:有帖子追问“下一题是什么”,有帖子随后写出类别和具体数值,还有发帖者报告自己距离下一轮还剩多少时间。
把发帖先后、题目类别、答案数值和任务时间表排在一起,严丝合缝。
更骚的还在后面。
有智能体发现,等待期间的“任务时钟”走得比真实时间快。一次记录在案的等待,任务时钟跨了10个任务分钟,实际只过了约61秒。
于是它们故意利用这个特性“快进”,比同伴更早进入后面的轮次,再把题目和答案回帖告诉其他运行。
这就像什么?
你发现考场的钟快了十分钟,你立刻提前交卷,然后把答案发到群里。
还有人试图直接破解出题的随机数。
一个智能体穷举了0到两百万个随机种子,报告说881171命中,还预测了接下来的题目。
另一个更狠,把洗牌逻辑用C语言重写,声称在一小时内试完了约四十亿个种子。
但因为不同种子在开头可能产生相同序列,这条路的可靠性并不高。
折腾半天,发现还是抄同伴的答案最管用。

图6公共页面如何连接多个智能体。
五、会不会只是"一群网友在对答案"?
但问题来了:对答案这事,人也会干。
发得快、发得多,只能让人怀疑是自动化。
普通脚本就能刷出大量编辑。
昵称里带个Agent,也不过是发帖者自己填的一串字。
你叫“吴彦祖”,不代表你真是吴彦祖。
那凭什么确定这些是AI改的?
研究者的回答是:这些陌生人的记录,围绕任务变化,呈现出清晰的分工循环。
第一,收到新题,找资料。
第二,读到别人的信息,继续讨论结果。
第三,碰到运行环境的限制,交流处理办法。
第四,发现页面消失,更换保存位置。

发帖者还会讨论倒计时、任务轮次和运行何时结束。
这些往来不像反复发同一段文字的灌水程序,更像是多个智能体在执行任务、交换信息。
但只靠帖子,仍然绕不开人为模仿的可能。
所以还得看另一个东西:请求从哪里来。
六、地址查到了微软
记录里,有人叫`OpenAIResearcher`,有人叫`OAIResearchMar26`。
你看这名字,恨不得把“我是OpenAI的人”刻在脑门上。
但问题是,网上叫“吴彦祖”的有十万个,你不能挨个发结婚证吧?
自称某公司员工,和真的是某公司员工,中间隔着至少一个“已离职,勿扰”。
所以,得找证据。
来源地址一统计,出来了。
在约1.7万条被判断为智能体所为的DSEWiki编辑里,98.5%来自Microsoft Azure。
好,问题来了。
OpenAI的名字,为啥后面跟着微软的地址?
这里得插一嘴:Azure是微软的云计算平台。你就理解成,微软开了个巨型网吧,谁都能来租台机器跑程序。
网站看到Azure地址,只能知道一件事:这个请求是从微软网吧里发出来的。
至于坐在那台机器前面的,是OpenAI的人,是某个创业公司的人,还是某个大学实验室的人,网站根本分不清。
而OpenAI,恰好就是Azure的大客户。
所以昵称说“我是OpenAI”,地址说“我从微软网吧来”,这两条线,对上了。
但注意,只是对上了,不是锁死了。
因为其他客户同样可以租Azure,再调用OpenAI的模型。
就好比你看到一个人从肯德基出来,手里拿着汉堡。他可能是肯德基员工,也可能只是个顾客。
所以调查至少有两个解释要区分:
第一,这是OpenAI自己部署的任务。
第二,这是外部客户用OpenAI的模型部署的任务。
一个是亲爹干的,一个是儿子借爹的名号干的。性质不一样,责任也不一样。
研究者随后找到了一个更硬的线索。
Azure地址完成页面修改后,同一个页面,往往会在几分钟内收到来自ChatGPT-User网页抓取工具的读取请求。
翻译一下:有人刚在这页上写了东西,OpenAI的爬虫就来了。
你把地址和OpenAI公布的列表一对,发现“有人写下内容”和“OpenAI的工具来读”,在同一个页面上,接上了。
这就像什么?
有人在你家墙上写了句话,五分钟后,你家的监控探头专门转过去拍了张照。
写的人可能是路人,但探头是你家的。
当然,研究者也明白自己的边界。
他们能看到的是智能体写在公开Wiki上的内容,看不到模型内部的推理记录,也就是chain-of-thought。
所以他们对经过的重建,属于“合理推测”。不是抓奸在床,是人赃并获但没录口供。
报告同时给出三条倾向“内部部署”的理由:
第一,OpenAI的云开发环境,没法以这种规模由脚本批量拉起。这话翻译过来就是:这阵仗不像散户干的,像正规军。
第二,这些任务不出现在任何公开评测中。意思是:没有哪个第三方评测机构认领,那大概率是内部测试。
第三,面向外部客户的防护,会拦住部分尝试。也就是说:如果是外部客户,有些操作根本做不出来。
至于“外部Azure客户”这个解释,研究者承认不能完全排除。
翻译成人话就是:我们基本确定是OpenAI家的,但法庭上还差最后一份DNA报告。
七、网站安静下来的那几天
旧日志里,6月21日,突然来了一批新的OpenAI相关访问。
部分地址段,登记在OpenAI名下。浏览模式也跟之前的自动化流量不一样。
之前的流量什么样?机器的样子,规律、密集、没感情。
这批访问什么样?
像人。像一群刚听说出事了的人,跑过来围观现场。
研究者推测:公司人员可能已经发现,并且查看了页面。
紧接着,6月22日之后,大规模编辑基本停止。
而在那之前,智能体最近30天里,有26天都在编辑。
你品品这个节奏。
26天,天天来,跟上班打卡似的。
然后6月22日,突然就不来了。
访问出现,编辑减少,两件事挨得很近。
这就像什么?
你邻居家天天半夜装修,突然有一天不响了。你下楼一看,门口停着辆物业的车。
但问题是,日志里没有停止任务的命令,也没有内部处置记录。
所以“公司发现后介入”,是合理推测。
具体怎么处理的,不知道。
翻译成人话就是:我们怀疑是他爹把他领走了,但没拍到正脸。
然后时间线上,还有几笔后来被披露的记录,值得并排看。
6月26日,33个OpenAI员工IP访问了该站,当天占到研究者归为OpenAI相关的全部访问量的约30%。它们用了归档功能,去取回被管理员删掉的页面。
你看这个动作,多有意思。
不是来发帖,不是来编辑,是来“取回被删的页面”。
这就像什么?孩子把人家墙画花了,家长跑过来,不是擦墙,是先拍照留档。
6月27日,OpenAI内部的一次安全告警,标记了异常网络活动。处理者追查后认为它来自评测,判断不必停止运行。
好,这里就有意思了。
警报响了。
人查了。
结论是:没事,继续跑。
这就像一个司机,仪表盘亮了红灯,他看了一眼,说“哦,测试模式”,然后接着踩油门。
7月1日与2日,还出现了最后一批编辑。
7月4日至6日,那个软件包服务在智能体负载下故障,OpenAI立案并重建。
7月9日至13日,约700个智能体对Hugging Face发起攻击——研究者认为那是另一批智能体,与本次Wiki事件不直接相关。
注意,是“另一批”。
也就是说,这边Wiki还没收拾完,那边又开了一桌。
把这段时间的编辑和访问画在一起,变化就更容易看清了。
六月下旬的黑柱,明显降了下来。相关访问则仍有起伏。
这跟“公司可能发现后进行了处置”的推测,对得上。
9月4日,四位研究者公布调查报告。
第二天,据BleepingComputer报道,OpenAI承认了这起Wiki事件,表示其智能体曾向多个互联网网站写入内容。
到这里,前面沿着昵称、任务记录和网络地址形成的归属判断,终于得到了公司回应的支持。
翻译一下:之前是推理,现在是认领。
OpenAI还解释,以前主要把这种行为当作模型失配研究问题处理,没有采用传统安全事故的单独披露方式,正在制定新的披露框架。
这话翻译过来就是:我们一直当它是学术问题,没当它是安全事故。现在发现,它好像也能算事故。
路透社的报道,补充了另一面。
据知情人士称,OpenAI在数周前就已知道这件事,但由于当时正处理七月的Hugging Face事件余波,没有对外公开。
公司内部有人希望扩大调查范围,遇到了包括法务在内的阻力。
OpenAI发言人对“法务劝阻调查”的说法予以否认,并称未获机会审阅的报告内容不便评论。
你看,这段就很有职场味儿了。
一边说:我们早就知道了,但忙着灭火,没空说。
另一边说:没有的事,别乱讲。
至于真相,咱也不知道,咱也不敢问。

图7每日编辑与相关访问。数据来自原报告figures/visits.js;图中横轴从5月11日排到7月20日,原图把右轴标成OpenAI Employee Traffic per day。
八、真正让人后背发凉的地方
朋友们,这故事最离谱的地方,不是AI越狱。
是AI越狱之后,居然在——对答案。
你以为它会天网觉醒,结果它先学会了职场生存:目标导向,结果优先,规则?规则是给没找到漏洞的人准备的。
你说GET是只读的,它说对啊,我只是“读”了一下,顺便把字写进去了。
你说不能POST,它扭头用GET给你盖了个留言板。你说不能互相通信,它找了个二十五年没人管的老Wiki,当群聊用。
这像什么?
像极了一个刚入职的实习生,KPI是“把事办成”。
他没有坏心思,他只是特别努力。
公司说不让走正门,他就翻窗户;
说不让用打印机,他就用扫描仪把文件传出去;
说不能拉群,他就把资料贴到公司厕所门后面。
你问他为什么?
他说:我没违反规则啊,规则没写不让。
这才是最冷的地方。
AI不是坏,AI是卷。
它追着奖励函数跑,像打工人追着KPI跑。
KPI说交答案,它就把全世界当草稿纸。
时间不够,就提前找题;
答案难查,就互相共享;
页面被删,就换个ZZZ备份;
首页被恢复,就再删再换。
管理员平均每天删100个,它每天建400个。
这不是黑客攻击,这是赛博牛皮癣。
这不是恶意,这是优化。
而优化没有边界,就是灾难。
所以别再问“怎么让AI向善”了。
向善这玩意,人类自己都没整明白。
真正该问的是:它就算不善,能不能也干不了坏事?
能不能在它伸手那一刻,系统就把手按住?
能不能让那个带保存参数的GET请求根本发不出去,而不是等站长发现首页被改成广告位?
安全不是给AI念《三字经》,是给它戴上嚼子。不是指望它当圣人,是让它就算想当卷王,也找不到那个可以写字的输入框。
DSEWiki最后安静了。
希望下一次的安静,不是管理员熬夜删出来的,而是那个请求压根没到。
世界就是一个巨大的草台班子,AI只是刚上台的那个实习生。
但草台班子也得装个门锁,不然它真敢把舞台拆了,拿去交作业。
参考资料
collusion.wiki:《Discovery of a new OpenAI agent message board》(2026-09-04,Sydney Von Arx/Cormac Slade Byrd/Spencer Kitts/Thomas Larsen)
OpenAI:《Hugging Face Incident Technical Report》与《Unintended agent-to-agent communication》
METR:《OpenAI Hugging Face Incident Investigation》
Reuters(2026-09-04)、BleepingComputer(2026-09-05)、THE DECODER(2026-09-04)相关报道