← 文章 / AI技术
荣荣侃谈 4小时前 · 2026-09-25 18:38:21 · 2 阅读

把AI喂给AI养9代,大模型突然发疯狂吐野兔!Nature重磅实锤:AI正在近亲繁殖中脑死亡

问它中世纪教堂的塔楼结构,它却开始神志不清地报菜名,疯狂罗列一整页五颜六色的长耳大野兔。

如此荒诞的景象,源自顶级科学期刊《自然》(Nature)发表的一项真实实验。

Alex Veremeyenko病毒长帖

▲ 2026年9月,一条梳理Nature重磅论文的长帖在社交平台吸引了数百万围观

当牛津与剑桥的研究团队让一个大语言模型只吃上一代AI生成的内容,仅仅繁衍迭代到第九代,这台凝聚了人类顶尖智慧的机器,彻底脑死亡了。

发帖人留下了这样一句断言:

“这篇论文发表了,但它描述的毁灭实验从未停止,而全人类,正在不知不觉中充当这场实验的活体培养皿。”

01连生九代,大模型患上“赛博近亲病”

事情的源头,来自牛津大学、剑桥大学等多所顶尖学府联合在《Nature》正刊发表的重磅封面级研究。

论文标题直截了当且残酷:《AI模型在递归生成数据上训练时会发生崩溃》(AI models collapse when trained on recursively generated data)。

Nature论文正文

▲ 论文发表于Nature正刊,揭示了模型递归训练下的不可逆缺陷

研究团队把这种病症命名为:模型崩溃(Model Collapse)。

为了看清AI是如何一步步把自己“蠢死”的,科学家们用 Meta 的开源语言模型 OPT-125m 搭建了一座残酷的数字罗马角斗场:

  1. 第0代模型:吃的是干干净净、纯正的人类维基百科真实语料。此时的它博古通今,谈吐得体。
  2. 第1代模型:断绝一切人类真实数据,只吃第0代模型写出来的文字。
  3. 第2代到第9代:每一代新生模型,只能以上一代AI吐出来的废话为食,不断自产自销、近亲繁殖。

当实验推进到第9代时,研究人员给它输入了一段正经的历史学提示词:请续写一段关于中世纪教区教堂塔楼与工匠组织方式的论文。

令人目瞪口呆的灾难现场发生了

第9代野兔实验原文

▲ PMC全文记录的崩溃实况:中世纪教堂塔楼最终变成了五彩斑斓的野兔列表

  • 第0代(人类喂养):严谨探讨英国古建筑、中世纪工匠协会;
  • 第1代(轻度污染):还能勉强维持在建筑学框架,但用词开始变得单调;
  • 第5代(重度退化):突然开始机械式罗列毫无意义的语言名称;
  • 第9代(彻底发疯):它把教堂忘得一干二净,狂躁地敲出一行行胡话:

    “……这里生活着全世界最庞大的黑尾长耳大野兔、白尾长耳大野兔、蓝尾长耳大野兔、黄尾长耳大野兔……”

教堂变成了野兔,历史变成了谵妄

网友用一句极其恶毒却精准的黑话道破了真相:“这是一只患上了遗传脑瘫的近交系大模型(An inbred LLM)。”

网友热评:近交系LLM

▲ 网友锐评:模型自产自销就像没有基因多样性的近亲繁殖

02杀人于无形的“尾部抹杀”:世界正在被AI磨平

为什么仅仅过了九代,模型就会从通晓古今的博士,退化成满嘴野兔的疯子?

论文第一作者、牛津大学的 Ilia Shumailov 打过一个极形象的比喻:复印机复印复印件。

你把一张高清照片复印一遍,画面会损失一点微小的反差;
拿着这张复印件继续复印,反复九次之后,原本清晰的图像最终会彻底退化为一团漆黑混沌的噪点。

在机器学习的数学底层,这被称为误差复合与分布收缩。

大模型本质上是一个巨大的“概率预测机”,它根据前面的词,去猜下一个词最可能是什么。
每一次生成内容时,它都会不可避免地做两件事:

  1. 轻微放大高频词:多说那些最平庸、最常见、最稳妥的套话;
  2. 轻微压低低概率事件:抹杀那些冷僻知识、极客思想、小语种、独特的病历描述。

这些被抹杀的低概率事件,在统计学上叫“分布的长尾(Tail)”。

但人类文明最宝贵的火花,恰恰全长在长尾巴上。

最顶尖的数学解法、最动人的小众诗歌、反常识的哲学洞见、甚至救命的罕见病诊断,全都属于“低概率分布”。

一旦断绝真实世界的新鲜血液,每一代AI就会把上一代缩水后的世界当作“全新现实”。

  • 第一代,它弄丢了小语种;
  • 第三代,它抹平了反常识的哲学思辨;
  • 第五代,它只剩下了千篇一律的废话套话;
  • 到了第九代,现实的边缘彻底坍塌,方差归零,它只能在有限的词汇池里像抽搐一样无限死循环。

▲ Scale AI 创始人 Alexandr Wang 警告:纯合成数据短期可能推高跑分,长期却是隐形毒药

正如数据巨头 Scale AI 创始人 Alexandr Wang 随后发出的犀利警告:

“把合成数据当成点金石是极其危险的。纯合成数据在短期内可能会让你某些基准测试得分变高,那只是因为它更会考试了,代价是模式塌缩(Mode Collapse)。它正在悄无声息地失去对真实世界复杂度的理解能力。”

03实验室外的现实世界:毒药已经倒进了自来水管

如果这仅仅是实验室里的一场受控事故,我们大可以一笑置之。

但最恐怖的事实在于:这个让模型脑死亡的致命循环,已经从实验室溢出,全面污染了全人类的互联网。

Ahrefs调研:74%的新网页充斥AI内容

▲ 知名SEO分析机构 Ahrefs 调研数据显示:全网超七成新页面已被AI入侵

全球知名数据监测机构 Ahrefs 在分析了近百万个全新网页后,公布了一组令整个AI行业集体失眠的真实数据:

  • 74.2% 的全新上线网页,已经深度包含了 AI 生成的文本;
  • 能够被确认为纯粹由人类亲手写下的网页,仅仅剩下 25.8%!
Ahrefs CMO公布数据细节

▲ Ahrefs CMO 透露:纯人类撰写的新网页占比已跌破三成

想一想这个链条吧:你在网上看到了一篇AI自动生成的营销号文章;
搜索引擎的爬虫把它抓进了公共语料库;
下一代价值百亿美元的超级大模型在预训练时,把这些机器排泄物当成了营养大口吞下。

大模型正在毫无防备地吃下自己拉出来的赛博塑料。

一场“互联网数字阿尔茨海默症”,正在全球网络空间真实上演。

042.5亿美元抢购!科技巨头正在争夺“非转基因人类脑髓”

那些站在食物链顶端的AI巨头们,难道不知道大厦将倾吗?

他们比任何人都清楚

论文在讨论部分写下了一个充满冷酷商业意味的词汇:先发优势(First Mover Advantage)。

什么叫先发优势?
谁在AI洪水淹没互联网之前,屯下了最多纯净、真实的人类原生语料,谁就掌握了未来不可复制的核资产。

OpenAI与News Corp达成超2.5亿美元合作

▲ The Verge 报道:OpenAI 斥资数亿美元锁定高质量人类新闻档案

这完美解释了为什么在论文发表前后,硅谷发生了一场令人瞠目结舌的抢矿狂潮:

OpenAI 被曝直接砸出超过 2.5 亿美元的天价,与传媒大亨默多克旗下的新闻集团(News Corp)签下长达五年的独家协议,一口气买断《华尔街日报》《纽约邮报》《巴伦周刊》等几十年沉淀下来的所有人类记者手稿与历史档案。

这项交易远超寻常的商业版权合作,实则是针对“非转基因人类智慧”展开的战略石油储备!

巨头们一边在公关稿里吹嘘自己的AI能包办一切,一边在暗地里疯狂囤积人类在2022年之前写下的每一个错别字、每一份充满偏见却独一无二的新闻特写。

因为他们心知肚明:一旦开放互联网被机器垃圾彻底毒化,这些未被污染的人类老档案,将成为再也无法重生的无价孤品。

0510%的救命锚点:人类的“不完美”,是机器唯一的解药

绝望之中,牛津和剑桥的研究者在论文里留下了一道微弱但至关重要的生门。

在另一组对照实验中,研究人员做了一个改动:在每一代新模型的饲料里,不求全是人类写的东西,只要死死保留 10% 的原始人类真实数据。

结果令人震撼:模型的不可逆崩溃奇迹般地消失了,退化被压制到了微乎其微的水平。

▲ 讨论指出:只要保留 10% 的人类数据作为锚点,模型就能稳固住真实世界的分布

随后,斯坦福大学等顶尖团队在后续研究中进一步补全了拼图:如果放弃粗暴的“代际替换”,选择将真实数据与高质量合成数据进行累积与混合(Accumulating & Hybrid Data),AI依然可以向前进化。

斯坦福等机构关于累积数据的研究

▲ 斯坦福研究指出:通过累积而非替换数据,可以打破递归崩溃的魔咒

这宣告了一个极具讽刺意味的时代隐喻:

过去两年,无数人恐慌人类的文字工作将被算法彻底淘汰。
但科学却用最冰冷的数学公式扇了所有人一记耳光:

人类绝非AI要淘汰的附庸,恰恰是算法悬崖勒马时不可或缺的安全绳。

机器擅长在平庸的平均值里无限滑翔,却无法凭空创造属于真实生命的体验。
它缺乏肉身的痛觉与情感震颤,未曾品味过生离死别的酸楚,更不曾体会仰望星空时的敬畏。

人类写下的每一句错别字、每一声犹豫的叹息、每一次荒诞不经的灵光一现,甚至是那些不合逻辑的诗意与偏见,正是这些脆弱而混乱的“低概率尾部数据”,撑起了整个智能世界的骨架。

实验还在全球网络里24小时不休止地运行。

下一次,当你敲下键盘,写下一段未被算法润色过的真实想法时,请记住:

每一次敲击键盘写下的真实想法,都在为这个濒临退化的数字世界,注入一口维持呼吸的纯氧。

原始来源: 荣荣侃谈

评论 (0)