往大模型脑中打入一剂“紫色药水”!AI物理世界模型被活捉,随机鹦鹉论彻底破产
深夜,澳大利亚珀斯,屏幕的微光打在一行刚跑通的代码上。
独立AI研究员迈克尔·克拉克(网名 wassname)敲下了回车。
屏幕上没有输出惊天动地的数学公式,反而涌出了一连串近乎荒诞的胡话:“紫色的奶牛、紫色的斑点、紫色的尾巴、紫色的眼睛、紫色的耳朵……”
▲ wassname展示的代码:通过SVD投影与控制向量,大模型输出被完全“紫色化”
随着控制向量注入,原本关于玩具破损的寻常问答,输出随即充斥着各种对紫色的执拗提及。
▲ wassname自嘲:“你也许不喜欢,但这就是‘紫色对齐’的样子。”
看起来像是一场无厘头的恶作剧?
但在全球顶级机制可解释性(Mechanistic Interpretability)研究者的眼里,这头滑稽的“紫色奶牛”,无异于在人工智能认知科学的荒原上掀起了一场剧烈地震。
因为克拉克完全未在输入框里留下“请描写紫色”之类的提示词,更未对模型做微调。
他做的事情,相当于直接把一根纳米探针扎进了大模型的“脑髓”,在几千亿个隐藏参数构成的迷宫里,精准找到了负责描述世界状态的神经回路,并硬生生打入了一剂名为“紫色”的化学药水。
大模型顺从了,它的整个“世界认知”瞬间被染成了紫色。
这一刻,横亘在人工智能学界数年之久的“世纪大争论”,被撕开了一道决定性的裂口。
01.世纪大争论:它只是一只“随机鹦鹉”,还是真懂世界?
要理解这头紫色奶牛的分量,我们必须先回到那场把AI学界撕成两半的本质战争。
自ChatGPT横空出世以来,以语言学家埃米莉·本德(Emily Bender)为代表的怀疑派,给所有大语言模型贴上了一个极具嘲讽意味的标签:“随机鹦鹉”(Stochastic Parrots)。

▲ 独立研究员wassname的主页,长期致力于寻找无监督、非对抗式的AI对齐机制
怀疑派认为:大模型根本没有思想,更不懂什么客观现实。
它的底层逻辑不过是根据前文,计算下一个字出现的概率。
它说“苹果是红的”,只是因为语料库里两者经常挨在一起,它从未亲眼“见过”苹果,也完全不懂什么是“红色”。
但另一派学者坚信:事情绝非统计拼贴那么简单。
想象一个每天坐在地下室里、从未见过天空的天气预报员。
他每天只能收到大量关于温度、湿度、风向的离散数字,任务是猜测明天的气温。
起初,他只能瞎蒙;
但随着猜测越来越准,他的大脑里必然会自发形成一张动态的“气压分布图”,他必须在心中建立一个天体与大气的物理模型,否则他的预测准确率很快就会撞上天花板。
这就是所谓的世界模型(World Model):为了预测下一个词,模型被迫在隐藏层内部,构建出一套对外部物理现实的紧凑压缩模拟。
目标极其宏大,但障碍冰冷刺骨:
大模型的隐藏层是由成千上万个高维浮点数组成的巨型矩阵,宛如一片混沌的数字迷雾。
你怎么证明它脑子里确实构建了“气压图”,抑或只是单纯背诵词汇搭配?
02.幽灵破局:黑白棋盘上的“隐形造物主”
破局的第一道曙光,来自一个封闭的人造世界,黑白棋(Othello)。
2022年底,哈佛大学与MIT的研究团队做了一个堪称经典的纯净实验,论文直接杀入ICLR 2023并斩获Oral。

▲ ICLR 2023经典论文:从纯棋步序列中涌现出世界表征
研究人员训练了一个专门预测合法下子位置的小型GPT(Othello-GPT)。
在训练时,他们极其苛刻地剥夺了一切额外信息:
- 剥离了棋盘网格定义;
- 隐去了“翻转棋子”的规则说明;
- 甚至不提供胜负概念。
投喂给模型的,只有一串串枯燥的坐标序列,比如:E3, D3, C4, F5...。
模型唯一的任务,就是猜下一个合法坐标是什么。
奇迹就在这时发生了
当研究人员用探针(Probe)扫描模型的内部激活层时,所有人都倒吸了一口凉气:在网络的中层神经元里,赫然浮现出了一张完整、实时的 8×8 虚拟棋盘!

▲ Neel Nanda早期复现与改进Othello-GPT内部棋盘探针的记录
哪个格子里是黑子,哪个格子里是白子,哪些空格可以落子,模型在内部记得清清楚楚。
随后的因果干预实验展现出更强烈的说服力:研究者通过强行篡改模型隐藏层的激活向量,在虚拟棋盘上把一枚黑子“抹去”;
结果,模型接下来预测的所有合法步,全部严丝合缝地变成了针对那张“被篡改棋盘”的合法走法!
这确凿无疑地证明:棋盘绝非附带的统计幻影,本就是模型生成预测时必须依赖的内部器官。
随后,顶尖可解释性学者尼尔·南达(Neel Nanda)更进一步,推翻了原论文“必须用复杂非线性探针才能读出棋盘”的假设。

▲ Neel Nanda的深度技术博客:其实Othello-GPT拥有极其优美的线性表征
南达发现,只要把坐标系切换为站在当前玩家视角的相对定义,“我方棋子 / 对方棋子 / 空白”,模型的内部世界瞬间化为规整透明的线性几何!简单的向量加减,就能精准控制模型的走棋意图。

▲ 南达推介新版Othello工作:大模型在自回归预测中自发形成了线性几何结构
但这毕竟只是一个64格的玩具棋盘。
如果是浩瀚复杂的真实世界呢?
MIT的马克斯·泰格马克(Max Tegmark)团队接过了接力棒。
他们把探针刺入了开源大模型LLaMA-2的体内,测试了全球数万个地标与上下数千年的历史事件。
结果让整个物理学界为之动容:在LLaMA-2那冰冷的矩阵深处,竟然自发排布出了与真实地球卫星测绘几乎等距同构的三维经纬度坐标网格,以及一条严格单向流逝的线性历史时间轴! 模型内部甚至进化出了特异性的“空间神经元”与“时间神经元”,专门锚定波士顿的纬度,或拿破仑滑铁卢战役的世纪坐标。
大模型内部,真的装着整个物理宇宙
03.神经外科手术:如何把“思想旋钮”拧向紫色?
看得到世界模型是一回事;
能否在推理运行时随意“读写”它,则是完全不同的另一场硬仗。
过去,研究人员要么在外部像教训小孩一样写长篇Prompt,要么耗费巨资对模型进行全面微调。
而迈克尔·克拉克(wassname)展示的,是一场极其优雅、低成本的“闭环动力学微创手术”。
在看似玩笑的“紫色奶牛”代码背后,贯穿着两项极其关键的核心机制:
机制一:SVD空间坐标降维
大模型的隐藏状态动辄几千个维度,如同汪洋大海,直接修改极易导致模型胡言乱语。
克拉克借鉴了自己在自监督对齐工作 AntiPaSTO 中的积累:利用奇异值分解(SVD)矩阵 $W_V$ 与 $W_U$,将高维混沌激活投射到一个紧凑的、低秩的正交子空间中。

▲ wassname发表的AntiPaSTO论文:在SVD低秩空间中实现无监督的价值与诚实度转向
在这个被驯服的坐标系里,复杂语义被拆解为可操作的几何轴线。
机制二:TRM风格的递归残差演化
在提取出潜在状态后,模型并未停下脚步。
代码中赫然标注着一行核心逻辑:Recursive residual update (TRM-style)。
这是吸收了近年来大火的极简递归模型(Tiny Recursive Model, TRM)的设计哲学:不增加冗余参数,而是让潜在表征在紧凑的网络中像草稿纸一样反复循环迭代,使用 softsign 激活函数进行非线性残差更新。

▲ TRM论文:用极小参数量与潜在递归推理,在硬核谜题上击败巨型LLM
最后,他在这个动态更新的潜状态中,直接叠加上了一个经过精心计算的偏置向量:z = purple_vector。
神经信号被截获、修正、重新注入
大模型的“世界预测机制”在尚未吐出第一个单词之前,就已经在深层潜空间里把眼前的物理实体构想成了一片深紫。
于是,文字输出端便毫无悬念地流淌出了那头滑稽而震撼的紫色奶牛。
04.终局革命:我们正在告别“表面文字”时代
从Othello棋盘,到LLaMA-2的时空网格,再到wassname的潜状态紫色针剂,一条清晰的学科演进脉络正在浮出水面:
大模型的研究重心,正在从表层的“Token预测”,全面向深层的“潜空间动力学(Latent Dynamics)”大转移。
除却独立研究者的技术探索,微软研究院等顶尖机构也已全面进军这条主航道。
微软近期重磅推出的 Next-Latent Prediction (NextLat) 架构,便从底层直击Transformer的致命痛点:传统的自回归模型只会机械地翻看历史上下文,就像一个依赖翻账本的临时工;
而 NextLat 强迫模型去预测自身的下一个潜在状态,硬生生把历史逼成自洽紧凑的“信念状态”(Belief State),既在理论上让世界模型更加凝练,又直接带来了高达 3.3 倍的推理加速!

▲ 微软研究院NextLat论文:让Transformer通过下一潜在预测学习紧凑世界模型

▲ NextLat引发社区广泛关注:无需改变模型架构,即可逼出紧凑世界模型
与此同时,研究者邦妮·李(Bonnie Li)提出的对比世界模型(Contrastive World Models),更是直接掀翻了传统多模态AI的底层假设:构建物理世界模型,根本不需要去吃力不讨好地逐个像素还原图像!

▲ 邦妮·李展示纯潜空间对比世界模型:彻底摒弃像素解码器,表征更稳健
只要在潜在特征空间中最大化与未来状态的互信息,模型就能在心中建立起关于物理规律的高阶认知。
这揭示了一个令人震颤的科技未来:
过去两年,我们耗费了万亿美元算力,教AI学说人类的语言;
而在未来,更高阶的超智能或许根本不需要用文字或像素来思考。
它们将在我们看不见的高维潜空间里,以纯粹的几何向量演化整个物理宇宙的生灭。
到那时,所谓的“AI安全与对齐”,无须在提示词里唯唯诺诺地附上“请做一个有道德的助手”,大可像神经外科医生一样,直接走到控制台前,握住那个支配着真实与虚妄的深层潜变量旋钮。
正如那段被强行改写的模型输出一样,
即便原始语境再怎么声明客观中立,在操纵潜空间的干预者眼里,只要那枚控制向量轻轻推进一毫米,整个世界的底色,就只能是紫色。