【人工智能100讲/74】不要神话大模型,Kimi K3的改动是高中生能想到的东西
不要动不动就是神童天才少年,然后清华北大斯坦福毕业才能做AI,才能做大模型。
动不动就把这些东西神话了。
当然,这个东西确实非常复杂。
但并不是说我们不可以研究,不可以去做。
就好像那个汽车刚出来的时候,所有骑马车的人觉得汽车就是个神,就觉得一个盖子都不能修它,不能动它。
任何事情都是一个工具而已,不顺手你就修它,你就拿锤子敲它。不要把它放在祖宗牌位那供着。
这个心态特别关键,心态不对,搞什么东西都搞不好。
被吹成神的那个Kimi K3的那个所谓的神童就是一个小孩而已。
这小孩叫陈广宇,2009年生,深圳人,今年17岁,在华润小径湾贝赛思国际学校读高三。你要说他是啥天才,还真不完全是——一年多前他连Transformer是啥都还没摸透,正经系统搞大模型也就是2025年才开始。
Transformer架构包括所谓的AI大模型根本不是一个神,不是祖宗的牌位,不要动不动就放在神位上供着,中国人的这些自媒体人都有病一样的。
你就把它当成个自行车链条,想怎么修就怎么修,马上就能搞明白了。
这个也不是什么高科技竞争。
说难听点,有小学生的知识你都可以去研究。
不要动不动就是中美之间最大的竞争,最高深的就是大模型,这个东西有什么高深的呢?当然难,但并不是不可以研究。
你供在祖宗牌位上,你不敢去看它一眼,你当然研究不明白了,这样固步自封一样的。
就是这个道理。整个AI圈把这玩意儿供成神了,好像Transformer是祖宗牌位不能碰。结果人家真动手拆了,发现也就那么回事儿。
好,我给大家用大白话重新捋一遍,不说一个术语。
先把背景说清楚
Transformer这东西,你可以理解成一条流水线。
比如有100个工位,每个工位干完活,把成果递给下一个工位。为了让东西不丢,每个工位除了收到上一家的货,还会顺手把最早第一家的货也复印一份带着。
问题是啥呢?带了100份复印稿在手上,后面的人根本分不清哪份有用哪份没用,全搅在一起了。而且越到后面,最早那份的原始信息就越模糊,跟传话游戏一模一样。
他干了啥?
第一个事:AttnRes(注意力残差)
以前每个工位拿到东西是"全部照单全收"——不管有用没用,前面所有人的活儿我都一股脑加上去。
陈广宇他们干的事就是:别全加了,挑着加。
每个工位现在多了个小本本,上面写着:
"第3个工位干的那个活儿对我有用,我拿80%;第40个工位那个垃圾活儿我只拿10%。"
也就是说,每个工位可以根据自己正在干的事,回头去前面翻档案,专门挑有用的信息拿来用,而不是把所有前人的活儿都无差别地堆上来。
就这么个事儿。
第二个事:Block AttnRes(分块版)
上面那个想法听着挺好,但你真在工厂里试一下就知道炸了——100个工位,每个工位都要存前面99个人的所有档案,还要随时翻出来算权重。仓库不够用,快递也送不过来。
所以他们想了个折中办法:别一对一翻了,分组。
把100个工位分成十几组,组内还是老规矩(全加),组与组之间才挑着加。这样仓库压力一下子就降下来了,效果还保留了八九成。
效果咋样?
就改了这么点东西,结果:
- 训练速度快了25%(本来要烧100天的卡,现在75天搞定)
- 花的成本只多了不到2%
- 做题成绩实打实涨了好几分
关键是这个改动让Kimi K3撑到了2.8万亿参数还能稳稳跑,没崩。
为啥轰动?
回到你说的那个点——大家太把Transformer当回事了。
这十年来所有人都默认"残差连接就是等权相加",没人问过一句"凭什么一定要等权?"就像自行车链条,大家都觉得出厂就这样不能改,结果人家拆开一看,换个链节方式骑得更快。
轰动不是因为难,是因为没人敢动手。
而一个17岁的高中生,在月之暗面实习期间,跟几个研究员一起把这个"不敢动的地方"给动了,还真的管用。这就跟一个高中生去修F1赛车发动机,修完还跑赢了,一个道理。
总结成一句话
以前每层都是"不管有用没用,前面所有人的活儿我全加上";现在改成"我回头看看,谁干得好我就多用谁的"。然后为了不让电脑爆内存,又搞了个分组版本。没了。
就这么朴素。你直觉完全没错,这东西本质上就是"试试呗,不行换一个",只不过大多数人连试都不敢试。
大家要是还想听,我可以接着给你掰扯那个KDA(混合线性注意力)是啥意思,那个更有意思,相当于把流水线上最慢的那个工位给换了 😏
每天都是干不完的活,每天早上醒来都几百个任务。






