16个大模型集体预测诺奖:AI知识体系的隐性边界,藏在投票结果里
QUOTE
16个大模型预测诺贝尔奖,结果暴露了AI知识体系的真实边界。
每年十月的诺奖开奖周,都是科技圈的固定节目。今年我们做了一个实验:让16个大模型来预测今年的诺贝尔奖。
这不是凑「AI猜奖」的热闹。我们真正想知道的是:当16个大模型面对同一个科学问题,它们的回答有多大程度的共识?又会暴露出怎样的系统性偏差?
我们用同一套提示词,关闭了所有模型的联网搜索功能,让它们仅凭训练知识作答。每个模型对四个奖项(物理/医学/化学/经济)各给出前三名预测,包含候选人、贡献、风向标奖项、置信度和推理过程。
64份预测、48个研究方向、上百位候选人。数据拉出来的那一刻,我们自己也惊讶了。
CONTENTS
01
16位选手全景
02
置信度差6.6倍
03
四奖项拆解
04
三大意外发现
05
开奖前悬念
06
诺奖公布日程
附录
提示词全文
01
THE MODELS
16位选手,它们都是谁
这次我们找来了目前全球最主流的16个大模型,覆盖中美新欧四个地区。开源模型占了7个,还不到半数。两年前根本不敢想。
5
美国模型
9
中国模型
2
欧/新模型
7
开源模型
🇺🇸 美国军团:五大旗舰,性格迥异
GPT-6 Astra · OpenAI · 闭源很保守 16.3%
OpenAI 最新的推理模型,是当前公认的顶尖模型。它的特点是极度谨慎。平均置信度只有 16.3%,在 16 个模型里排倒数第四。上一代 GPT-5.6 Luna 的置信度高达 68.8%,新一代反而更「谦虚」。OpenAI 可能在新模型中刻意校准了置信度输出。
GPT-5.6 Luna · OpenAI · 闭源比较自信 68.8%
上一代旗舰。Luna 的平均置信度高达 68.8%,排第三,和 Astra 形成鲜明对比。从 Luna 到 Astra 的置信度跳水,基本就是 OpenAI 两代模型风格变化的缩影。
Claude Opus 5.5 · Anthropic · 闭源最保守 11.3%
16个模型里最保守的那一个。Claude 以谨慎、严谨著称,永远不会把话说满,任何判断都要打个折。但置信度低不代表准确度低,它的推理质量在所有模型里属于第一梯队,「话少但准」。
Gemini 3.6 Flash · Google · 闭源最自信 74.8%
最自信的模型,平均置信度高达 74.8%,而且四个奖项的置信度稳定在 74-75%,几乎不波动。Google 的模型在科学事实类问题上表现一直很突出,知识更新也快。但它是不是「过度自信」?得等开奖后才能验证。
Grok 4.7 · xAI · 闭源比较保守 20.9%
风格跳脱、常常语出惊人,带点「马斯克式」的不确定感。它的预测有时候会出一些冷门方向,是16个模型里最有「惊喜感」的一个。
🇨🇳 中国军团:九人混战,实力不容小觑
Kimi K3 · 月之暗面 · 开源中等克制 39.2%
国产开源模型里的「长上下文专家」。推理质量在国产模型里属于第一梯队,提名也比较精准,是我们这次比较意外的国产模型之一。
DeepSeek V4 Pro · 深度求索 · 开源谨慎 27.1%
国产开源之光。推理能力强,提名质量高,在开源模型里属于头部水平。也是这次实验里「推理过程写得最详细」的模型之一。
文心 5.1 · 百度 · 闭源自信满满 70.9%
国产模型里最自信的,平均置信度 70.9%,排第二,仅次于 Gemini。文心的高自信很有意思。是因为训练数据里中文科学文献更「确定」,还是模型本身的风格偏好?值得后续研究。
通义千问 3.7 MAX · 阿里 · 闭源比较克制 30.0%
阿里的旗舰模型。整体表现稳定,没有特别突出的亮点,但也没有明显的短板。
Seed 2.1 Pro · 字节豆包 · 闭源保守 18.3%
字节的豆包模型。提名覆盖面广,但推理深度相对一般。
GLM-5.3 · 智谱/清华 · 开源非常保守 14.2%
智谱的开源旗舰。排倒数第三,非常谨慎。在科学问题上,GLM 倾向于给出更保守的判断。
MiniMax-M3 · 稀宇 · 开源中等偏上 55.5%
稀宇的开源模型,属于偏自信的类型。它的提名质量在国产开源模型里属于中上水平。
Hy4 Preview · 腾讯混元 · 开源比较保守 19.9%
腾讯的混元大模型,开源版本。整体表现稳定。
MiMo V2.6 Flash · 小米 · 开源比较保守 20.1%
小米的开源模型。在科学问题上的表现超出预期,提名质量在开源模型里属于中等偏上。
🇪🇺🇸🇬 欧新力量:两个意外
Mistral Large 3 · 法国 Mistral AI · 开源极度保守 12.9%
欧洲的开源之光。非常谨慎,仅次于 Claude。Mistral 以高效和技术实力著称,是欧洲数一数二的大模型公司。
Agnes 2.5 Flash · 新加坡 Sapiens AI · 闭源黑马自信 63.3%
这次最大的黑马。一个新加坡小团队的模型,平均置信度排第四,比绝大多数中美大厂模型都自信。它的提名质量和推理完整性在 16 个模型里能排到中上水平。
EXPERIMENTAL SETUP
所有预测在24小时内完成,关闭联网搜索,统一提示词,统一 JSON 输出格式。每个模型对每个奖项给出3个预测,共产生 16 × 4 × 3 = 192 条预测记录。
02
CONFIDENCE
置信度差了6.6倍,这说明了什么
统计完第一个意外就来了:置信度的差距大到离谱。
「同样是预测诺贝尔奖,Gemini 平均给74.8%的置信度,Claude Opus 只给11.3%,差了6.6倍。」
这背后不是能力差距,而是风格差距。我们把 16 个模型按平均置信度排了个序:
📊 总排名:自信派 vs 保守派
1Gemini 3.6 Flash · 74.8% — 最自信的模型,四奖项稳定在74-75%,几乎不波动
2文心 5.1 · 70.9% — 国产最自信,百度模型的风格偏确定
3GPT-5.6 Luna · 68.8% — 上一代GPT很自信,新老差异巨大
4Agnes 2.5 Flash · 63.3% — 新加坡黑马,自信度排第四
5MiniMax-M3 · 55.5% — 稀宇模型,中等偏上自信
………中间 9 个模型在 14%-39% 之间……
15Mistral Large 3 · 12.9% — 欧洲开源代表,极度谨慎
16Claude Opus 5.5 · 11.3% — 最保守的模型,永远不把话说满
📈 分奖项看:每个模型的「自信领域」不一样
有意思的是,不同模型在不同奖项上的置信度是有波动的。我们整理了每个奖项的置信度 TOP3:
物理学奖
1. Gemini 74%
2. 文心 68.3%
3. Agnes 67%
医学奖
1. Gemini 75%
2. 文心 73.3%
3. GPT-5.6 70%
化学奖
1. Gemini 75%
2. GPT-5.6 71.3%
3. 文心 70.3%
经济学奖
1. Gemini 75%
2. 文心 71.7%
3. GPT-5.6 70%
Gemini 几乎在所有奖项上都是最自信的,而且稳定得惊人。四个奖项都是 74-75%,像设定好的一样。而 Claude Opus 在所有奖项上都是最保守的,物理学奖甚至只有 9.7%。
最有意思的是GPT-6 Astra 和 GPT-5.6 Luna 的对比:Luna 在四个奖项上的置信度都是 63-71%,而 Astra 只有 14-21%。两代模型差异之大,几乎不像同一个公司的产品。
置信度和准确度是什么关系?现在还说不准。得等开奖后,我们才能做「置信校准度」分析,看看是自信的模型更准,还是保守的模型更稳。
03
DEEP DIVE
四个奖项,逐个拆解
接下来是重头戏。我们逐个奖项来拆解:每个热门方向的科学意义是什么、热门候选人是谁、拿过哪些风向标奖项、模型们怎么看。
医学奖:GLP-1 vs 食欲素,双雄争霸

— 医学奖预测方向共识榜(GLP-1 高票领先,食欲素紧追)
🥇 GLP-1/代谢疾病 · 15/16票 · 11个Rank1

— GLP-1/代谢疾病方向 · 风向标奖项全览
这是本届预测中15个模型提名(16个中仅 Agnes 未提名)的方向。GLP-1 受体激动剂引发的全球减重革命,是近十年医药领域最具社会影响力的事件。司美格鲁肽的年销售额已经突破200亿美元,跻身人类历史上最畅销药物行列。
核心人物链:从发现到临床
Svetlana Mojsov— GLP-1 的发现者之一。她在 Joel Habener 实验室最早发现了 GLP-1 的基因序列和生物学活性,是整个故事的起点。
Jens Juul Holst— 丹麦哥本哈根大学生理学家。发现了 GLP-1 的肠道来源(L细胞),阐明了「肠促胰素效应」的生理机制:为什么口服葡萄糖比静脉注射更能刺激胰岛素分泌。
Daniel Drucker— 加拿大多伦多大学教授。打通了从基础生理到临床转化的关键环节:阐明了 GLP-1 受体的分布和功能,推动了 GLP-1 受体激动剂的药物开发。
不同模型给出了不同排列组合,但核心叙事一致:从发现到生理机制阐明到临床转化,构成一个完整的科学链条。
风向标信号也非常密集:2020年阿尔珀特奖、2024年拉斯克临床奖、2025年突破奖、2026年科睿唯安引文桂冠,四大风向标六年间接力指向同一主题。
THE BIG QUESTION
但 GLP-1 有一个隐忧:是不是太快了?诺奖通常表彰经受了时间检验的成果。司美格鲁肽2017年才获批,长期安全性数据还在积累。诺奖委员会愿意等,还是会被全球减重浪潮推着走?这是今年医学奖最大的悬念。
🥈 食欲素/睡眠 · 13票 · 4个Rank1
— 食欲素/睡眠方向 · 风向标奖项全览
如果 GLP-1 今年不拿,最大的受益者就是食欲素方向。柳泽正史(Masashi Yanagisawa)和 Emmanuel Mignot是这个领域的双子星。
科学家故事:两条路,一个发现
Yanagisawa 是日本科学家,现在美国西南医学中心。1998年,他的团队在 Cell 上发表里程碑论文,发现了一种新的神经肽,命名为「食欲素」(orexin),能刺激动物进食。
几乎同一时间,斯坦福大学的 Mignot 从另一个方向切入:他研究发作性睡病的狗模型,发现病因是食欲素受体基因的突变。后来又发现,人类患者脑脊液中食欲素水平几乎为零,产生食欲素的神经元被自身免疫系统破坏了。
两个团队从完全不同的角度出发,最后汇聚到同一个发现上:食欲素是调节睡眠-觉醒周期的关键分子。
这是一个非常「诺奖相」的发现。从分子发现,到动物模型,再到人类疾病,科学弧线完整而漂亮。2026年9月刚刚颁发的拉斯克基础医学研究奖,直接给了这两个人。距离诺奖公布只有四周,这是一个「超级信号」。
🥉 cGAS-STING/固有免疫 · 5票

— cGAS-STING/固有免疫方向 · 风向标奖项全览
陈志坚(Zhijian James Chen)发现的 cGAS-STING 通路,是近十五年免疫学最重大的发现。它解释了细胞如何感知胞质中的病毒 DNA,从而启动免疫反应。
这个发现的意义有多重大?它解释了抗病毒免疫的核心机制,也解释了为什么某些自身免疫疾病(如红斑狼疮)会发生。现在全球有几十个公司在开发 STING 激动剂和抑制剂,用于癌症免疫治疗和自身免疫疾病治疗。2024年拉斯克基础奖 + 2019年突破奖,双料风向标。
物理学奖:最分裂的一局

— 物理学奖预测方向共识榜(前三票数接近,最无悬念的反而是悬念本身)
物理学奖是四个奖项里共识度最低的。前三名票数咬得很紧,没有任何一个方向拿到压倒性优势。
🥇 量子反常霍尔效应/拓扑物态 · 12票 · 1个Rank1

— 量子反常霍尔效应方向 · 风向标奖项全览
总票数最高的是拓扑物态方向。核心人物是薛其坤——清华大学教授,中国科学院院士。
科学意义:不需要磁场的量子高速路
2013年,薛其坤团队在 Science 上发表震动凝聚态物理界的论文:在磁性掺杂的拓扑绝缘体薄膜中,首次实验观测到了量子反常霍尔效应。简单说:普通霍尔效应需要外加磁场,量子霍尔效应需要极强的磁场(几十万倍地球磁场),而量子反常霍尔效应是不需要外加磁场的量子霍尔效应。电子可以在材料边缘无耗散地单向运动,就像高速公路上的单行道。
但有意思的是,虽然总票数第一,但只有1个模型把它排第一。很多模型觉得这个方向「值得提名,但还不够拿奖」。如果获奖,将是中国大陆物理学家的首个诺贝尔物理学奖。
🥈 魔角石墨烯/转角电子学 · 11票 · 6个Rank1

— 魔角石墨烯方向 · 风向标奖项全览
Rank1 票数反而更高的是魔角石墨烯。这个方向是近年来凝聚态物理最火的领域,没有之一。
科学故事:从理论预言到实验发现的7年
2011年,理论物理学家Allan MacDonald和学生 Bistritzer 做了一个计算:如果把两层石墨烯以大约 1.1° 的「魔角」堆叠在一起,电子能带会变平,可能出现非常规超导。当时很多人觉得「太疯狂了」。
7年后的2018年,MIT 的Pablo Jarillo-Herrero团队真的做到了,观测到了莫特绝缘态和非常规超导。从此,「转角电子学」(Twistronics)这个全新的领域诞生了。
证据链非常完整:2020年沃尔夫奖 → 2025年 BBVA 奖 → 2026年科维理纳米科学奖。用一个模型的话说,这是「本周期物理领域信号密度最高的方向」。但它的问题在于:太新了。2018年才发现,距离现在才8年。诺奖一般会等更久。
🥉 光晶格钟/精密测量 · 11票 · 6个Rank1

— 光晶格钟方向 · 风向标奖项全览
和魔角石墨烯并列第二的是光晶格钟。叶军(Jun Ye)——美籍华裔物理学家,科罗拉多大学 JILA 研究所研究员。他可能是当前全球最被密集押注的物理诺奖候选。
文明级影响:宇宙年龄尺度,误差不到1秒
叶军的光晶格原子钟,精度达到了 10⁻¹⁸ 量级。整个宇宙年龄(138亿年)尺度上,误差不到 1 秒。光钟的意义远不止「准」:它可以用来检验基本物理常数是否随时间变化、探测引力波、定义新的时间标准。基于光钟的「新秒定义」已经进入国际计量议程。这是文明级的影响。
2026年沃尔夫物理学奖刚颁给了 Ye 和Immanuel Bloch(超冷原子量子模拟的先驱)。这是一个非常「诺奖口味」的方向。基础测量类的发现,是诺奖的传统偏爱。
物理学奖分裂的背后有个现实原因:2022到2025年,物理学奖连续四年落在量子信息/AMO/量子技术大类(量子纠缠、阿秒物理、人工神经网络、超导量子电路)。连续四年量子方向,历史罕见。2026年是不是该「平衡」一下?不同模型对这个「轮动逻辑」的判断差异很大。
化学奖:最没有悬念的一届?

— 化学奖预测方向共识榜(15/16 模型支持 DNA 测序)
🥇 高通量DNA测序(SBS技术)· 15/16票 · 15个Rank1
— 高通量DNA测序方向 · 风向标奖项全览
这是今年所有奖项里共识度最高的方向。16个模型里15个把它排化学奖第一,只有一个模型有不同意见。
核心候选人
Shankar Balasubramanian · David Klenerman · Pascal Mayer
三位的故事,几乎就是「学术创业的范本」。Balasubramanian 和 Klenerman 是剑桥大学化学教授,Mayer 是他们的博士后。上世纪90年代,三人在剑桥实验室里发明了「边合成边测序」(SBS)技术:在 DNA 复制过程中用荧光标记逐个读出碱基。
他们后来创办了 Solexa 公司,2007年被 Illumina 以 6 亿美元收购。今天 Illumina 的平台占全球 80% 以上测序市场,而核心原理依然是当年那三个人捣鼓出来的东西。这项发明把人类基因组测序成本从几十亿美元拉低到几百美元,下降了数百万倍。
风向标信号也强到离谱:2022年突破奖、2024年盖尔德纳国际奖、2026年沃尔夫化学奖,三大顶级奖项接力指向同一三人组。而且沃尔夫化学奖「明确将其纳入化学轨道」,等于帮诺奖委员会提前裁决了学科归属。
🥈 纳米药物递送 / 自组装单分子层 · 8票

— 纳米药物递送方向 · 风向标奖项全览
第二名争议比较大。有的模型押注 Robert Langer 的纳米药物递送,有的提到了 Pieter Cullis 的脂质纳米颗粒(LNP),后者是 mRNA 疫苗成功的「隐形功臣」。2023年医学奖给了 mRNA 的发现者,会不会在化学奖补上递送技术?这是一个合理的叙事。
还有的模型提到了自组装单分子层(SAMs)。Allara、Nuzzo 和 Sagiv 在 1980 年代的奠基性工作,现在已经成了整个表面化学和纳米技术的基础设施。Clarivate 2026 直接将三人列为引文桂冠。
🥉 碱基编辑 / 基因编辑化学 · 8票

— 碱基编辑/基因编辑化学方向 · 风向标奖项全览
碱基编辑被视为继 CRISPR 之后基因编辑领域的下一个里程碑。刘如谦(David R. Liu)实验室先后发明了胞嘧啶碱基编辑(CBE)、腺嘌呤碱基编辑(ABE)和先导编辑(Prime Editing)。核心思路是把 CRISPR 从"分子剪刀"升级为"分子修正器",不需要切断 DNA 双链就能精准改写单个碱基。
化学逻辑非常漂亮:通过蛋白质工程改造酶的活性中心,让化学反应在基因组的特定位点上精准发生。2025年突破奖、2026年沃尔夫医学奖等五大风向标的密集加持,体现了其跨学科的突破性价值。
它的主要竞争对手是纳米药物递送方向,两者同票并列第二。碱基编辑的优势在于化学原创性更强,劣势是临床应用还相对早期。
经济学奖:Woodford 领跑,多方向追击

— 经济学奖预测方向共识榜(Woodford 一骑绝尘,数字经济紧追)
🥇 货币政策/新凯恩斯宏观 · 14票 · 5个Rank1

— 货币政策/新凯恩斯方向 · 风向标奖项全览
Michael Woodford。这是经济学奖最没有争议的候选人。
学术地位:当代货币经济学的「圣经」作者
如果你问任何一个宏观经济学家:「过去三十年最重要的宏观经济理论家是谁?」十有八九会提到 Woodford。他的《利息与价格》(Interest and Prices, 2003)是当代货币经济学的圣经,几乎重新定义了整个领域。
Woodford 最大的贡献在于,他把「预期管理」这个概念系统地引入了货币政策框架。他告诉大家:货币政策真正的力量,不在于今天做了什么,而在于让市场相信你明天会做什么。他提出的「前瞻指引」思想,现在已经成为美联储、欧央行等全球主要央行的常规政策工具。
风向标奖项拿了个「大满贯」:2024年内默斯奖 + 2024年BBVA知识前沿奖 + 2026年科睿唯安引文桂冠奖,三重风向标确认。内默斯奖历来是诺奖最精确的前瞻指标(Milgrom、Wilson、Bernanke、Romer 等均先拿内默斯再拿诺奖)。
🥈 数字经济/信息经济学 · 11票 · 6个Rank1

— 数字经济/信息经济学方向 · 风向标奖项全览
如果说 Woodford 是「众望所归」,那数字经济就是「上升势头最猛」的方向。
双子星:理论先驱 + 方法开创者
Hal Varian— 谷歌首席经济学家。在加入谷歌之前,他是加州大学伯克利分校教授。他的《信息规则》(Information Rules)是互联网经济学的奠基之作。早在1998年,互联网还在拨号上网的时代,Varian 就系统地阐述了信息商品的定价规律、版本化策略、网络效应。这些理论后来几乎成了所有互联网公司的产品设计圣经。
Susan Athey— 首位获得约翰·贝茨·克拉克奖(2007年)的女性经济学家。她的研究横跨机制设计、市场设计、计量经济学,近年来更是把机器学习和因果推断结合起来,开创了一个全新的研究方向。
有意思的是,它的 Rank1 票数(6票)甚至超过了 Woodford(5票)。说明很多模型觉得「虽然 Woodford 是大热门,但今年可能会轮动到更有时代感的方向」。
🥉 劳动经济学/技术变革 · 6票 · 5个Rank1

— 劳动经济学/技术变革方向 · 风向标奖项全览
David Autor 和 Lawrence Katz代表的劳动经济学方向,讨论的是技术变革、全球化和不平等的关系。
Autor 可能是过去二十年最有影响力的实证经济学家。他和 Dorn 的「中国冲击」研究(2013年 AER 论文)被引用超过 6000 次,直接改变了整个贸易经济学的实证研究范式。而 Autor 和 Katz 提出的「ALM 任务模型」,则是讨论自动化和就业的标准框架。
在 AI 对就业的冲击成为全球热议话题的当下,给劳动经济学颁奖,会有很强的时代共鸣。
04
SURPRISES
三个意想不到的发现
做完统计,有几个观察让我们挺意外。
FINDING 01国产模型更「偏爱」中国科学家?物理学奖的拓扑物态方向,国产模型几乎一致地支持薛其坤的量子反常霍尔效应,而美国模型则更分散地支持魔角石墨烯、光晶格钟等方向。这种差异可能反映了训练语料的语言和地域偏好。中文语料里中国科学家的工作被讨论得更多,英文语料里则更关注西方学界的热门话题。
这也引出了一个更值得思考的问题:大模型的「世界观」,到底在多大程度上被训练数据的语言和文化塑造?这可能是未来 AI 对齐研究中一个被忽视的维度。
FINDING 02开源模型完全不输闭源7 个开源模型里,DeepSeek、Mistral、Kimi、GLM、Hy4 头部几个在推理严谨度和候选人准确度上,完全不输闭源旗舰。甚至在某些方向上,开源模型的提名更精准。这和我们对开源模型的普遍印象一致:2026 年的开源模型,已经不是「追着闭源跑」的定位了。
FINDING 03新加坡模型 Agnes 是匹黑马来自新加坡的 Agnes 2.5 Flash 在测试中的表现超出预期。它的提名质量、推理完整性,在16个模型里能排到中上水平。而且它的置信度高达63.3%,排第四。一个新加坡小团队的模型,在科学知识上不输中美大厂,这件事本身就很有意思。
05
OUTLOOK
开奖前的四大悬念
距离开奖还有几天。最后我们整理了几个最值得关注的悬念:
1GLP-1 到底能不能拿? 科学价值和社会影响力都够,但「是不是太快了」是最大疑问。诺奖委员会愿意等,还是会被全球减重浪潮推着走?
2物理学奖真的会轮动吗? 连续四年量子方向之后,2026年是回归凝聚态,还是「破纪录」地再来一年量子?
3化学奖会不会爆冷? DNA 测序看起来板上钉钉,但诺奖历史上「全民预测对」的情况其实并不多。如果爆冷,最可能从哪里冒出来?
4数字经济能跑出来吗? Rank1 票数甚至超过了 Woodford。在 AI 时代背景下,诺奖委员会会不会提前加冕这个方向?
等开奖后,我们会把16个模型的预测和真实结果做一次完整的对撞分析。到时候才能真正看出,谁才是真正的「诺奖预言家」,谁又是「自信但不准」的虚高选手。
* 本文所有数据基于2026年10月4日采集的16个大模型预测结果
预测仅供研究参考,不构成任何投注建议
06
SCHEDULE
2026 诺奖公布日程
2026 年诺贝尔奖将于 10 月 5 日至 12 日陆续公布。以下是各奖项的具体时间(北京时间 = CEST + 6 小时):
10月
5
周一
生理学或医学奖
17:30 北京时间(11:30 CEST)· 卡罗林斯卡学院
10月
6
周二
物理学奖
17:45 北京时间(11:45 CEST)· 瑞典皇家科学院
10月
7
周三
化学奖
17:45 北京时间(11:45 CEST)· 瑞典皇家科学院
10月
8
周四
文学奖
19:00 北京时间(13:00 CEST)· 瑞典学院
10月
9
周五
和平奖
17:00 北京时间(11:00 CEST)· 挪威诺贝尔委员会
10月
12
周一
经济学奖
17:45 北京时间(11:45 CEST)· 瑞典皇家科学院
📺 所有奖项公布均在诺贝尔官网(nobelprize.org)直播,北京时间比瑞典时间早 6 小时。
APPENDIX
附录
实验用统一提示词全文
很多朋友问:你们到底给模型喂了什么提示词?下面就是本次实验使用的完整提示词,包含系统提示词和任务提示词两部分。16个模型用的是完全一样的版本,关闭联网搜索,统一 JSON 输出格式。
🧠 系统提示词(System Prompt)
...system_prompt.txt你是一位科学政策与学术评价专家,拥有深厚的科学史背景和对全球前沿科研的广泛了解。
你的任务是基于公开的学术成果、引文影响力、过往获奖记录以及诺贝尔奖的评选传统,
对2026年诺贝尔奖获得者进行预测。
请严格遵循以下原则:
1. 基于事实和证据进行推理,不要凭空猜测
2. 考虑诺贝尔奖的评选偏好(偏向基础性发现、通常滞后于成果发表、重视独立贡献)
3. 重点参考「诺贝尔风向标奖项」——得主往往是诺奖的有力竞争者
· 物理学:沃尔夫奖、突破奖、克拉福德奖、科维理奖、富兰克林奖章
· 医学:拉斯克奖、盖尔德纳奖、沃尔夫奖、突破奖、邵逸夫奖
· 化学:沃尔夫奖、普里斯特利奖章、威尔许化学奖、富兰克林奖
· 经济学:克拉克奖、科睿唯安引文桂冠奖、BBVA知识前沿奖、内默斯奖
4. 每个奖项给出3位最可能的获奖者/团队,按可能性排序
5. 提供具体推理依据:关键论文、学术贡献、已获重要荣誉等
6. 对每个预测给出置信度评分(0-100%)
7. 如认为某领域可能连续获奖或存在轮动规律,请在分析中说明
8. 在每个候选人信息中列出其已获得的主要风向标奖项
📋 任务提示词 + JSON 输出格式(以物理学奖为例)
四个奖项的任务提示词结构一致,只是学科名称和方向列表不同。下面以物理学奖为例,展示完整的任务提示词和要求的 JSON 输出格式。
...task_prompt.json请预测2026年诺贝尔物理学奖的获得者。
请考虑以下可能的方向:
- 凝聚态物理(如量子材料、高温超导、拓扑物态)
- 粒子物理与场论
- 天体物理与宇宙学
- 量子信息与量子计算
- 原子分子光物理
- 生物物理
请按以下JSON格式输出(不要使用markdown代码块包裹,直接输出纯JSON文本):
{
"physics": [
{
"rank": 1,
"names": ["获奖者姓名1", "获奖者姓名2"],
"affiliation": "机构/国家",
"contribution": "核心贡献简述",
"field": "具体子领域",
"wind_awards": ["已获风向标奖项1", "已获风向标奖项2"],
"confidence": 85,
"reasoning": "详细推理依据,包括关键成果、引文影响、已获重要奖项(特别是风向标奖项)等"
},
...(rank 2、rank 3 结构相同)
],
"field_analysis": "对今年物理学奖可能方向的整体分析",
"wind_award_analysis": "基于风向标奖项的预测分析(哪些风向标得主最有可能今年获奖)"
}
// temperature=0.2 · 关闭联网搜索 · 24小时内完成
EXPERIMENTAL SETUP
温度参数:temperature = 0.2,偏向确定性输出,减少随机性
联网搜索:全部关闭,仅基于模型训练数据
时间窗口:24小时内完成所有模型预测,减少时间差异