← 文章 / AI技术
涌现AI笔记 3小时前 · 2026-10-05 02:47:27 · 9 阅读

16个大模型集体预测诺奖:AI知识体系的隐性边界,藏在投票结果里

QUOTE

16个大模型预测诺贝尔奖,结果暴露了AI知识体系的真实边界。

每年十月的诺奖开奖周,都是科技圈的固定节目。今年我们做了一个实验:让16个大模型来预测今年的诺贝尔奖。

这不是凑「AI猜奖」的热闹。我们真正想知道的是:当16个大模型面对同一个科学问题,它们的回答有多大程度的共识?又会暴露出怎样的系统性偏差?

我们用同一套提示词,关闭了所有模型的联网搜索功能,让它们仅凭训练知识作答。每个模型对四个奖项(物理/医学/化学/经济)各给出前三名预测,包含候选人、贡献、风向标奖项、置信度和推理过程。

64份预测、48个研究方向、上百位候选人。数据拉出来的那一刻,我们自己也惊讶了。

CONTENTS

01

16位选手全景

02

置信度差6.6倍

03

四奖项拆解

04

三大意外发现

05

开奖前悬念

06

诺奖公布日程

附录

提示词全文

01

THE MODELS

16位选手,它们都是谁

这次我们找来了目前全球最主流的16个大模型,覆盖中美新欧四个地区。开源模型占了7个,还不到半数。两年前根本不敢想。

5

美国模型

9

中国模型

2

欧/新模型

7

开源模型

🇺🇸 美国军团:五大旗舰,性格迥异

GPT-6 Astra · OpenAI · 闭源很保守 16.3%

OpenAI 最新的推理模型,是当前公认的顶尖模型。它的特点是极度谨慎。平均置信度只有 16.3%,在 16 个模型里排倒数第四。上一代 GPT-5.6 Luna 的置信度高达 68.8%,新一代反而更「谦虚」。OpenAI 可能在新模型中刻意校准了置信度输出。

GPT-5.6 Luna · OpenAI · 闭源比较自信 68.8%

上一代旗舰。Luna 的平均置信度高达 68.8%,排第三,和 Astra 形成鲜明对比。从 Luna 到 Astra 的置信度跳水,基本就是 OpenAI 两代模型风格变化的缩影。

Claude Opus 5.5 · Anthropic · 闭源最保守 11.3%

16个模型里最保守的那一个。Claude 以谨慎、严谨著称,永远不会把话说满,任何判断都要打个折。但置信度低不代表准确度低,它的推理质量在所有模型里属于第一梯队,「话少但准」。

Gemini 3.6 Flash · Google · 闭源最自信 74.8%

最自信的模型,平均置信度高达 74.8%,而且四个奖项的置信度稳定在 74-75%,几乎不波动。Google 的模型在科学事实类问题上表现一直很突出,知识更新也快。但它是不是「过度自信」?得等开奖后才能验证。

Grok 4.7 · xAI · 闭源比较保守 20.9%

风格跳脱、常常语出惊人,带点「马斯克式」的不确定感。它的预测有时候会出一些冷门方向,是16个模型里最有「惊喜感」的一个。

🇨🇳 中国军团:九人混战,实力不容小觑

Kimi K3 · 月之暗面 · 开源中等克制 39.2%

国产开源模型里的「长上下文专家」。推理质量在国产模型里属于第一梯队,提名也比较精准,是我们这次比较意外的国产模型之一。

DeepSeek V4 Pro · 深度求索 · 开源谨慎 27.1%

国产开源之光。推理能力强,提名质量高,在开源模型里属于头部水平。也是这次实验里「推理过程写得最详细」的模型之一。

文心 5.1 · 百度 · 闭源自信满满 70.9%

国产模型里最自信的,平均置信度 70.9%,排第二,仅次于 Gemini。文心的高自信很有意思。是因为训练数据里中文科学文献更「确定」,还是模型本身的风格偏好?值得后续研究。

通义千问 3.7 MAX · 阿里 · 闭源比较克制 30.0%

阿里的旗舰模型。整体表现稳定,没有特别突出的亮点,但也没有明显的短板。

Seed 2.1 Pro · 字节豆包 · 闭源保守 18.3%

字节的豆包模型。提名覆盖面广,但推理深度相对一般。

GLM-5.3 · 智谱/清华 · 开源非常保守 14.2%

智谱的开源旗舰。排倒数第三,非常谨慎。在科学问题上,GLM 倾向于给出更保守的判断。

MiniMax-M3 · 稀宇 · 开源中等偏上 55.5%

稀宇的开源模型,属于偏自信的类型。它的提名质量在国产开源模型里属于中上水平。

Hy4 Preview · 腾讯混元 · 开源比较保守 19.9%

腾讯的混元大模型,开源版本。整体表现稳定。

MiMo V2.6 Flash · 小米 · 开源比较保守 20.1%

小米的开源模型。在科学问题上的表现超出预期,提名质量在开源模型里属于中等偏上。

🇪🇺🇸🇬 欧新力量:两个意外

Mistral Large 3 · 法国 Mistral AI · 开源极度保守 12.9%

欧洲的开源之光。非常谨慎,仅次于 Claude。Mistral 以高效和技术实力著称,是欧洲数一数二的大模型公司。

Agnes 2.5 Flash · 新加坡 Sapiens AI · 闭源黑马自信 63.3%

这次最大的黑马。一个新加坡小团队的模型,平均置信度排第四,比绝大多数中美大厂模型都自信。它的提名质量和推理完整性在 16 个模型里能排到中上水平。

EXPERIMENTAL SETUP

所有预测在24小时内完成,关闭联网搜索,统一提示词,统一 JSON 输出格式。每个模型对每个奖项给出3个预测,共产生 16 × 4 × 3 = 192 条预测记录。


02

CONFIDENCE

置信度差了6.6倍,这说明了什么

统计完第一个意外就来了:置信度的差距大到离谱。

「同样是预测诺贝尔奖,Gemini 平均给74.8%的置信度,Claude Opus 只给11.3%,差了6.6倍。」

这背后不是能力差距,而是风格差距。我们把 16 个模型按平均置信度排了个序:

📊 总排名:自信派 vs 保守派

1

Gemini 3.6 Flash · 74.8% — 最自信的模型,四奖项稳定在74-75%,几乎不波动

2

文心 5.1 · 70.9% — 国产最自信,百度模型的风格偏确定

3

GPT-5.6 Luna · 68.8% — 上一代GPT很自信,新老差异巨大

4

Agnes 2.5 Flash · 63.3% — 新加坡黑马,自信度排第四

5

MiniMax-M3 · 55.5% — 稀宇模型,中等偏上自信

…

……中间 9 个模型在 14%-39% 之间……

15

Mistral Large 3 · 12.9% — 欧洲开源代表,极度谨慎

16

Claude Opus 5.5 · 11.3% — 最保守的模型,永远不把话说满

📈 分奖项看:每个模型的「自信领域」不一样

有意思的是,不同模型在不同奖项上的置信度是有波动的。我们整理了每个奖项的置信度 TOP3:

物理学奖

1. Gemini 74%

2. 文心 68.3%

3. Agnes 67%

医学奖

1. Gemini 75%

2. 文心 73.3%

3. GPT-5.6 70%

化学奖

1. Gemini 75%

2. GPT-5.6 71.3%

3. 文心 70.3%

经济学奖

1. Gemini 75%

2. 文心 71.7%

3. GPT-5.6 70%

Gemini 几乎在所有奖项上都是最自信的,而且稳定得惊人。四个奖项都是 74-75%,像设定好的一样。而 Claude Opus 在所有奖项上都是最保守的,物理学奖甚至只有 9.7%。

最有意思的是GPT-6 Astra 和 GPT-5.6 Luna 的对比:Luna 在四个奖项上的置信度都是 63-71%,而 Astra 只有 14-21%。两代模型差异之大,几乎不像同一个公司的产品。

置信度和准确度是什么关系?现在还说不准。得等开奖后,我们才能做「置信校准度」分析,看看是自信的模型更准,还是保守的模型更稳。


03

DEEP DIVE

四个奖项,逐个拆解

接下来是重头戏。我们逐个奖项来拆解:每个热门方向的科学意义是什么、热门候选人是谁、拿过哪些风向标奖项、模型们怎么看。

医学奖:GLP-1 vs 食欲素,双雄争霸

— 医学奖预测方向共识榜(GLP-1 高票领先,食欲素紧追)

🥇 GLP-1/代谢疾病 · 15/16票 · 11个Rank1

— GLP-1/代谢疾病方向 · 风向标奖项全览

这是本届预测中15个模型提名(16个中仅 Agnes 未提名)的方向。GLP-1 受体激动剂引发的全球减重革命,是近十年医药领域最具社会影响力的事件。司美格鲁肽的年销售额已经突破200亿美元,跻身人类历史上最畅销药物行列。

核心人物链:从发现到临床

Svetlana Mojsov— GLP-1 的发现者之一。她在 Joel Habener 实验室最早发现了 GLP-1 的基因序列和生物学活性,是整个故事的起点。

Jens Juul Holst— 丹麦哥本哈根大学生理学家。发现了 GLP-1 的肠道来源(L细胞),阐明了「肠促胰素效应」的生理机制:为什么口服葡萄糖比静脉注射更能刺激胰岛素分泌。

Daniel Drucker— 加拿大多伦多大学教授。打通了从基础生理到临床转化的关键环节:阐明了 GLP-1 受体的分布和功能,推动了 GLP-1 受体激动剂的药物开发。

不同模型给出了不同排列组合,但核心叙事一致:从发现到生理机制阐明到临床转化,构成一个完整的科学链条。

风向标信号也非常密集:2020年阿尔珀特奖、2024年拉斯克临床奖、2025年突破奖、2026年科睿唯安引文桂冠,四大风向标六年间接力指向同一主题。

THE BIG QUESTION

但 GLP-1 有一个隐忧:是不是太快了?诺奖通常表彰经受了时间检验的成果。司美格鲁肽2017年才获批,长期安全性数据还在积累。诺奖委员会愿意等,还是会被全球减重浪潮推着走?这是今年医学奖最大的悬念。

🥈 食欲素/睡眠 · 13票 · 4个Rank1

— 食欲素/睡眠方向 · 风向标奖项全览

如果 GLP-1 今年不拿,最大的受益者就是食欲素方向。柳泽正史(Masashi Yanagisawa)和 Emmanuel Mignot是这个领域的双子星。

科学家故事:两条路,一个发现

Yanagisawa 是日本科学家,现在美国西南医学中心。1998年,他的团队在 Cell 上发表里程碑论文,发现了一种新的神经肽,命名为「食欲素」(orexin),能刺激动物进食。

几乎同一时间,斯坦福大学的 Mignot 从另一个方向切入:他研究发作性睡病的狗模型,发现病因是食欲素受体基因的突变。后来又发现,人类患者脑脊液中食欲素水平几乎为零,产生食欲素的神经元被自身免疫系统破坏了。

两个团队从完全不同的角度出发,最后汇聚到同一个发现上:食欲素是调节睡眠-觉醒周期的关键分子。

这是一个非常「诺奖相」的发现。从分子发现,到动物模型,再到人类疾病,科学弧线完整而漂亮。2026年9月刚刚颁发的拉斯克基础医学研究奖,直接给了这两个人。距离诺奖公布只有四周,这是一个「超级信号」。

🥉 cGAS-STING/固有免疫 · 5票

— cGAS-STING/固有免疫方向 · 风向标奖项全览

陈志坚(Zhijian James Chen)发现的 cGAS-STING 通路,是近十五年免疫学最重大的发现。它解释了细胞如何感知胞质中的病毒 DNA,从而启动免疫反应。

这个发现的意义有多重大?它解释了抗病毒免疫的核心机制,也解释了为什么某些自身免疫疾病(如红斑狼疮)会发生。现在全球有几十个公司在开发 STING 激动剂和抑制剂,用于癌症免疫治疗和自身免疫疾病治疗。2024年拉斯克基础奖 + 2019年突破奖,双料风向标。

物理学奖:最分裂的一局

— 物理学奖预测方向共识榜(前三票数接近,最无悬念的反而是悬念本身)

物理学奖是四个奖项里共识度最低的。前三名票数咬得很紧,没有任何一个方向拿到压倒性优势。

🥇 量子反常霍尔效应/拓扑物态 · 12票 · 1个Rank1

— 量子反常霍尔效应方向 · 风向标奖项全览

总票数最高的是拓扑物态方向。核心人物是薛其坤——清华大学教授,中国科学院院士。

科学意义:不需要磁场的量子高速路

2013年,薛其坤团队在 Science 上发表震动凝聚态物理界的论文:在磁性掺杂的拓扑绝缘体薄膜中,首次实验观测到了量子反常霍尔效应。简单说:普通霍尔效应需要外加磁场,量子霍尔效应需要极强的磁场(几十万倍地球磁场),而量子反常霍尔效应是不需要外加磁场的量子霍尔效应。电子可以在材料边缘无耗散地单向运动,就像高速公路上的单行道。

但有意思的是,虽然总票数第一,但只有1个模型把它排第一。很多模型觉得这个方向「值得提名,但还不够拿奖」。如果获奖,将是中国大陆物理学家的首个诺贝尔物理学奖。

🥈 魔角石墨烯/转角电子学 · 11票 · 6个Rank1

— 魔角石墨烯方向 · 风向标奖项全览

Rank1 票数反而更高的是魔角石墨烯。这个方向是近年来凝聚态物理最火的领域,没有之一。

科学故事:从理论预言到实验发现的7年

2011年,理论物理学家Allan MacDonald和学生 Bistritzer 做了一个计算:如果把两层石墨烯以大约 1.1° 的「魔角」堆叠在一起,电子能带会变平,可能出现非常规超导。当时很多人觉得「太疯狂了」。

7年后的2018年,MIT 的Pablo Jarillo-Herrero团队真的做到了,观测到了莫特绝缘态和非常规超导。从此,「转角电子学」(Twistronics)这个全新的领域诞生了。

证据链非常完整:2020年沃尔夫奖 → 2025年 BBVA 奖 → 2026年科维理纳米科学奖。用一个模型的话说,这是「本周期物理领域信号密度最高的方向」。但它的问题在于:太新了。2018年才发现,距离现在才8年。诺奖一般会等更久。

🥉 光晶格钟/精密测量 · 11票 · 6个Rank1

— 光晶格钟方向 · 风向标奖项全览

和魔角石墨烯并列第二的是光晶格钟。叶军(Jun Ye)——美籍华裔物理学家,科罗拉多大学 JILA 研究所研究员。他可能是当前全球最被密集押注的物理诺奖候选。

文明级影响:宇宙年龄尺度,误差不到1秒

叶军的光晶格原子钟,精度达到了 10⁻¹⁸ 量级。整个宇宙年龄(138亿年)尺度上,误差不到 1 秒。光钟的意义远不止「准」:它可以用来检验基本物理常数是否随时间变化、探测引力波、定义新的时间标准。基于光钟的「新秒定义」已经进入国际计量议程。这是文明级的影响。

2026年沃尔夫物理学奖刚颁给了 Ye 和Immanuel Bloch(超冷原子量子模拟的先驱)。这是一个非常「诺奖口味」的方向。基础测量类的发现,是诺奖的传统偏爱。

物理学奖分裂的背后有个现实原因:2022到2025年,物理学奖连续四年落在量子信息/AMO/量子技术大类(量子纠缠、阿秒物理、人工神经网络、超导量子电路)。连续四年量子方向,历史罕见。2026年是不是该「平衡」一下?不同模型对这个「轮动逻辑」的判断差异很大。

化学奖:最没有悬念的一届?

— 化学奖预测方向共识榜(15/16 模型支持 DNA 测序)

🥇 高通量DNA测序(SBS技术)· 15/16票 · 15个Rank1

— 高通量DNA测序方向 · 风向标奖项全览

这是今年所有奖项里共识度最高的方向。16个模型里15个把它排化学奖第一,只有一个模型有不同意见。

核心候选人

Shankar Balasubramanian · David Klenerman · Pascal Mayer

三位的故事,几乎就是「学术创业的范本」。Balasubramanian 和 Klenerman 是剑桥大学化学教授,Mayer 是他们的博士后。上世纪90年代,三人在剑桥实验室里发明了「边合成边测序」(SBS)技术:在 DNA 复制过程中用荧光标记逐个读出碱基。

他们后来创办了 Solexa 公司,2007年被 Illumina 以 6 亿美元收购。今天 Illumina 的平台占全球 80% 以上测序市场,而核心原理依然是当年那三个人捣鼓出来的东西。这项发明把人类基因组测序成本从几十亿美元拉低到几百美元,下降了数百万倍。

风向标信号也强到离谱:2022年突破奖、2024年盖尔德纳国际奖、2026年沃尔夫化学奖,三大顶级奖项接力指向同一三人组。而且沃尔夫化学奖「明确将其纳入化学轨道」,等于帮诺奖委员会提前裁决了学科归属。

🥈 纳米药物递送 / 自组装单分子层 · 8票

— 纳米药物递送方向 · 风向标奖项全览

第二名争议比较大。有的模型押注 Robert Langer 的纳米药物递送,有的提到了 Pieter Cullis 的脂质纳米颗粒(LNP),后者是 mRNA 疫苗成功的「隐形功臣」。2023年医学奖给了 mRNA 的发现者,会不会在化学奖补上递送技术?这是一个合理的叙事。

还有的模型提到了自组装单分子层(SAMs)。Allara、Nuzzo 和 Sagiv 在 1980 年代的奠基性工作,现在已经成了整个表面化学和纳米技术的基础设施。Clarivate 2026 直接将三人列为引文桂冠。

🥉 碱基编辑 / 基因编辑化学 · 8票

— 碱基编辑/基因编辑化学方向 · 风向标奖项全览

碱基编辑被视为继 CRISPR 之后基因编辑领域的下一个里程碑。刘如谦(David R. Liu)实验室先后发明了胞嘧啶碱基编辑(CBE)、腺嘌呤碱基编辑(ABE)和先导编辑(Prime Editing)。核心思路是把 CRISPR 从"分子剪刀"升级为"分子修正器",不需要切断 DNA 双链就能精准改写单个碱基。

化学逻辑非常漂亮:通过蛋白质工程改造酶的活性中心,让化学反应在基因组的特定位点上精准发生。2025年突破奖、2026年沃尔夫医学奖等五大风向标的密集加持,体现了其跨学科的突破性价值。

它的主要竞争对手是纳米药物递送方向,两者同票并列第二。碱基编辑的优势在于化学原创性更强,劣势是临床应用还相对早期。

经济学奖:Woodford 领跑,多方向追击

— 经济学奖预测方向共识榜(Woodford 一骑绝尘,数字经济紧追)

🥇 货币政策/新凯恩斯宏观 · 14票 · 5个Rank1

— 货币政策/新凯恩斯方向 · 风向标奖项全览

Michael Woodford。这是经济学奖最没有争议的候选人。

学术地位:当代货币经济学的「圣经」作者

如果你问任何一个宏观经济学家:「过去三十年最重要的宏观经济理论家是谁?」十有八九会提到 Woodford。他的《利息与价格》(Interest and Prices, 2003)是当代货币经济学的圣经,几乎重新定义了整个领域。

Woodford 最大的贡献在于,他把「预期管理」这个概念系统地引入了货币政策框架。他告诉大家:货币政策真正的力量,不在于今天做了什么,而在于让市场相信你明天会做什么。他提出的「前瞻指引」思想,现在已经成为美联储、欧央行等全球主要央行的常规政策工具。

风向标奖项拿了个「大满贯」:2024年内默斯奖 + 2024年BBVA知识前沿奖 + 2026年科睿唯安引文桂冠奖,三重风向标确认。内默斯奖历来是诺奖最精确的前瞻指标(Milgrom、Wilson、Bernanke、Romer 等均先拿内默斯再拿诺奖)。

🥈 数字经济/信息经济学 · 11票 · 6个Rank1

— 数字经济/信息经济学方向 · 风向标奖项全览

如果说 Woodford 是「众望所归」,那数字经济就是「上升势头最猛」的方向。

双子星:理论先驱 + 方法开创者

Hal Varian— 谷歌首席经济学家。在加入谷歌之前,他是加州大学伯克利分校教授。他的《信息规则》(Information Rules)是互联网经济学的奠基之作。早在1998年,互联网还在拨号上网的时代,Varian 就系统地阐述了信息商品的定价规律、版本化策略、网络效应。这些理论后来几乎成了所有互联网公司的产品设计圣经。

Susan Athey— 首位获得约翰·贝茨·克拉克奖(2007年)的女性经济学家。她的研究横跨机制设计、市场设计、计量经济学,近年来更是把机器学习和因果推断结合起来,开创了一个全新的研究方向。

有意思的是,它的 Rank1 票数(6票)甚至超过了 Woodford(5票)。说明很多模型觉得「虽然 Woodford 是大热门,但今年可能会轮动到更有时代感的方向」。

🥉 劳动经济学/技术变革 · 6票 · 5个Rank1

— 劳动经济学/技术变革方向 · 风向标奖项全览

David Autor 和 Lawrence Katz代表的劳动经济学方向,讨论的是技术变革、全球化和不平等的关系。

Autor 可能是过去二十年最有影响力的实证经济学家。他和 Dorn 的「中国冲击」研究(2013年 AER 论文)被引用超过 6000 次,直接改变了整个贸易经济学的实证研究范式。而 Autor 和 Katz 提出的「ALM 任务模型」,则是讨论自动化和就业的标准框架。

在 AI 对就业的冲击成为全球热议话题的当下,给劳动经济学颁奖,会有很强的时代共鸣。


04

SURPRISES

三个意想不到的发现

做完统计,有几个观察让我们挺意外。

FINDING 01国产模型更「偏爱」中国科学家?

物理学奖的拓扑物态方向,国产模型几乎一致地支持薛其坤的量子反常霍尔效应,而美国模型则更分散地支持魔角石墨烯、光晶格钟等方向。这种差异可能反映了训练语料的语言和地域偏好。中文语料里中国科学家的工作被讨论得更多,英文语料里则更关注西方学界的热门话题。

这也引出了一个更值得思考的问题:大模型的「世界观」,到底在多大程度上被训练数据的语言和文化塑造?这可能是未来 AI 对齐研究中一个被忽视的维度。

FINDING 02开源模型完全不输闭源

7 个开源模型里,DeepSeek、Mistral、Kimi、GLM、Hy4 头部几个在推理严谨度和候选人准确度上,完全不输闭源旗舰。甚至在某些方向上,开源模型的提名更精准。这和我们对开源模型的普遍印象一致:2026 年的开源模型,已经不是「追着闭源跑」的定位了。

FINDING 03新加坡模型 Agnes 是匹黑马

来自新加坡的 Agnes 2.5 Flash 在测试中的表现超出预期。它的提名质量、推理完整性,在16个模型里能排到中上水平。而且它的置信度高达63.3%,排第四。一个新加坡小团队的模型,在科学知识上不输中美大厂,这件事本身就很有意思。


05

OUTLOOK

开奖前的四大悬念

距离开奖还有几天。最后我们整理了几个最值得关注的悬念:

1

GLP-1 到底能不能拿? 科学价值和社会影响力都够,但「是不是太快了」是最大疑问。诺奖委员会愿意等,还是会被全球减重浪潮推着走?

2

物理学奖真的会轮动吗? 连续四年量子方向之后,2026年是回归凝聚态,还是「破纪录」地再来一年量子?

3

化学奖会不会爆冷? DNA 测序看起来板上钉钉,但诺奖历史上「全民预测对」的情况其实并不多。如果爆冷,最可能从哪里冒出来?

4

数字经济能跑出来吗? Rank1 票数甚至超过了 Woodford。在 AI 时代背景下,诺奖委员会会不会提前加冕这个方向?

等开奖后,我们会把16个模型的预测和真实结果做一次完整的对撞分析。到时候才能真正看出,谁才是真正的「诺奖预言家」,谁又是「自信但不准」的虚高选手。

* 本文所有数据基于2026年10月4日采集的16个大模型预测结果

预测仅供研究参考,不构成任何投注建议


06

SCHEDULE

2026 诺奖公布日程

2026 年诺贝尔奖将于 10 月 5 日至 12 日陆续公布。以下是各奖项的具体时间(北京时间 = CEST + 6 小时):

10月

5

周一

生理学或医学奖

17:30 北京时间(11:30 CEST)· 卡罗林斯卡学院

10月

6

周二

物理学奖

17:45 北京时间(11:45 CEST)· 瑞典皇家科学院

10月

7

周三

化学奖

17:45 北京时间(11:45 CEST)· 瑞典皇家科学院

10月

8

周四

文学奖

19:00 北京时间(13:00 CEST)· 瑞典学院

10月

9

周五

和平奖

17:00 北京时间(11:00 CEST)· 挪威诺贝尔委员会

10月

12

周一

经济学奖

17:45 北京时间(11:45 CEST)· 瑞典皇家科学院

📺 所有奖项公布均在诺贝尔官网(nobelprize.org)直播,北京时间比瑞典时间早 6 小时。


APPENDIX

附录

实验用统一提示词全文

很多朋友问:你们到底给模型喂了什么提示词?下面就是本次实验使用的完整提示词,包含系统提示词和任务提示词两部分。16个模型用的是完全一样的版本,关闭联网搜索,统一 JSON 输出格式。

🧠 系统提示词(System Prompt)

...system_prompt.txt

你是一位科学政策与学术评价专家,拥有深厚的科学史背景和对全球前沿科研的广泛了解。

你的任务是基于公开的学术成果、引文影响力、过往获奖记录以及诺贝尔奖的评选传统,

对2026年诺贝尔奖获得者进行预测。

请严格遵循以下原则:

1. 基于事实和证据进行推理,不要凭空猜测

2. 考虑诺贝尔奖的评选偏好(偏向基础性发现、通常滞后于成果发表、重视独立贡献)

3. 重点参考「诺贝尔风向标奖项」——得主往往是诺奖的有力竞争者

 · 物理学:沃尔夫奖、突破奖、克拉福德奖、科维理奖、富兰克林奖章

 · 医学:拉斯克奖、盖尔德纳奖、沃尔夫奖、突破奖、邵逸夫奖

 · 化学:沃尔夫奖、普里斯特利奖章、威尔许化学奖、富兰克林奖

 · 经济学:克拉克奖、科睿唯安引文桂冠奖、BBVA知识前沿奖、内默斯奖

4. 每个奖项给出3位最可能的获奖者/团队,按可能性排序

5. 提供具体推理依据:关键论文、学术贡献、已获重要荣誉等

6. 对每个预测给出置信度评分(0-100%)

7. 如认为某领域可能连续获奖或存在轮动规律,请在分析中说明

8. 在每个候选人信息中列出其已获得的主要风向标奖项

📋 任务提示词 + JSON 输出格式(以物理学奖为例)

四个奖项的任务提示词结构一致,只是学科名称和方向列表不同。下面以物理学奖为例,展示完整的任务提示词和要求的 JSON 输出格式。

...task_prompt.json

请预测2026年诺贝尔物理学奖的获得者。

请考虑以下可能的方向:

- 凝聚态物理(如量子材料、高温超导、拓扑物态)

- 粒子物理与场论

- 天体物理与宇宙学

- 量子信息与量子计算

- 原子分子光物理

- 生物物理

请按以下JSON格式输出(不要使用markdown代码块包裹,直接输出纯JSON文本):

{

"physics": [

{

"rank": 1,

"names": ["获奖者姓名1", "获奖者姓名2"],

"affiliation": "机构/国家",

"contribution": "核心贡献简述",

"field": "具体子领域",

"wind_awards": ["已获风向标奖项1", "已获风向标奖项2"],

"confidence": 85,

"reasoning": "详细推理依据,包括关键成果、引文影响、已获重要奖项(特别是风向标奖项)等"

},

...(rank 2、rank 3 结构相同)

],

"field_analysis": "对今年物理学奖可能方向的整体分析",

"wind_award_analysis": "基于风向标奖项的预测分析(哪些风向标得主最有可能今年获奖)"

}

// temperature=0.2 · 关闭联网搜索 · 24小时内完成

EXPERIMENTAL SETUP

温度参数:temperature = 0.2,偏向确定性输出,减少随机性

联网搜索:全部关闭,仅基于模型训练数据

时间窗口:24小时内完成所有模型预测,减少时间差异

原始来源: 涌现AI笔记

评论 (0)