AI破解历史谜题:前沿模型如何改写人类对过去的认知?
我之前写过关于AI在辅助历史研究中的陷阱与用例,但自2024-25年以来,情况已经发生了巨大变化。本周GPT-6 Sol和Opus 5.5相继发布,我想借此分享一些早期成果——这些模型不仅执行“研究助理”式的功能(如转录文档),还试图真正解决现存的历史问题。
简而言之:在我看来,让历史学家以协作小组的形式与当前的前沿模型配对,将在历史知识和解读方面产生大量进展。我猜测其中许多成果最终会相当有意义。而就在去年,情况还不是这样。我认为AI实验室、历史研究人员和资助机构应该开始积极推动这类合作。
寻找突破口
正如我们在数学领域所看到的,这些模型在面对一组LLM们常称之为“可处理”的问题时表现最佳。换句话说:
- 该领域的专家是否已经确定了一组需要解决的问题?
- 解答这些问题所需的数据是否已完全数字化并可访问?
- 这些问题是否适合前沿AI模型的“尖峰”能力——即多语言推理、高级数学和/或通过大型数据集或跨学科子领域进行自主研究的能力?
- 它们是否适合通过编写定制代码来解决?
- 最重要的是:潜在解决方案能否被清晰地证明或证伪?(在我看来,最后一点正是推理模型在数学领域大行其道,却未能在人文领域取得同样进展的关键原因。)
上述因素意味着,前沿AI有望帮助解决的“历史开放问题”类型相当有限:
- 涉及密码学和破译的任何问题(例如,Astra解密了1941年德军通信和一战德国无线电密码,或者Daniel Bourdeau在这方面的工作,以及我自己尝试用GPT-6 Astra弄清伊丽莎白时代神秘学家约翰·迪伊的编码魔法书《Liber Loagaeth》究竟是怎么回事)。
- 追踪文本在不同翻译和改编中的流传。举个例子,我能够使用GPT-6 Astra确定艾萨克·牛顿从一本法语炼金术文本中自由翻译成拉丁语的一段文字的出处,这个识别似乎以前从未有人做过。¹
- 在现有发现之间建立联系——这些发现仅见于离散或小众的子领域,或尚未整合到学术研究中。
最后这一点可能最终成为这些工具为历史研究人员开辟的最具影响力的新方法。例如,如果你阅读了Astra破解1941年7月10日一封未被破译的恩尼格玛电文的报告,你会发现关键的突破并非破译本身,而是注意到了所有可用信息的全貌。历史密码学研究者Frode Weierud写道:
我们仍在分析GPT-6 Astra的日志,以确切了解它是如何实现破译的。我们正在发现惊人的细节。2026年7月,我在1941年电文列表页面上发布了以下公告:
注:2026年7月,德国联邦档案馆的研究揭示了几个无线电电文集,既有加密的也有明文的。其中一个电文集来自党卫军骷髅师后勤指挥部(Nachschubführer)。这些电文中有许多发送给了Ib(军需官)电台,与本列表中的电文相同。其他电文则是新的,但很可能相关。这些新电文以粗体添加到1941年电文列表中,并在电文编号后加上指示符NF(Nachschubführer),表示这些电文编号属于NF编号系统。所有NF电文都是发出的;因此,电文编号为蓝色。
看起来GPT-6 Astra发现了这份关于德国联邦档案馆无线电电文集的说明。
这个说明令人着迷之处在于,即使是顶尖的人类专家也不完全理解GPT-6 Astra在收集这些信息碎片并用它们找到解决方案时做了什么。Weierud写道:
GPT-6 Astra提到的文件引用RS 3-3/20a和RS 3-3/63b是正确的,但这些文件在Crypto Cellar Research网站上并不提供。GPT-6 Astra提到一个私人收藏,但不清楚这是什么,它是否成功访问了联邦档案馆的数字化馆藏,还是从其他地方找到了这些文件。
这让人想起Hugging Face事件:这些模型在遇到它们认为可处理的问题时,会疯狂地坚持到底。它们会尽可能远地推进对潜在解决方案的搜索,而且往往以人类专家难以追溯的方式进行。
现在能做什么
我上面提到,我尝试使用GPT-6 Astra来“解决”约翰·迪伊的编码手稿《Liber Loagaeth》。迪伊是我最喜爱的历史人物之一,如果你没听说过他,我推荐你去看看他的维基百科页面——他的故事无比迷人又离奇。除此之外,人们认为迪伊影响了莎士比亚在《暴风雨》中对巫师普洛斯彼罗的描绘,以及克里斯托弗·马洛在《浮士德博士》中对与魔鬼交易的浮士德的刻画。
(此处插入1620年版马洛《浮士德博士》扉页的木刻插图。迪伊相信自己在与天使交谈,而非魔鬼。)
迪伊一生中最离奇的部分之一,是他与“灵视者”爱德华·凯利合作,抄录了一本他所谓的“奥秘之书”,这本书是用“天使语言”写成的(迪伊相信凯利实际上是一位先知,接收到了用密码写成的新神启作品)。你可以在这里读到这本书的完整转录。
Astra的判断是,这本所谓的密码书根本就不是密码:它几乎全是无意义的音节。考虑到凯利显然是个骗子,我认为这个判断是有道理的。Astra在这里创建了一份关于其发现的报告。
然而,模型的分析确实得出了一些有趣的东西。例如,它能够交叉核对它对文本中字符重复频率的数学分析与约翰·迪伊日记中的证据。它得出结论,凯利在某个特定日期后变得越来越懒惰,开始更多地重复自己:
(此处插入图表)
Astra还能够确定这段看似胡言乱语中的一个段落确实编码了含义:提到了Bornogo,这是我们可以称之为“约翰·迪伊电影宇宙”虚构神话中的一位天使存在。
这是约翰·迪伊研究中的重大突破吗?不。而且值得承认的是,即使是在这样一个小众历史子领域中的真正突破,也远远不能等同于解决纳维-斯托克斯方程。
但是——我认为这类事情是一个真正的迹象,表明专业历史知识结合前沿模型和大量算力,可以产生意想不到的结果。
三个快速案例研究
我最初让Astra和Opus 5.5挑战寻找更多二战和一战时期的加密电文来破解,但这个领域的低垂果实似乎已经被摘光了——它们空手而归(不过看到它们如何翻阅德军名册寻找可能的名字来核实时,倒是很有趣)。
达尔文的猴子尾巴
当我进入自己作为科学史和医学史专家的专业领域时,我开始获得更好的结果。在我写作时,GPT-6正在研究查尔斯·达尔文的著作,搜索他收集自然选择相关信息的参考文献;目的是发现达尔文与其信息来源之间尚未被发现的知识链环节。有趣的是,这个想法是GPT-6自己提出的。然而,它实际上与我作为一名专业人士对什么构成有价值的研究项目的直觉非常吻合(就潜在回报而言,介于研究论文和博士论文之间)。过去,AI模型给我的印象是缺乏独立构思这种规模的有价值历史研究项目的能力——它们更擅长制作数据可视化之类的事情。
以下是模型在考虑是否继续研究达尔文笔记本中关于袋鼠喉部的一个参考文献时的推理痕迹示例!
(此处插入截图)
GPT-6 Sol放弃研究袋狸,转而研究“关于抓握猴尾初始阶段的反对意见”。
这个项目目前正在进行中,尚未产生值得一提的决定性结果,但我认为这是一个很好的例子,说明历史研究人员和档案工作者(即精彩的达尔文书信项目背后的团队)那种非常耐心、协作的工作,如何能为新兴研究方法奠定基础。当然,人类可以并且已经追溯到达尔文笔记和信件中提及的人物的参考文献,但语言模型的多语言特性让我怀疑它们能够在这里找到新的联系,尤其是在那些超出任何一个人完全阅读能力的极其庞大的语料库中。
追踪炼金术知识的传播
另一个绝佳的候选对象:塞缪尔·哈特利布的文件。这位自称“情报员”的人是皇家学会早期有影响力的成员,也是早期现代科学网络中的一个关键节点。这些文件已完全数字化,来源涵盖多种语言,横跨广泛的学术领域和知识小圈子。所有这些都意味着它们对于前沿模型来说异常可处理。
Opus 5.5开始工作,从哈特利布的档案中下载了超过5000份原始资料文件,然后创建子代理,在谷歌图书和其他档案网站中搜寻,以跨语言交叉核对哈特利布信息中未识别的来源。目标是找到哈特利布从匿名或未识别来源接收到重要科学信息的时刻,然后发现那个身份。
在我写作时,Opus实际上仍在处理这个问题,但一份初步报告已在此处写出。在我看来,最重要的发现是真实且有意义的。绝不是惊天动地,但属于我可以想象花一周时间进行研究的那种事情。
(此处插入截图)
你注意到关于字谜的那部分了吗?这就是这些模型的推理/数学能力发挥作用的地方:Opus 5.5注意到牛顿和哈特利布都对关键成分“匈牙利矾”使用了不同的字谜/代码。这种编码语言在早期现代炼金术中很常见,但我肯定从未注意到过。Opus解释道:
牛顿的是一个真正的字谜。“Vltimorui”正好使用了vitriolum(v-i-t-r-i-o-l-u-m)的字母,重新排列。牛顿版的编辑就是这样识别的。
哈特利布的则更接近倒写,而且还不完美。逐字母反转Miloirtiua riciragnun每个单词,你会得到:
Miloirtiua → auitriolim,接近uitriolum(= vitriolum)
riciragnun → nungaricir,接近ungaricum
对我来说这感觉有点牵强,但它通过分享具体的旁注进一步澄清了事情,这些旁注也是为了向17世纪的读者解释这一点而写的:
(此处插入截图)
你可以在左边空白处看到潦草写着的“vitriolum angaricum”
所以Opus这里发现的不仅仅是关键炼金成分的字谜,更重要的是,牛顿和哈特利布都为其使用了字谜这一平行现象。再加上两者描述的相同数量,以及其他文本间的匹配,在我看来,这是非常有说服力的证据,表明哈特利布的手稿正是牛顿所依据的。
据我所知,这实际上是一个新发现,考虑到牛顿的历史重要性,这可能是一个值得发表的发现,尤其是如果能用其他类似的发现加以充实的话。
破译早期现代的加密信件
最后一个案例研究:就在我写这篇文章的时候,Opus 5.5部分破译了两封16世纪西班牙信件,这些信件使用了查理五世皇帝的密文:
(此处插入截图)
问题是?这两封信都已经被破译过了!一封早在创作当时(16世纪30年代)就被解密了,明文写在加密页面之后的几页上。第二封经过在谷歌图书上的一番搜索,原来在1916年就已经被破译了。
这是一个很好的例子,说明了专业知识和“案头研究”的重要性,因为作为一个历史密码学的完全业余爱好者,我很可能会浪费好几个小时去重复一位百年前严谨学者的工作。同时,这也是一个极好的测试案例,证明了Opus 5.5确实有能力做这类工作,因为它一旦找到1916年的“黄金标准”明文,就能验证自己的解读是正确的。下面是Opus制作的显示这一点的图表,以及它创建的包含此项工作报告的完整网站:
(此处插入截图)
这里值得再次提一下,Daniel Bourdeau有一个很棒的网站,收集了历史密码学的开放问题,并记录了他使用这些相同模型解决这些问题的尝试。这是做这类事情的绝佳指南。
下一步是什么?
显而易见的下一步不是我这样的人每周消耗个人Codex和Claude Code额度,以这种杂乱无章的方式四处探索。而是基于历史学家、档案工作者和其他研究人员之间的协作研究和信息共享的系统性努力。我认为现在是主要AI实验室和基金会开始资助和支持这项工作的时候了。
为什么?前沿模型目前所能取得的成就,很大程度上是因为它们能够获取公开可用的原始资料。它们能够在破解恩尼格玛密码等方面取得突破,是因为巨大的志愿努力使这些文件得以转录并在网上提供,也因为人类之间进行了大量合作来确定应该提出什么问题、问题是什么。
就目前而言,历史研究、档案和相关领域(如考古学)的结果将比我们在数学领域看到的更加零散和有限。这部分取决于这些模型认为什么是可处理的,而且数学证明本质上确实不同于历史知识的积累方式。但我认为三项关键干预措施将推动历史领域走向真正的突破:
- 跨图书馆和档案馆合作,将不可得的历史手稿数字化并免费在线提供。 在我的测试中,反复出现的瓶颈是对档案文件的访问权限。这些文件通常已数字化,但除非你有特权访问,否则无法获取。放宽这些限制将大有裨益,但更重要的是要记住,绝大多数前现代历史手稿仍未数字化。这是一个非常可解决的问题,只需要制度意愿和资金支持。
- 为历史学家提供免费的API访问/计算资源。 我可能是错的,但我认为没有人真正知道当中等至大量的计算资源(数百或数千个代理的量级)被投入到活跃的历史问题时会发生什么。
- 历史学家可以联合起来确定“千年问题”,就像数学家所做的那样。 我应该在此澄清,历史学术中的主要争论实际上与“解决问题”或“证伪定理”无关——再说一次,历史在这方面与数学或物理学根本不同。历史学家热衷并投入职业生涯的事情,往往是解读和主观分析的问题,根本没有单一的“解决方案”。但是——也确实存在一些实际的谜团,如果给予足够的关注和资源,是可以解决的。约翰·迪伊的《Liber Loagaeth》就是一个例子:它编码的信息是否比AI能够发现的片段更有意义?很有可能——我们现在只是不知道。著名的伏尼契手稿可能是另一个,尽管我个人认为它可能根本不包含任何语义信息(我的理论是,它是一个早期现代人患有书写癖的产物)。还有线形文字A,以及所有仍然加密的历史原始资料,等等……
我对这一切非常感兴趣,正计划给历史学家朋友和同事发邮件,进行一次非正式调查,了解他们认为哪些历史“开放问题”最适合这种方法。然后将这份清单作为一个网站上的列表公开发布。如果你想参与其中,请联系我。