新聊天机器人旨在解锁残缺古希腊文献中的奥秘
全球的学术图书馆里堆满了数十万件古希腊纸草残片。许多残片损毁严重,含义可能永远无法知晓,但学者们仍可以通过系统地补全缺失的词语或句子来复原其余部分。为了加速这项繁琐的工作,研究人员转向了人工智能。
本周三,奥地利科学院将发布“全球首个面向古希腊语的高级大语言模型”,该模型由奥地利科学院与法国 AI 实验室 Mistral 以及技术服务公司 Sail Reply 合作开发。这个名为 Apollo 的模型,使用了从手稿、纸草文书和铭文中提取的约 6 亿个古希腊语历史词汇进行训练。
学者们可以通过聊天机器人界面免费使用该模型。其目标是帮助学者更快地找到与自己细分研究领域相关的纸草残片,以及有前景的新研究方向。面对残缺破损的文书,Apollo 能够根据统计规律填入最可能出现的词语或段落,从而可能揭示出有关历史事件和社会习俗的隐藏细节。
Sail Reply 合伙人 Dimitris Vlitas 告诉 WIRED,以这种方式挖掘知识“在一年前还是不可想象的”。
在此之前,复原一件破损的纸草文书,需要一位功底深厚的学者先辨认词与词的分界——古希腊文的书写中并没有空格——然后准确判断文书的年代,结合相应的社会政治背景,并查阅参考资料,才能选出合适的词语填补空缺。伦敦大学学院古典学与历史语言学教授 Stephen Colvin 说:“全世界精通希腊历史的学者屈指可数。”
但所有这些专业知识都已内置于 Apollo 之中。奥地利科学院的历史学家兼纸草学家 Anna Dolganov 说:“它看到 Homer 的作品,就用荷马式希腊语补全;看到多利安方言的铭文,就用多利安方言补全。”
那些深陷于繁琐复原工作的学者们,期待 Apollo 能加快这一进程,让他们得以聚焦于历史文献的内涵,而非费力去辨识其文字。
“我觉得这非常令人振奋,”牛津大学古典语言与文学教授阿曼德·达格尔(Armand D'Angour)说道。牛津大学拥有全球最大的古代纸莎草藏品。“如果我有一台机器能告诉我‘这里有三个可能的词可以填入那个空缺’,那将大大加快工作进度。”
Apollo 不太可能改变人们对古代世界的宏观认知;许多纸莎草卷之所以尚未被复原,恰恰是因为它们内容平庸——多为私人信件、婚姻契约或公务员档案。“如果你是门外汉,可能会认为突然就会出现几部索福克勒斯的新剧,但事实并非如此,”科尔文(Colvin)说。不过,该模型有助于揭示古代生活的更多细节,并证实现有的学术假设。“每当有新内容产出,都会为理解古代世界增添一点点知识,”达格尔说。
弗拉塔斯(Vlitas)表示,如果 Apollo 取得成功,同样的技术可以轻易应用到其他古代语言——比如拉丁语或古埃及语——或任何能从大规模语料库的提炼与索引中获益的学术领域。AI 在某些领域已取得了显著成功;OpenAI 最近表示其 AI 模型解决了一道拥有 200 年历史的数学难题,而 Google DeepMind 则发布了一个庞大的数据集,该数据集绘制了基因突变如何影响分子生物学的图谱,这是利用 AI 编译而成的。
一种担忧可能是,依赖基于概率的语言模型来填补古代文献的空缺,有误将错误混入历史记录的风险。但为了规避这一问题,Apollo 被设计为仅提供一系列可选词供学者甄别。“关键在于必须保留人类的判断力,”多尔加诺夫(Dolganov)说。“如果我们对 AI 转录和历史材料解读变得完全依赖,问题就开始了。”