← 文章 / AI技术
AI4ChemE 1小时前 · 2026-09-12 17:56:54 · 3 阅读

EPFL团队用不确定性信号训练大模型,让AI成为可靠的实验优化器

LLM做实验优化最怕什么?瞎指挥。EPFL团队让LLM通过贝叶斯优化的“不确定性”信号进行微调,把“盲目自信”变成“自知之明”——从10个失败实验起步,在23个任务上排名第一,匹配传统贝叶斯优化所需实验数量减少40%以上。

导语

AI可以在一小时内生成数百万种候选分子、材料或化学反应。但真正的瓶颈从来不是“生成”,而是“选哪个去实验”

贝叶斯优化(BO)能给出有依据的答案——预测+不确定性,平衡探索与利用。但它依赖专家设计的领域特征(分子指纹、反应描述符、量子化学参数),每换一个任务就要重新设计一套。

大语言模型(LLM)拥有丰富的先验知识和自然语言接口,但缺乏校准的不确定性估计——在高风险实验决策中,这正是致命缺陷。

EPFL(洛桑联邦理工学院)Philippe Schwaller团队在 Nature Machine Intelligence 上发表的研究,解决了这个两难问题:让LLM通过贝叶斯优化的边际似然进行微调,把“不确定性”这个LLM的致命弱点,变成了驱动学习的关键信号。

他们的方法GOLLuM(高斯过程优化的大语言模型) 从仅10个低性能实验起步,在23个跨领域任务(有机合成、材料科学、过程化学、分子设计)上平均排名第一,匹配传统BO所需实验数减少40%以上,并在Buchwald-Hartwig反应中将近翻倍了高性能条件的发现率(43% vs 24-25%)。

研究背景:LLM做实验优化——看起来很美,实则很“虚”

用LLM做实验优化,听起来很诱人:

  • 你不需要设计分子指纹

  • 你不需要写反应描述符

  • 你只需要用自然语言描述你的实验空间

但从目前的尝试来看,这条路走得并不顺利。直接让LLM“凭感觉”推荐下一个实验,失败率极高。 作者测试了多个最先进的LLM(包括专有和开源模型)作为“直接优化器”,结果:

  • 大量建议无效:生成不存在的化学结构或超出参数空间

  • 频繁重复已试条件

  • 有时甚至拒绝继续优化

直接LLM提示的性能,远低于传统BO方法。问题出在哪里?LLM虽然拥有丰富的化学知识,但它没有“不确定性估计”能力——它不知道自己不知道什么。

而贝叶斯优化的核心优势恰恰在于:它能同时给出预测值及其不确定性,从而在探索(尝试未知区域)和利用(深耕已知好区域)之间做出理性权衡。

GOLLuM的解法是:把这两种方法合并,而不是让它们对立。

核心理念:让LLM通过GP的“不确定性”信号进行微调

直观理解

GOLLuM的核心,用一句话说就是:训练LLM时用的“损失函数”不再是“预测值与真实值的误差”(MSE),而是GP的“边际似然”——一个同时衡量拟合质量和不确定性的概率目标。

这个目标有两个效果:

  • 拟合效果好的点会被拉近(高相似度)

  • 效果差的点会被推开(低相似度)

结果是:LLM的嵌入空间被重新组织,高绩效和低绩效的实验自动形成两个分离的区域。 这种组织结构让GP更容易建模——因为同一区域的点具有相似的输出。

这相当于给LLM的“知识”加了一层“校准”,让它从“懂得多但没谱”变成了“懂得多且有谱”。

技术实现

GOLLuM的框架包含两个组件:

  1. LLM编码器(如T5、Qwen-7B等):将实验条件的自然语言描述(如“用碘代苯和Pd(OAc)₂在110°C反应”)转换为连续嵌入向量

  2. GP代理模型:以这些嵌入为输入,预测实验产出并提供不确定性估计

关键创新:LLM的参数和GP的超参数通过GP的边际似然联合优化。梯度从GP反向传播到LLM,调整嵌入空间,使其更好地反映实验结果的结构。

数学上,这个过程等价于一个隐式的对比学习目标——嵌入空间中:

  • 相似产出的实验被拉近

  • 不同产出的实验被推远

GOLLuM提供了三种变体:

  • PLLM:在固定LLM嵌入之上学一个线性投影(适用于闭源模型)

  • LLM φ:通过LoRA微调LLM参数(适用于开源模型)

  • PLLM φ:两者结合(性能最佳)

所有这些变体都通过GP边际似然进行训练,不依赖MSE等监督损失。

核心发现:固定LLM嵌入在优化中表现不佳

在深入研究GOLLuM之前,作者先诊断了一个关键问题:为什么直接用LLM嵌入做BO效果不佳?

在Buchwald-Hartwig C-N交叉偶联反应(3,955种条件,5种不同产物)的完全枚举基准上:

  • 固定LLM嵌入+GP:仅发现15-26%的高性能反应(前5%阈值)

  • 专业化学指纹DRFP+GP:达到38%

  • 化学专用LLM(TSChem) 在SMILES输入下为23%,在程序描述输入下仅16%

即使是最好的LLM嵌入(OpenAI的嵌入模型),也未能达到专业指纹的水平。

原因不是LLM“不懂化学”,而是它的嵌入空间与GP代理模型的要求不匹配。

作者提出一个几何指标:GP学习的长度尺度ℓ与搜索空间平均成对距离d̄的比值。

  • 这个比值高 = 嵌入空间平滑、GP友好(相近点有相近输出)

  • 这个比值低 = 嵌入空间崎岖、难以建模

在所有14种表示中,这个几何指标与BO性能的相关性高达r=0.92,远超预测模型的R²(r=0.78)。

换句话说:优化成功的关键不在于模型能多准确地预测已知点,而在于嵌入空间的“几何结构”是否支持GP的平滑性假设。

核心发现:GOLLuM在23个任务上平均排名第一

23个跨领域任务

作者在23个优化任务上进行了基准测试,涵盖:

  • 有机化学(12个任务):5个Buchwald-Hartwig反应、4个Ni催化添加剂筛选、Suzuki-Miyaura偶联等

  • 分析/过程化学(3个任务):烯丙基-邻苯二酚重排、HPLC方法优化、C₆₀加合物合成

  • 材料/催化(3个任务):甲烷氧化偶联C₂收率、析氧反应催化剂、气相扩散结晶

  • 分子性质优化(5个任务):氧化还原电位、水合溶剂化能、对接打分、π-π*跃迁波长、光伏转换效率

所有任务用同一组超参数,无任务特定调优。

性能结果

50次实验预算下,GOLLuM(PLLM φ + T5)达到36.3%的top-5%覆盖率,对比:

方法top-5%覆盖率
GOLLuM36.3%
传统BO(GP+专业特征)29.7%
BoChemin(固定LLM嵌入+GP)26.5%
LAPEFT(MSE微调+Laplace不确定性)12.1%

优势最显著的领域是过程化学:GOLLuM将覆盖率从13.4%提升到25.4%,相对提升90%。有机化学从23.9%提升到30.6%(+28%)。即使在分子性质预测等传统指纹已经很强的领域,GOLLuM也保持竞争力(47.9-53.2%)。

样本效率:GOLLuM是唯一比传统BO更高效的LLM方法,达到相同最终性能所需的实验数减少41%(中位数)。

LAPEFT为何不如GOLLuM?

LAPEFT先用MSE损失微调LLM(监督回归),再通过Laplace近似添加不确定性。这种“事后不确定性”效果有限。

GOLLuM则通过GP边际似然同时优化拟合质量和不确定性校准。这不是“先训练再添加不确定性”,而是“用不确定性作为训练信号”。

核心发现:Buchwald-Hartwig反应中近乎翻倍

在5个Buchwald-Hartwig反应(3,955个条件)的基准上,GOLLuM将高性能条件的发现率从24%提升到43%

  • 超越专业化学指纹DRFP(38%)

  • 超越DFT描述符(33%)

  • 超越化学专用LLM TSChem(23%)

  • 接近翻倍于其他LLM方法(24-25%)

GOLLuM不仅在数量上胜出,在效率上也如此——更早进入高绩效区域,更快发现最优条件。

核心发现:隐式对比学习与化学可解释性

GOLLuM的嵌入空间不是静态的——它随着每次实验动态演变

在Buchwald-Hartwig反应中,作者追踪了嵌入空间随迭代的变化:

  • 初期(第10次迭代) :高绩效和低绩效实验仍然混杂

  • 中期(第25次迭代) :开始出现分离迹象

  • 后期(第50次迭代) :化学上有意义的组织——碘代芳基(高反应性)聚集在高收率区域,氯代芳基(低反应性)聚集在低收率区域

这种组织是自动涌现的,模型从未被告知这些化学分类。

这种结构有两个实际价值:

  • 对GP而言:更平滑的景观意味着更高效的探索

  • 对科学家而言:可以根据建议相对于已知高/低绩效区域的位置来评估其合理性

可解释性不仅仅是锦上添花——它是优化过程中内生的结构特征。

对科研人员的启示

1. LLM做实验优化,不能“直接问”

要让LLM可靠地指导实验,必须给它一个概率框架,让它不仅知道“该试什么”,还知道“为什么该试这个”。

GOLLuM提供的不是“下一个实验”的确定性推荐,而是一个经过不确定性校准的推荐——这在高风险决策中至关重要。

2. “嵌入空间的几何结构”比“预测精度”更重要

一个模型可以完美拟合已知数据,但在优化时仍然表现糟糕。关键是嵌入空间是否有足够的“平滑性”——相近的点是否确实对应相近的结果。

GOLLuM的几何指标(ℓ/d̄)为这个直观概念提供了可操作的定义,并且与优化性能高度相关(r=0.92)。

3. 通用LLM + 概率微调 > 化学专用模型

GOLLuM在Buchwald-Hartwig中的表现超越了针对化学领域预训练的模型(TSChem)。通用LLM通过GP概率目标微调后,反而更有效。

专业知识的价值,不仅要看模型在什么数据上训练,还要看它以什么目标进行微调。 有时,通用基础加概率微调,比专用基础加标准微调更强大。

4. 小数据也可以有效微调大模型

GOLLuM仅从10个初始实验(中位数以下,即“失败”实验)开始,逐步添加后续结果。你没有看错——从“失败”开始,而不是从“好的初始条件”开始。 这说明GOLLuM不依赖有利的初始条件。

GOLLuM有效利用了LLM的丰富先验,又通过GP的概率信号实现了领域适配。大模型不一定需要海量领域数据——它需要的是正确的学习信号。

5. “不确定性”不是缺陷,而是机遇

GOLLuM最根本的启示是:LLM的“不自信”恰恰是最有价值的信息来源。 传统上我们试图压制或忽略LLM的不确定性。GOLLuM则通过GP的边际似然,用不确定性来指导LLM的学习过程

当一个LLM“犹豫”时,这种犹豫本身就是一个信号——它告诉我们它需要更多的结构来理解这个领域。不确定性不是一个要解决的问题,而是一个要利用的资源。

局限与展望

作者承认了几点局限:

  • 标准GP的立方复杂度对数千次实验的大规模优化构成挑战

  • 自然语言接口在以复杂高维数据(如蛋白质构象、晶体结构)为主的领域中可能效果有限

  • 未来工作可探索将GOLLuM与这些数据类型的专用编码器相结合的混合模型

结语

这篇论文最深刻的洞见,用作者自己的话来说就是:“不确定性不应被视为LLM在实验科学中的致命缺陷,而应被重新定位为一个丰富的训练信号——一个将模型的学习目标从‘做出最佳预测’转变为‘提供良好校准的预测’的信号。”

当AI从“工具”走向“实验伙伴”,可信度的要求发生了质的变化。GOLLuM证明了一条可行的路径:通过将LLM“嵌入”到已建立的、具有原则性不确定性的优化框架中,而不是试图从头开始构建一个新框架。

对于从事实验科学(化学、材料、生物)的科研人员:这项技术可以让你的下一个实验更有依据,而不是盲目试错。

对于AI研究者:概率推理与预训练知识的交叉,可能是通往可靠科学AI的关键路径。


论文信息:Bojana Rankovic et al., “Large language models as uncertainty-calibrated optimizers for experimental discovery,” Nature Machine Intelligence, 2026.

代码与数据:https://github.com/schwallergroup/gollum | Zenodo: 10.5281/zenodo.20625386


原始来源: AI4ChemE

评论 (0)