Nature MI:AI大模型设计了 47 个抗新冠分子,很多都无法真正合成,北大出手
顶刊雷达 · Nature Machine Intelligence,2026 年 9 月 23 日在线,Article,DOI 10.1038/s42256-026-01304-x。两位作者:Junren Li 与 Luhua Lai(通讯,北京大学化学与分子工程学院)。方法叫 SynCraft。
现在有一批 AI 模型专门干一件事:你给它一个靶点蛋白,它给你设计出能塞进去的小分子。有时候设计得又快又多。 这里的问题是,里面很大一部分AI设计的东西却在实验室造不出来。这篇论文里有个数字:某个模型针对新冠病毒主蛋白酶生成了 47 个候选分子,按他们的检验标准,只有 1 个是能直接合成的。 对于这个问题,以前常用的解法有两种。一种是生成完再来筛选,造不出来的呢,就直接扔掉,有时候好分子也跟着扔了一大批。另一种是一开始就限定只能用现成的积木块拼,这样做的话,那 AI 探索的自由就没了。 来自北大团队换了个思路:别扔也别限制,让大模型来改。而且不让它重写整个分子,只让它说「把第 26 号原子删掉,加一个氧,跟第 6 号和第 14 号连上」。 |
📖 先补 4 个名词 可合成性:这个分子化学家能不能真正在实验室合成出来。在理论上和纸上成立,不等于实验室里做得出来。 SMILES:把一个分子的结构写成一串字符,化学界通用。它有严格的语法,写错一个符号整个分子就不成立了。 逆合成:倒着推。从目标分子往回想,它能由哪两块拼成,那两块又能由什么拼成,一直推到市面上买得到的原料。有专门的软件干这个。 相似度:两个分子长得有多像,用一个 0 到 1 之间的数表示,1 是一模一样。改完之后还像不像原来那个,就看这个数。 |
📊 30 秒速览 | |
3,332 攒了多少对「改一点点就能造出来」的分子,拿来教模型。 | 42.7% 救回来的比例(相似度要求 0.5 以上)。最强的老方法是 30.7%。 |
64.3% 同一套流程,把后台的大模型换成开源的 DeepSeek 之后。 | 0 全文真造出来做了实验的分子数量。所有结论都在计算机里。 |
一、为什么 AI 画得出来的分子会造不出来?
论文开头讲了原因:这类生成模型的目标函数通常很单一,主要盯着一个指标,比如跟靶点蛋白结合得有多紧。为了把这个分数拉满,它会造出一些在计算上很理想、但化学上站不住的结构,比如绷得很紧的环、装配不上去的取代方式。
作者提出一个说法,叫「合成悬崖」。药物化学里早就有「活性悬崖」的概念:一个分子改动一丁点,活性可能掉一大截。合成悬崖是类似的另一面,一个很小的、局部的改动,就能让一个几乎做不出来的分子变得好做。
既然只差一点点,那就不该把整个分子扔了重来。这是整篇文章的出发点。
二、为什么不让大模型直接写分子
大模型读了海量化学文献,脑子里是有化学常识的。但它写 SMILES 这种严格语法的字符串不在行,经常吐出语法不合法或者化学上讲不通的东西。论文管这叫「语法脆弱性」。
他们的处理方式是把大模型的角色从「写分子的人」改成「出主意的人」。模型先分析这个分子难做在哪,然后给出一串编辑指令。比如论文里那个例子:
DEL_ATOM 26 |
翻译过来就是:删掉 26 号原子,加一个氧原子编号 500,把它跟 6 号和 14 号各连一根单键,完事。执行这串指令的不是大模型,是一个确定性的化学工具包,改完还要过一遍 RDKit 的合法性检查,改出不合法或者断成两截的结构就直接作废。
这样一来,模型只负责它擅长的判断,具体落笔的活交给不会出语法错的程序。
这篇论文的核心思路 别让大模型写分子 大模型有化学常识 数据来源:Nature Machine Intelligence(2026)· DOI 10.1038/s42256-026-01304-x 科研 AGENT 实验室 |
↑ 长按保存或截图发到课题组群
三、效果咋样?
测试集是两个现成的分子生成模型(P2M 和 ResGen)吐出来的、被判定为造不出来的分子。评判标准是:改完之后既要过逆合成软件这关,又要跟原来那个分子保持一定的相似度。相似度门槛从 0.5 卡到 0.8,越往上越严。
| 方法(P2M 那组) | >0.5 | >0.6 | >0.7 | >0.8 |
|---|---|---|---|---|
| ChemProjector | 21.6% | 9.8% | 4.2% | 1.9% |
| SynFormer | 30.7% | 14.1% | 6.2% | 2.9% |
| ReaSyn | 30.4% | 15.4% | 6.4% | 3.0% |
| 本文(Gemini 后台) | 42.7% | 28.4% | 11.9% | 3.2% |
| 本文(DeepSeek 后台) | 64.3% | 50.1% | 27.8% | 8.5% |
在 0.5 和 0.6 这两档上,新方法比老方法强出一截。另一组数据(ResGen)趋势一样。
但把目光挪到最右边那一列:相似度要求卡到 0.8 时,Gemini 后台是 3.2%,ReaSyn 是 3.0%,SynFormer 是 2.9%。三家基本打平。也就是说,如果你要求改完之后几乎不走样,这套方法的优势就没了。论文正文没有专门讨论这一列。
四、换个模型,效果咋样?
表里还有一件事。同一套流程、同一份测试集,只把后台的大模型换掉,成绩差出很多:
Gemini-2.5-Pro:42.7%|GPT-5.2:39.0%|DeepSeek-V4-Pro:64.3%|DeepSeek-V4-Flash:64.9% 两个开源模型比两个闭源模型高出二十多个百分点。在另一组数据上也一样(65.7% 和 65.2% 对 44.7% 和 44.5%)。 |
公平性上要说明两点。Gemini 和两个 DeepSeek 都是按 pass-k=5 跑的,也就是每个分子允许提 5 个方案取最好,这三者可比。GPT-5.2 因为接口预算只跑了 pass-k=1,论文注明了这一点,并说如果跑 5 次它的数只会更高。
所以在可比的那三个里,开源的赢了,而且赢得不少。
有意思的是论文自己的措辞。摘要里写的是「在闭源和开源后台上表现相当」,正文写的是「四个后台都落在 39% 到 65% 之间,达到或超过了最强的基线」。一个二十多个百分点的差距,被放进了一个区间里一笔带过。而且论文通篇把 Gemini 当作默认配置,主图、案例分析用的都是它。为什么不用表现明显更好的那个当默认,文中没有解释。
五、三个案例
第一个是对答案。之前有篇论文生成了一批 PLK1 抑制剂,其中一个叫 lig-886 的分子,化学家嫌它不好做,手工改过之后才合成,最终产物叫 IIP0944。作者把 lig-886 喂给模型,看它会不会改出同一个方向。
原分子上有个二甲基哌嗪,带两个手性中心,做出来可能是四种立体异构体的混合物,要拆开很贵。模型给出的理由是把这两个甲基去掉,省掉立体异构的麻烦。人类化学家当初做的也是同一件事。两边对上了。
第二个是救被搁置的分子。另一项 RIPK1 抑制剂的研究里,作者生成了几千个分子,但排名前 50 的里面只合成了 8 个,剩下的因为难做被搁在那儿。这篇拿其中 42 个来改。改完重新对接,191 对「原分子和改后分子」的结合姿态里,最好的那个改动在 81% 的候选上保住了一半以上的相互作用,74% 的情况下打分没变差。
第三个是走完整套流程。他们把框架打包成一个智能体技能,输入分子式和靶点蛋白就能用。拿另一个模型针对新冠主蛋白酶生成的 47 个分子来跑,其中只有 1 个本来就能合成,剩下 46 个里救回了 32 个,比例 70%。代价是结合打分平均往不利方向动了 0.14 千卡每摩尔,论文说这个幅度在对接软件自身的重复性误差范围内。
六、几件必须说清楚的事
一、全文没有造出任何一个分子。所谓「变得能合成了」,是逆合成软件在 30 分钟内推出了一条路线;所谓「结合能力保住了」,是对接软件的打分和接触分析。整篇论文停在计算机里,一次湿实验都没做。这是读这篇时最需要记住的一件事。 二、那个「前瞻性拯救」的小标题名不副实。RIPK1 那一节标的是前瞻性,但既没有新合成也没有新测活,验证手段仍然是对接打分。跟前面的 PLK1 回溯案例在证据类型上是一回事。 三、那些读起来很专业的化学理由,是模型看着答案倒推的。训练语料里每一对分子都配了一段「为什么这么改」的说明,来源是把改前改后两个分子一起交给 Gemini,让它事后编一个理由。论文自己写明了这一点,说这些理由只是教学信号,不是经过核实的语义标准答案。好在最终的成绩不依赖理由对不对,因为改动执行和逆合成检验都是独立的程序在跑。这条论文交代得很实在。 四、论文自己承认模型不懂三维。靶点的相互作用信息是以文字标签的形式塞进提示词的,不是三维坐标。所以模型可能把一个七元环缩成五元环,清单上列的原子一个没少,朝向却已经歪了。作者说得很具体,并指出在口袋更开阔的新冠主蛋白酶上,保持效果不如口袋紧凑的激酶。 五、失败主要不怪模型。作者拆了失败原因,占大头的不是改错或者改跑偏,而是逆合成软件在 30 分钟里没解出来。他们说下一步该提升的是逆合成的覆盖能力。 |
另外有个小插曲:论文末尾的单位列表里,北大-清华生命科学联合中心被标成了成都,北京大学成都前沿交叉生物技术研究院被标成了北京,两个城市写反了。属于排版层面的出入,不影响内容。
代码按 MIT 协议开源在 GitHub,数据放在 Figshare,包括 3,332 对训练语料、测试集、四个模型的推理结果。作者声明无利益冲突。基金来自国家自然科学基金和中国医学科学院医学与健康科技创新工程。
数据来源 · 访问层级说明 Guiding large language models to predict edit sequences for molecular synthesizability optimization,Nature Machine Intelligence,2026-09-23 在线,Article,DOI 10.1038/s42256-026-01304-x | 代码 MIT 协议开源:github.com/catalystforyou/SynCraft-Core |
💬 评论区聊聊 做药物设计的朋友,你们组里 AI 生成的分子最后真正进合成的比例大概是多少?另一个问题:这种「让模型出主意、让程序落笔」的分工,你觉得能推广到别的科学任务上吗? 📤 发给做计算化学和药化的同行 三件事:一、思路是把大模型从「写分子」改成「说改哪个原子」,绕开它写化学式容易出语法错的短板,代码 MIT 开源可直接试;二、同一套流程换成开源的 DeepSeek 后台,成绩比 Gemini 高二十多个百分点,而论文摘要称两者「表现相当」;三、相似度卡到 0.8 时各家基本打平,全文无湿实验,引用时要带上这两个前提。 |
📂 明日预告 T 细胞靠表面的受体认出病变细胞,哪个受体认哪个目标,实验测一次很贵。腾讯、澳门大学、清华大学深圳国际研究生院和江南大学合作做了个基础模型来预测,还拿 8 个黑色素瘤多肽做了前瞻验证。 |
科研 AGENT 实验室 · 顶刊雷达 · 北京大学 分子可合成性优化
2026-09-28