← 文章 / AI技术
The Decoder 1小时前 · 2026-09-10 05:06:08 · 1 阅读

DeepMind AlphaGenome Atlas 绘制人类基因组全部 DNA 变异图谱

Image描述

Google DeepMind 已预测出人类基因组中约九十亿种可能的单碱基突变在体内可能产生的影响。AlphaGenome Atlas 旨在帮助研究人员从海量遗传变异中快速锁定少数有致病关联的变异。

人类基因组包含约三十亿个碱基。每个人相对于参考序列都有数百万处微小差异,通常只是单个碱基的替换。其中绝大多数无害,少数则会导致疾病。但哪些变异有风险,无法仅凭 DNA 序列直接判断;而要在实验室里逐一验证约九十亿种可能的替换,基本不现实。

新发布的 AlphaGenome Atlas 正是用预测来填补这一空白。对于这九十亿种突变中的每一种,它都会给出该突变在数百种细胞类型和组织中可能如何影响分子层面活动的估计。整个数据集达到 1 PB,规模超过 AlphaFold 蛋白质结构数据库的 30 倍。

Atlas 建立在 2025 年推出的 AI 模型 AlphaGenome 之上。该模型可读取长达百万碱基的 DNA 片段,并预测基因转录强度、调控蛋白能否与 DNA 结合、以及基因转录本的剪接方式。过去,每个变异都需要逐一查询模型;如今结果已预先算好。据论文介绍,每个变异平均附带约 2.7 万个独立预测值。

这一能力对基因组中约 98% 不编码蛋白质的区域意义最大。这些非编码区扮演着"开关"和"旋钮"的角色,决定基因何时、在哪些组织中活跃。绝大多数与疾病相关的变异就藏在这里,同时也是解读其效应最困难的地方。

每种突变,一个数值

每个变异点会产生数千个预测值,日常使用负担过重,团队表示。为此,Deepmind 设计了 AlphaGenome 变异影响评分(AVI),将全部信息浓缩为一个数值。一个小型神经网络把 AlphaGenome 的预测与蛋白质模型 AlphaMissense 结合,再融入两项衡量 DNA 位点在数百万年进化中保守程度的指标。AVI 仅使用 18 个输入特征,而成熟的基准工具 CADD 则用了超过 150 个。

几乎没有变异点能被明确判定是否有害,团队绕开了这个难题:在人群中极为罕见的变异被视为大概率有害,常见的则视为大概率无害,因为有害突变在代际传递中扩散的概率更低。尽管采用这种间接训练方式,论文显示 AVI 在已获临床分类的变异测试中仍优于现有工具,尤其在非编码区域表现突出。不过在某些任务上,竞争工具略胜一筹。该图谱还能拆解每个变异的评分由哪些过程驱动,例如是否影响了基因转录本的剪接或某个开关机制。

一个癫痫病例印证了实际价值

GREGoR 联盟专攻未解罕见病,其中一例展示了实际应用价值。一名患有严重癫痫的儿童,尽管已进行全基因组测序,仍未能确诊。AVI 将一个此前归为"意义不明"的 DNM1 基因变异推至候选名单首位。

AlphaGenome 的预测还揭示了分子机制:该变异在转录本加工过程中生成了一个错误的剪接位点,导致蛋白质多出 13 个氨基酸。但这一现象仅发生在只在脑部表达的基因版本中,此前基于血样的研究因此一无所获。

后续实验验证了这一预测,研究者建议将其归类为"可能致病"。回看联盟已解决的病例,AVI 在 29.5% 的案例中将致病变异排入前 50 名候选,而 CADD 仅为 12.5%。

在噪声中提炼信号

该图谱也旨在推动群体研究。要判断某一基因区域的罕见变异是否影响血常规等指标,必须将多个变异放在一起分析,因为单个变异频率太低,无法支撑统计推断。若有害与无害变异混在一起,真正的信号就会被噪声淹没。

埃克塞特大学的 Gareth Hawkes 借助该图谱,从 54,000 多名 UK Biobank 参与者的基因组数据中,筛选出预测作用机制相同的变异,结果发现非编码变异与血液蛋白水平之间的关联比传统筛选方法多出 22%。

团队还从预测结果中提炼出 2,601 个反复出现的短 DNA 模式——这些本质上就是基因组中的"单词",是调控蛋白结合的位点。

科研工具,而非诊断手段

AlphaGenome 也有局限。它并不了解所有细胞类型,也会漏掉通过其他调控蛋白含量起作用的效应。Deepmind 表示,图谱和 AVI 都是科研工具,只能作为诊断证据链中的一环。

该图谱目前可通过网页端口API 以及 Google Antigravity 中的技能供非商业用途使用。商业版本后续将经由 Google Cloud 提供。

原始来源: The Decoder

评论 (0)