← 文章 / AI技术
Google Research 博客 6小时前 · 2026-09-04 09:21:53 · 5 阅读

Genomic Prediction 中的 Transfer Learning 用于代表性不足人群

多基因风险评分(PRS)可用于根据遗传变异预测疾病风险,通常整合了成百上千至数百万种遗传变异的影响。然而,其在临床决策中的采用率目前较低,部分原因在于历史上的全基因组关联研究(GWAS)绝大多数仅评估欧洲队列,导致在非欧洲人群中的应用出现严重的准确率下降。这些准确率差异源于不同人群在遗传结构、群体结构以及等位基因频率方面的差异。

此外,对于大多数医疗体系而言,对数十万个体开展新的 GWAS 成本过高。借鉴现有以欧洲为中心的大型 GWAS,并结合目标人群特异性 GWAS 数据,提供了一种潜在的解决方案。

为此,本文介绍了一项研究,该研究在八种临床性状上,通过调整构建预测模型所用的目标非欧洲人群及欧洲人群样本量,评估了 PRS 在目标人群中的表现。具体而言,我们评估了基于英国生物样本库(UKB)中数十万欧洲个体建立的 PRS,迁移应用到日本生物样本库(BBJ)——一个拥有近 20 万日本个体且表型信息详尽的队列——中的效果。我们的主要目标是为优化目标人群预测性能时的跨人群 GWAS 及 PRS 模型训练方法,提供系统性的实证指导。

GWAS 人群规模对目标 ancestry PRS 性能的影响

拥有两个大规模、深度基因型和表型分型的队列(UKB 和 BBJ),可以开展数据集消融实验,系统评估 PRS 性能随样本量的变化。我们选取了两组人群中均测量的八个与临床相关的性状进行评估:体重指数(BMI)、收缩压、舒张压、红细胞计数、白细胞计数、高密度脂蛋白胆固醇(HDL)、低密度脂蛋白胆固醇(LDL)以及血糖水平。在 UKB 中,由所测遗传变异解释的性状方差占比(单核苷酸多态性 遗传力)介于 0.07–0.28 之间。 三种方法被用于评估 PRS 性能的可迁移性: 1. UKB - 发现阶段全基因组关联研究(GWAS)+ 弹性网络:探索欧洲与日本人群间直接迁移遗传变异的有效性。针对每种性状,我们首先对完整的 UKB 欧洲人群运行 GWAS 以识别欧洲特异性遗传关联,再对结果进行筛选,保留同时存在于 BBJ 日本数据集中的独立变异。随后以这些变异作为输入,通过在 BBJ 和 UKB 样本的不同组合上训练弹性网络模型,计算目标人群的 PRS。具体而言,我们将 12–13 个 BBJ 样本量与 7 个 UKB 样本量配对组合,从而为每种性状生成 96–104 个 PRS 模型。 2. 荟萃分析 + 弹性网络:探索在变异发现阶段纳入日本人群数据的影响。首先,我们分别对完整的 UKB 欧洲人群和抽样后的 BBJ 日本数据集运行 GWAS,然后利用荟萃分析将两类遗传关联信息合并,生成最终变异集合。基于这些变异,我们在混合的 UKB / BBJ 数据集上训练弹性网络模型,以确定目标人群的 PRS。
  • PRS-CSx:探索了一种 PRS-CSx 模型,该模型旨在处理种群间的 linkage disequilibrium 差异。我们在所有性状的完全版 UKB 欧洲样本和部分采样的 BBJ 日本样本上应用 PRS-CSx。由于 PRS-CSx 模型从同一份样本中为每个种群提供两种不同的评分,我们还拆分了验证集,以寻找两种评分之间的最优线性组合。
  • 在所有实验中,PRS 模型均在相同的 BBJ 保留测试集上进行评估。

    A flowchart outlining three genomic prediction models—ElasticNet, Meta-Analysis, and PRS-CSx—using BBJ and UKB datasets.

    跨祖先基因组预测的实验设计。a) 主实验探讨了在利用大规模欧洲 GWAS 发现的变异时,不同数量的欧洲和日本样本对 Elastic Net 性能的影响。b) 荟萃分析实验将种群特异性 GWAS 结果整合到 Elastic Net 模型开发所用的变异生成过程中。c) PRS-CSx 实验在不同种群样本量下拟合 PRS-CSx 模型。

    A table listing sample sizes across UKB and BBJ datasets for eight physical and hematological traits.

    本研究涉及的八个性状在 UKB 和 BBJ 中的样本量。

    更多的数据并不总是有利于跨种群 PRS 预测

    在每个实验中,我们使用 Pearson 相关系数 来量化模型性能。正如预期那样,当目标种群数据有限或缺失时,欧洲发现数据提供了有益的基准。然而,当样本量达到 1.5 万及以上时,目标种群特异性模型的优越性得以体现,因为与外部欧洲数据的联合训练似乎限制了通过更高采样率所能实现的靶群准确性提升。

    A line graph showing HDL prediction correlation improving and crossing over as BBJ and UKB sample sizes increase.

    以 BBJ 和 UKB 样本量为自变量,BBJ 样本中 HDL 胆固醇的 PRS 表现:这种滴定曲线揭示了纳入目标群体之外的样本数据实际上可能损害目标群体的预测性能。在 BBJ 样本量超过 15,000 的交叉点后,与仅在目标群体数据上训练相比,加入超过 5,000 个 UKB 样本会降低预测性能。

    这一反直觉的观察结果在我们检验的所有表型中均成立。当目标样本量极小时(例如 5,000 个样本),在训练过程中并入欧洲 UKB 数据可提供显著统计学增益。但随着用于训练 PRS 模型的目标样本量增加,跨群体合并数据带来的收益逐渐减弱。

    虽然该趋势在所有表型中一致,但欧洲数据效益开始递减的临界点高度依赖于所研究的具体性状。我们可以通过跨群体的遗传相关性来量化“共享遗传度”的程度。我们发现,“保守型”性状(即两群体间遗传相关性较高的性状)在使用欧洲 UKB 训练数据的收益方面具有更强的鲁棒性,目标群体特异性训练数据需达到更大样本量(25,000–40,000+)才能与之持平。

    Five heatmaps showing prediction accuracies for shared genetic traits across varying UKB and BBJ sample sizes.

    跨群体具有共享遗传架构的性状,其 BBJ 样本中的 PRS 表现随 BBJ 和 UKB 样本量变化的情况:当 BBJ 样本量超过 40,000 后,最优 UKB 样本量从最大值开始下降。

    相比之下,脂质水平(HDL、LDL)和血糖等表型在更小的 BBJ 样本量下就会出现最优 UKB 样本量低于最大值的情况,且该最优样本量本身也更小。这类高度群体特异性的性状从 UKB 数据中获益较少,因为其数据分布偏离目标群体更远。

    Three heatmaps showing prediction accuracies for unique genetic traits across varying UKB and BBJ sample sizes.

    PRS 在 BBJ 样本中的表现随 BBJ 和 UKB 样本量变化,针对在不同人群间具有独特遗传架构的性状:与保守性状不同,这类更具人群特异性的表型较早出现性能交叉点。

    Meta-analysis 与 PRS-CSx 的影响

    上述实验将 PRS 模型的输入变异限定为在 UKB 欧洲人群中发现的变异,排除了 BBJ 样本中特有的任何与性状相关的变异。为了扩展分析以涵盖这些变异,我们构建了两种新的预测方法。

    首先,我们在不同的 BBJ 样本量下分别进行了 GWAS。第一种新方法利用完整的 UKB GWAS 和对应样本量的 BBJ GWAS 进行跨人群 meta-analysis,以筛选候选变异,随后在这些变异上拟合 elastic net 模型。第二种方法使用 PRS-CSx 整合两组 GWAS 汇总统计量。

    通过追踪 meta-analysis 和 PRS-CSx 在不同发现样本量下的净性能增益,我们观察到其在不同 BBJ 样本量下表现存在差异。

    对于保守性状,meta-analysis 的影响较小,主要原因在于 BBJ GWAS 样本量大幅缩减导致统计效力下降。然而,对于 HDL、LDL 等人群特异性性状,以及在一定程度上对血糖而言,meta-analysis 显著优于单一人群发现。这种提升主要得益于对 elastic net 输入变异的调整:在使用 10,000 个或更少 BBJ 样本时,纳入 UKB 欧洲样本进行训练略有改善;但当 BBJ 样本量更大时,未观察到类似提升。

    由于 PRS-CSx 可动态加权人群特异性模型,其性能理论上对保守性状与人群特异性性状的敏感性更低。然而我们发现,与 elastic net 模型相比,PRS-CSx 需要更多数据才能表现良好。在目标样本量低于 25k 时,除 BMI 外,PRS-CSx 在所有表型上的表现均劣于最强的对应 elastic net 模型。当样本量接近 100k 时,除血糖外,PRS-CSx 在所有表型上均达到或超越了表现最佳的模型。

    八条折线图比较三种预测模型在不同性状样本量下的皮尔逊相关系数

    相对于使用 BBJ 样本量的 UKB 发现集、meta分析与 PRS-CSx 模型性能对比:meta分析与 PRS-CSx 所采用的 BBJ 特异性 GWAS 结果均源自对 BBJ 数据集的亚采样。所有模型共用的 UKB GWAS 结果则基于完整的欧洲裔 UKB 数据集。

    结论

    对跨人群基因组预测的系统性评估揭示,在向代表性不足的人群应用多基因风险评分(PRS)时,更大的非目标人群数据集并不总是有益的。具体而言,尽管来自英国生物样本库(UK Biobank)大型欧洲队列的迁移学习在目标人群样本量较小时(如日本生物银行 BBJ 低于 15,000 例)能提供统计上的增益,但随着 BBJ 样本量的增加,预测准确性反而下降。这种性能拐点因性状而异:遗传保守型性状(如 BMI)能从外部数据合并中持续获益直至较大的样本量,而人群特异性性状(如血脂与血糖)则在较小样本量下即显现出获益递减的趋势。重要的是,像 PRS-CSx 这样先进的多祖先方法需要充足的 target-population 样本才能超越较简单的方法,而跨人群 meta分析则能在较小时样量下为人群特异性性状提供稳健的增益。最终,这些发现强调,要在多样化人群中优化预测性能,必须同时扩展本地、多样化的生物样本库,并针对性状遗传力与样本量精心挑选建模策略。

    致谢

    我们诚挚感谢日本生物银行(Biobank Japan)以及在RIKEN东京大学医学院研究所 东京大学的合作伙伴们对此次研究的支持,同时感谢 Google 的其他合作者:Babak Behsaz、Andrew Carroll、Farhad Hormozdiari 与 Taedong Yun。此外还要感谢 Hiroki Kayama 与 Joe Ledsam 提供的机构支持,以及 Michael Brenner 与 Katherine Chou 的领导支持。

    原始来源: Google Research 博客

    评论 (0)