← 文章 / AI技术
微软研究院 7小时前 · 2026-09-01 18:29:58 · 3 阅读

GigaPath-Flash 与 GigaTIME-Flash:借助高效病理学基础模型迈向人群规模发现

GigaPath/GigaTIME 模型家族概览。GigaPath-Flash 以 2,200 万参数提供高效的 tile 和 slide encoder。GigaTIME-Flash 根据 H&E 预测空间蛋白质组学数据,并以蒸馏后的 ViT-S encoder 替代 CNN backbone。

核心内容

  • Flash 系列在 GigaPath 和 GigaTIME 的基础上大幅提升了效率,让大规模病理学研究变得更加易于开展、切实可行。
  • 蒸馏后的病理学 foundation model backbone 在不牺牲性能的前提下降低了计算需求,使研究人员能够在更大规模的患者队列中反复开展分析。
  • 这些开放模型支持群体规模的科学发现,帮助研究人员利用多样化的癌症数据集探索疾病生物学、biomarker 和临床结局。

GigaPathGigaTIME 展示了 foundation model 如何利用常规采集的病理数据开展全视野切片分析和肿瘤微环境建模。GigaPath-Flash 和 GigaTIME-Flash 进一步显著提升了这些能力的效率,使研究人员能够分析更大规模的队列、开展更多实验,并朝着群体规模的科学发现迈进。 GigaPath-Flash 和 GigaTIME-Flash 是用于科研的模型,并非面向临床使用,也未经过临床验证,包括用于诊断、预后判断、治疗方案选择或其他患者照护决策。模型性能可能因数据集、扫描仪、机构、人群和使用场景而异。

计算病理学的规模化机遇

组织病理学是癌症研究中信息最丰富、应用最广泛的数据来源之一。每次组织活检都会生成一张全视野切片图像,以亚细胞分辨率记录细胞形态;全球各家医院每年都会产生数百万张这类切片。这些数据包含与诊断、预后判断、治疗方案选择以及肿瘤微环境生物学相关的信息。

基础模型开始让我们得以大规模挖掘这些信息。但全视野切片图像非常庞大,通常超过十亿像素;即使处理一张切片,也需要分析数千个图像块。当研究问题涉及数万名患者时,计算成本会迅速攀升。更重要的是,人群规模的发现并不是运行一次模型就能完成的:它需要反复进行特征提取、统计分析、假设检验,并在不同患者亚组、生物标志物和临床终点之间开展验证。

计算成本限制了研究人员能够分析的患者数量、数据集规模、任务数量和假设数目。要充分释放病理基础模型的潜力,我们需要能够在人群规模的数据上反复、经济地运行这些模型。

从 GigaPath、GigaTIME 到 -Flash 系列

GigaPath(Nature,2024)是一款全视野切片基础模型,基于 Providence 的大规模真实世界组织病理数据进行预训练。不同于只能处理图像块的模型,GigaPath 能够学习整张切片的上下文表征,同时捕捉局部细胞模式和整体组织结构。

GigaTIME(Cell,2026)将这项工作拓展到了肿瘤微环境。GigaTIME 基于 4000 万个细胞及其配对的 H&E 和多重免疫荧光(mIF)数据进行训练,可将常规 H&E 图像转换为包含 21 个蛋白通道的虚拟空间蛋白质组图谱。在超过 14,000 名癌症患者的数据上应用后,它生成了一个虚拟人群,并发现免疫细胞状态与临床生物标志物之间存在 1,200 多个具有统计学显著性的关联。

GigaPath 和 GigaTIME 解决了病理数据规模和生物学发现的扩展问题。如今,Flash 系列模型进一步解决了实验规模化的问题。

Figure 1: Overview of the GigaPath/GigaTIME model family. GigaPath-Flash provides efficient tile and slide encoders at 22M parameters. GigaTIME-Flash predicts spatial proteomics from H&E, replacing the CNN backbone with the distilled ViT-S encoder.
图 1:GigaPath/GigaTIME 模型家族概览。GigaPath-Flash 提供高效的 tile 编码器和 slide 编码器,总参数量为 2200 万。GigaTIME-Flash 根据 H&E 预测空间蛋白组学数据,并以蒸馏后的 ViT-S 编码器替代 CNN backbone。

GigaPath-Flash 与 GigaTIME-Flash

Flash 系列的核心目标是:在保留有效病理学表征的同时,大幅降低生成和使用这些表征所需的计算资源。两款模型采用相同的高效 backbone——从原始十亿参数级 GigaPath 编码器蒸馏得到的紧凑型 ViT-S tile 编码器,并均以 Apache 2.0 许可证开源。

GigaPath-Flash

GigaPath-Flash 是一款面向全切片表征学习的高效基础模型,由 2200 万参数的 ViT-S tile 编码器和 2100 万参数的 LongNet slide 编码器组成。tile 编码器从原始 GigaPath ViT-g 教师模型中蒸馏而来,将十亿参数级模型的表征能力迁移到规模小一个数量级的 backbone 中。slide 编码器通过扩张注意力机制为所有 tile embedding 建立上下文关联,其计算规模随 tile 数量线性增长。

在切片级分类基准测试中(PANDA 前列腺分级和 EBRAINS 脑肿瘤亚型分类),GigaPath-Flash 在全切片预训练模型中实现了最低的推理成本,同时保持了有竞争力的性能:在计算量约低 50 倍的情况下,得分与原始 GigaPath 的差距控制在 3% 以内。

图 2:全切片基准测试中的效率—性能权衡。与其他全切片预训练模型相比,GigaPath-Flash(左上,红色)以显著更低的计算成本实现了具有竞争力的性能。
图 2:全切片基准测试中的效率—性能权衡。与其他全切片预训练模型相比,GigaPath-Flash(左上,红色)以显著更低的计算成本实现了具有竞争力的性能。

GigaTIME-Flash

GigaTIME-Flash 使用 GigaPath-Flash 的 ViT-S 编码器替换原版 GigaTIME 的 CNN 主干网络,并搭配轻量级卷积解码器,实现从 H&E 到 mIF 的转换。模型通过 LoRA 适配器进行微调,预训练编码器的权重基本保持冻结。

在涵盖脑部、乳腺、结肠和肺部癌症的同分布与分布外队列中,GigaTIME-Flash 的空间蛋白质预测质量达到或超过原版 GigaTIME。尤其是在分布外数据上,模型提升更为明显,表明基础模型主干有助于提升模型对未见过组织类型的泛化能力。

图 3:在 GigaTIME 测试集和四个分布外 Prov-TMA 队列上,GigaTIME 与 GigaTIME-Flash 的窗口平均 Pearson 相关系数。GigaTIME-Flash 在所有队列上的表现均达到或超过原版模型。
图 3:在 GigaTIME 测试集和四个分布外 Prov-TMA 队列上,GigaTIME 与 GigaTIME-Flash 的窗口平均 Pearson 相关系数。GigaTIME-Flash 在所有队列上的表现均达到或超过原版模型。

提升效率,同时保留基础模型能力

Flash 系列模型带来了显著的效率提升:

模型类型效率提升
GigaPath-Flash全切片基础模型计算量减少约 50 倍;相比 GigaPath,保留 97% 的预测性能
GigaTIME-Flash空间蛋白质组学速度提升约 6 倍,内存占用减少约 8 倍;预测性能优于 GigaTIME

对于单张切片,这些差异意味着更短的运行时间和更低的硬件要求;而在处理数万张切片时,它们甚至可能决定实验能否真正开展。下面以单张 NVIDIA A100 GPU 为例,假设每张切片约包含 10,000 个 tiles,估算不同规模队列生成虚拟 mIF 所需的实际耗时:

模型1,000 张切片100K 张切片1M 张切片
GigaTIME-Flash约 2 GPU 小时约 7 GPU 天约 70 GPU 天
GigaTIME约 7 GPU 小时约 30 GPU 天约 300 GPU 天
估算基于以下条件:每张切片约 10,000 个 tiles、batch size 为 128,并使用单张 NVIDIA A100 GPU。实际运行时间取决于切片大小、切片分辨率和硬件配置。
Figure 4: GigaTIME efficiency scaling. Left: throughput (tiles/sec) vs. batch size. Right: peak GPU memory (GB) vs. batch size. GigaTIME-Flash scales to over 1,600 tiles/sec while using a fraction of the memory.
图 4:GigaTIME 的效率扩展性。左图展示吞吐量(tiles/秒)随 batch size 的变化,右图展示 GPU 峰值显存(GB)随 batch size 的变化。GigaTIME-Flash 的吞吐量可提升至每秒超过 1,600 个 tiles,同时仅占用一小部分显存。

开放模型发布

GigaPath-Flash 和 GigaTIME-Flash 均以开放权重模型形式发布,采用 Apache 2.0 许可证。模型权重和代码已在 HuggingFace 上提供:

这是一个早期研究版本。目前的评估仅覆盖有限的基准和队列,仍需在更多任务、扫描仪和患者群体中开展广泛验证。我们预计,这些模型最有价值的应用将延伸到初始实验之外的科学问题、队列和使用场景。我们欢迎社区开展评估,也同样期待了解这些模型在哪些方面表现出色、又在哪些方面存在不足。

要将其应用于临床,还需要进一步开展多机构和前瞻性验证。

以效率推动科学发现

GigaPath 和 GigaTIME 展示了病理基础模型能够从全视野切片和肿瘤组织中学习什么。GigaPath-Flash 和 GigaTIME-Flash 则朝着让这些能力服务于更大规模人群、更多实验和更广泛研究社区迈出了一步。

通过提升病理基础模型的效率,我们希望拓展研究人员能够探索的科学问题规模。

致谢

GigaPath-Flash 和 GigaTIME-Flash 由 Microsoft Research、华盛顿大学和 Providence 合作完成。技术细节请参阅论文

论文共同作者:Naoto Usuyama、Jeya Maria Jose Valanarasu、Sicong Yao、Hanwen Xu、Jaspreet Bagga、Guanghui Qin、Robert E. Kramer、Cliff Wong、Soohee Lee、Hao Qiu、Theodore Zhengde Zhao、Racheli Ben Shimol、Angela Crabtree、Kevin Matlock、Eduardo Alejandro Lozano Garcia、Naiteek Sangani、Alberto Santamaria-Pang、Maximilian Rokuss、Yashna Hasija、Naisargi Manishkumar Patel、Jason Entenmann、Alexandra Q. Bartlett、Bill J. Wright、Bernard A. Fox、Brian Piening、Sheng Zhang、Sheng Wang、Tristan Naumann、Carlo Bifulco、Hoifung Poon

原始来源: 微软研究院

评论 (0)