← 文章 / AI技术
Google Research 博客 7小时前 · 2026-09-05 05:11:14 · 4 阅读

利用 AI 工具从可穿戴传感器数据中优先筛选候选 biomarker

可穿戴设备能够以群体规模持续采集生理信号。从心率动态到睡眠模式,这些数据流可以在症状出现之前揭示早期的生理变化。如今的瓶颈已不再是数据采集,而是将这些信号转化为可靠且具有临床意义的生物标志物。

现有的基于语言模型的代理系统可自动化科学工作流的部分环节,但在处理生理时间序列数据时往往会出现问题。这些系统注重预测性能,却忽视了统计有效性,从而导致虚假相关、信息泄露和脆弱的特征。

为此,我们推出了生物标志物发现框架(Biomarker Discovery Framework),这是一个多代理系统,在人工监督下将候选生物标志物的优先级排序结构化为一个迭代研究循环。通过结合假设生成、并行统计分析、模型训练、对抗性验证以及基于文献的推理,该框架在保持严格统计严谨性并保留人工监督的同时,加速了发现过程。在三个队列(N = 9,279 participant-observations)中,Biomarker Discovery Framework 恢复了已知的临床信号,在不同独立数据集中识别出收敛的生物标志物,并在与人口统计学特征结合时提升了下游预测性能。

A conceptual diagram illustrating a cyclical AI-driven biomarker discovery process analyzing wearable and clinical data.

Biomarker Discovery Framework 概述。(a) 该系统摄入来自消费级可穿戴设备和临床实验室的时间序列数据。(b) 闭环架构协调六个阶段,映射人类生物标志物优先级排序的生命周期。(c) 协调器代理(Orchestrator agent)将自然语言研究指令分解为执行计划。

结构化、对抗性的流水线与人工监督

Biomarker Discovery Framework 将用于数值分析的确定性计算与用于假设形成和解释的生成式推理相结合。协调器代理将自然语言研究指令分解为执行计划,并指导专用代理完成六个阶段的工作。同时,共享内存、结构化事实表和通用工具确保了整个工作流的溯源性:

  • 数据理解:Scout 代理梳理数据 schema、缺失情况、时间结构和临床终点,同时通过泄漏控制确保目标标签与特征构建相互隔离。
  • 候选假设奠基:文献与 Hypotheses 代理检索并验证已有研究证据,进而提出符合生理逻辑的特征和复合指标。
  • 迭代发现循环:统计与 ML 代理执行确定性代码来构建特征、估计关联、进行多重检验校正,并评估预测信号。Critic 代理负责找出薄弱假设和未解决的缺口,必要时触发进一步分析。
  • 对抗性验证:Critic 和 Defender 代理对候选指标做压力测试,排查目标泄漏、过拟合、混杂因素敏感度、构念重叠、不稳定性以及生理上不合理等问题。系统内置了一套包含 11 项检查的结构化流程,为每个候选打上明确的标签:screened(已筛查)、conditional(有条件)、exploratory(探索性)、rejected(已排除)、unstable(不稳定)。
  • 深度调研与评估:Mechanism、Novelty 和 Strategy 代理评估生物学合理性、已有文献和潜在转化价值,同时避免将相关性误当作因果证据。
  • 报告撰写与汇总:Report 代理对照事实清单核实所有数值结论,把分析、图表、文献和局限性汇编成草稿,供专家审阅。

举个例子,在“找出与抑郁严重程度相关的可穿戴设备候选指标”这一任务中,Biomarker Discovery Framework 分析了 DWB 数据集,提出了睡眠时序波动类特征,并估计出睡眠时长波动与 PHQ-8 严重程度之间的关联(ρ = 0.252)。随后,工作流检验了结果的稳定性、泄漏风险、亚组一致性以及其他可能的解释,最终将其转化为一个有文献支撑的昼夜节律不稳定性假设,交由人工审阅。

A flowchart detailing a multi-agent AI system for automated biomarker discovery, validation, and report generation.

生物标志物发现框架架构。专业化子智能体(Scout、Critic、Defender、Mechanism)在共享状态上协同运作。该框架通过安全机制确保统计有效性,将特征构建与目标信号分离,并要求候选标志物通过包含 11 项测试的对抗性过滤阶段。

结果:跨领域优先筛选候选关联

为评估生物标志物发现框架从噪声数据中提取合理生理洞察的能力,我们将其独立应用于三个大规模队列,共计 9,279 个参与者观测值,涵盖精神健康(DWBGLOBEM)和代谢疾病(WEAR-ME)领域。该流水线自主识别出 41 个精神健康候选数字生物标志物和 25 个代谢结局候选标志物。

下表展示了经过筛选的候选关联样本。Spearman 秩相关系数 ρ 概括了关联的方向和强度。95% 置信区间量化了不确定性,校正后 p 值用于处理多重比较。机制列呈现基于文献的假设,而非因果结论。重要的是,最后一列描述的是先验证据强度——并非本研究中的临床验证——星号表示证据等级标志物,而非统计显著性代码。

生物标志物发现框架并非简单选择现有变量,而是构建了新的组合特征。例如,在精神健康领域,它识别出睡眠持续时间变异性与睡眠入睡变异性为抑郁严重程度的最佳相关因素。在代谢领域,它推导出一个心血管体能指数(步数除以静息心率)作为胰岛素抵抗的非侵入性相关指标,并将其与既往关于血糖调节和心肺代谢健康的研宄联系起来。

呈现三个队列中生物标志物候选项、效应量、校正 p 值及机制假说的数据表。

效应量与不确定性来自确定性分析,机制解释则基于文献提出的假说。Established 表示已有大量支持性文献;Supported* 表示底层生理轴已确立,但数字化操作化属新领域;Emerging** 表示先前证据有限,需通过独立样本验证;R 表示未能通过构念重叠筛选的候选项。† 标记由可穿戴设备提取的特征,Flagged unstable 表示独立样本估计值的效应方向发生反转。

大规模发现临床信号

我们将生物标志物发现框架(Biomarker Discovery Framework)部署于三个不同的大规模队列,合计包含 9,279 个参与者观测值,涵盖心理健康与代谢性疾病两大领域。

在两个抑郁域中,该框架优先选出了同一 circadian-instability 构念的不同操作化指标。在 DWB 队列中,睡眠时长变异性与 PHQ-8 严重程度相关(ρ = 0.252,p < 0.001);在 GLOBEM 队列中,睡眠入睡变异性则表现为与 PHQ-4 的探索性低信号关联(ρ = 0.126,p < 0.001;交叉验证 AUC = 0.535)。由于各队列的人群、终点指标及特征定义均不相同,且未出现完全一致的候选项复现,因此这一模式应解读为构念层面的提示性收敛,而非直接复现。

展示不同抑郁严重程度组别中睡眠时长与入睡可变性的双小提琴图。

两个抑郁队列中的相关 circadian-instability 候选项。两类队列的症状严重度组间变异性均呈递增趋势,但这些发现仅具假设生成意义,不构成因果证据,也未实现跨队列的直接复现。

总的来说,Biomarker Discovery Framework 共识别出 41 个心理健康领域的候选数字生物标志物,以及 25 个代谢结局领域的候选标志物。虽然效应量反映了被动感知式数字表型研究中常见的偏小幅度,但将这些标志物特征与人口统计学变量结合使用时,预测性能有所提升(抑郁症 ΔR² = 0.040,胰岛素抵抗 ΔR² = 0.021)。

雷达图和表格,展示某 AI 智能体在多个数据科学基准上与基线方法的性能对比。

Biomarker Discovery Framework 概览。左图:该框架还在数据科学和健康类基准上进行了评估,与各基准上最强的基线方法相比表现具有竞争力。右图:在盲法人类专家评估中,Biomarker Discovery Framework 在各质量维度上均获得了最高的平均分。

领域专家评估

为了评估研究报告的质量,来自医学、生物医学数据科学、机器学习、生物信息学和数字健康领域的 15 位专家,对 Biomarker Discovery Framework 以及三个同期 AI 研究系统的盲审报告进行了评审,这三个系统分别是 Google DeepMind 的 AI co-scientist BiomniGoogle ADK 的 Data Science Agent。Biomarker Discovery Framework、Biomni 和 Data Science Agent 在 21 次评审中被一起打分,此外 Biomarker Discovery Framework 还在另外 13 次评审中,使用相同的评估工具单独打分。

在双盲评估中,Biomarker Discovery Framework 在所有七个质量维度上均获得最高平均分。按照研究设定的模拟编辑评审标准,该系统是唯一获得“接收”或“小修”推荐的系统:2篇接收、8篇小修、8篇大修、3篇拒稿。审稿人估计平均会保留 Biomarker Discovery Framework 生成稿件内容的 56.9%,而基线系统的保留率仅为 18.8%–30.4%;在 13 次四系统排名环节中有 9 次将其列为第一。

Four charts evaluating various AI agents on report quality, acceptance rates, human effort saved, and task ranking.

双盲人工评估。(a)Biomarker Discovery Framework 在所有七个质量维度上均取得最高专家评分,尤其在统计有效性与逻辑严密性方面表现突出。(b)编辑决策分布显示,该系统的唯一特征是获得非拒稿决定(接收/小修)。

结论

随着可穿戴健康数据在人群规模上的持续增长,数字医学的瓶颈已不再是数据采集,而是如何基于原则开展严谨的假设生成。仅靠扩展模型能力无法解决科学严谨性问题。然而,当部署于精心设计的架构中——将确定性计算与生成式推理分离,并迫使智能体为其发现进行防御性辩论——AI 即可在人类监督下支持结构化的假设生成、验证与优先级排序。通过从黑箱自动化转向透明、人在回路的工作流,我们能够构建出可安全加速临床研究假设到验证周期的 AI 系统。

致谢

本文由 Google Research 的 Yubin Kim、Hamid Palangi 和 Daniel McDuff 撰写。本研究由 MIT 博士生 Yubin Kim 在 Google 实习期间主导完成,导师为 Daniel McDuff 与 Hamid Palangi。感谢来自 Google Research、Google DeepMind 及学术界的合作者与共同作者对本研究的贡献。

原始来源: Google Research 博客

评论 (0)