SymptomAI:面向日常症状评估的对话式AI智能体
为填补这一空白,我们在真实场景中开展了一项对比研究,测试一套实验性对话原型 AI 智能体,探索其能否独立完成端到端症状问诊与鉴别诊断评估,从而为研究基准测试提供依据。我们在近期论文《SymptomAI: Towards a Conversational AI Agent for Everyday Symptom Assessment》中分享了随机全国性研究(n=13,917)的成果,已签署知情同意的参与者在此过程中与五种 Gemini Flash 2.0 SymptomAI 智能体之一交互。研究期间产生的所有诊断、标签及疾病关联均仅供研究分析,不代表确认的临床诊断或正式医疗评估。交互结束两周后,我们请参与者反馈其实际就医时医生给出的诊断。基于这些数据,我们邀请临床专家进行标注,对比 SymptomAI 的诊断表现与实际医生的医疗评估。
验证 SymptomAI 鉴别诊断(DDx)准确率后,我们进一步将其结果与参与者对话前 Fitbit 可穿戴设备记录的生命体征数据进行比对。结果显示,最终被诊断为感染性疾病的对话,其时间线与参与者可能处于免疫反应阶段的生理趋势高度吻合,为 SymptomAI 的性能提供了进一步佐证。
本研究中,我们部署了一套对话式 AI 智能体,用于端到端的患者问诊与鉴别诊断。参与者可与智能体交流自身症状,获取候选鉴别诊断列表,并录入后续诊断结果。
工作原理
我们招募了13,917名签署知情同意书的研究参与者,每人向五个随机分配的SymptomAI代理之一描述自身症状,这些代理在症状访谈方式上的灵活程度各不相同。对话中,参与者描述症状,SymptomAI则提出追问,最终形成一份**鉴别诊断**(DDx,即可疑诊断列表)及下一步建议。参与者随后可自行前往医疗机构就诊,并在两周后通过问卷反馈就诊结果。为评估SymptomAI的诊断水平,我们开展了一项临床专家标注研究:由三名持照医师组成评审组,审阅对话记录并给出各自的诊断意见(即鉴别诊断)。随后,三位医师以**盲评**方式,对SymptomAI与其余医师提供的DDx进行排序。主要发现
临床专家更偏好SymptomAI的DDx
超过50%的情况下,医师们更倾向于SymptomAI生成的诊断而非其他医师的判断。这表明SymptomAI的诊断结论与临床医师的医学判断一致性相当,甚至更高。
SymptomAI生成的DDx被临床评分者评为整体质量最佳的概率更高。
临床专家认为SymptomAI的DDx更准确
此外,我们基于Top-5准确率(即参与者个人医疗提供者提供的真实诊断是否出现在系统生成的鉴别诊断前五名中)对比了SymptomAI生成的鉴别诊断与真实临床医生提供的诊断准确性。我们的临床医生逐一核查了各类鉴别诊断清单,包括SymptomAI生成的清单和其他临床医生提供的清单,确认其中是否包含对应的诊断。结果发现,相比其他临床医生提供的诊断,SymptomAI生成的鉴别诊断获得医生认可为准确的次数更多。
SymptomAI生成的鉴别诊断更可能包含用户自报的医疗提供者诊断。
**信息收集方式提升诊断效果**
本研究还评估了不同问诊策略的效果。参与者被随机分配到五个实验组,分别采用不同的提示策略:动态实时组(Dynamic Live)和动态最终组(Dynamic Final)可自由提出不限数量的追问;固定典型组(Fixed Canonical)和灵活典型组(Flexible Canonical)均使用医学院标准问诊问题模板;基准无提示组(Base)则代表完全由用户主导的当前大语言模型聊天机器人交互模式。我们发现所有主动提问策略均显著优于基准组,验证了通过追问收集信息对提升鉴别诊断准确率的价值。
SymptomAI实验各分组中SymptomAI与临床医生的准确率对比。
按 SymptomAI 实验组的总用户字数。
SymptomAI 在低置信度案例上的表现
我们发现,SymptomAI 相对临床基线的性能提升,在医生对自身鉴别诊断(DDx)信心最低时最为显著。
按基线医生的 DDx 置信度分层,医生对 SymptomAI 与基线医生生成的鉴别诊断所赋予的 Top-5 准确率。
SymptomAI 的诊断结果与生物信号相关
鉴于 SymptomAI 在临床基线上的准确率,我们还可以探索其大规模应用的潜力。目前,临床标注成本制约了对大规模人群数据集的现实分析。像 SymptomAI 这样准确的症状自查系统,有望实现临床级诊断的自动化参考标注,从而开启生理数据的大规模分析——这是当前在规模化层面尚无法完成的任务。
一个典型的例子是将可穿戴生物信号与不同类别的疾病相关联。在急性呼吸道感染中,可穿戴生物信号会出现最显著的变化。为了在人群规模上研究这一问题,我们收集了参与者知情同意后,在与SymptomAI交互前长达30天的每日生物特征数据。我们发现,在用户报告症状前的几天里,生物信号出现了明确的偏移,提示症状 onset。重要的是,队列间的区分是通过将SymptomAI的首要候选诊断进行分类,并将被归类为呼吸道感染的诊断进行分组而得出的。该队列排除了过敏性鼻炎和慢性阻塞性肺病等非感染性呼吸道疾病。可穿戴生物信号偏移峰值与这些参与者症状报告日期的相关性,为与其报告症状相一致的观察性生理证据。
与历史基线期(-30至-15天)平均值相比,SymptomAI对话前几天可穿戴生物信号的变化。感染组(红色)包括SymptomAI诊断为呼吸道感染的参与者,基线组(灰色)则包含数据集中其余所有参与者。第0天表示SymptomAI对话的日期。
与生物信号结合的实用性
基于症状表现的 AI 评估为研究开辟了新的可能性。通过使用 SymptomAI 分析大量症状报告,并结合实时 Fitbit 数据,我们可以在广泛疾病范围内探索数字生物信号表型。我们的分析发现,在用户使用 SymptomAI 对话前的几天里,心血管功能、呼吸、皮温和睡眠质量等生理指标均出现了明显的变化趋势。这些客观变化与症状对话的时间高度吻合,为验证患者报告的症状或提供辅助鉴别诊断的被动数据提供了潜在途径。此外,这种实时可访问性凸显了 AI 症状检查器的一个核心优势:与传统临床预约可能面临的排期延迟不同,参与者可以在症状刚出现时同步参与 SymptomAI 研究。这有望提高患者报告的起病时间线的准确性——这对于人群规模的卫生健康分析至关重要。局限
SymptomAI 是一项探索性研究,有望成为基于 AI 的症状评估领域的重要进展,并展示其对希望了解自身症状的大众所具备的潜力。虽然人群部署评估揭示了通过远程患者访谈进行症状评估的准确性,但在与临床医生评估进行对比时,仍存在一些细微的局限性。
首先,鉴别诊断本身是一个模糊的任务,即使已报告的诊断也可能随时间推移而变化发展。症状评估只是某个时间点的快照,记录的是那一刻呈现的症状表现。受限于部署规模,我们无法控制症状报告的频率与时机。因此,部分参与者可能远在更具代表性的指标出现之前就已报告症状,而另一些人则可能基于多年慢性病经验,在充分知情的情况下报告了明显指征。未来的工作可聚焦于症状发展特定阶段的具体疾病,例如早发性代谢综合征或呼吸道感染初期的症状。本研究生成的所有诊断、标签及疾病关联均由AI推导而来,仅用于研究分析,不构成确诊的临床诊断或正式医疗评估。
其次,在评估过程中,临床医生审阅的是静态聊天记录,无权自行追问。若由他们主导症状访谈,可能会凭直觉收集到不同的信息。此外,尽管近期研究表明对话式AI系统能以临床医生级别的细节和准确性获取临床数据,但这类系统仍可能遗漏肢体语言、视觉观察、病历记录等替代性信号,或在基层医疗场景中缺失与患者已建立的信任关系。
总之,我们推出了SymptomAI——一款用于开展真实世界患者访谈与症状评估的调研型对话式AI代理。我们通过人群样本上的鉴别诊断准确率,展示了SymptomAI端到端的真实世界性能,并证明SymptomAI的诊断结果有助于分析可穿戴生物信号等大规模人群数据,从而挖掘生理信号与报告疾病之间的关联。
致谢
本工作由Joe Breda、Jake Sunshine和Daniel McDuff共同完成,贡献均等。感谢来自Google Research和Google DeepMind的合作作者及同仁对本研究的贡献。