← 文章 / AI技术
Google Research 博客 7小时前 · 2026-09-05 05:11:16 · 4 阅读

推进 AMIE 迈向专家级视听临床问诊

医生接诊患者时,问诊远不止于语言的交流。医生会观察患者的步态,留意其可见的不适表现,注意其呼吸情况,并引导患者完成体格检查动作。这些源源不断的视觉和听觉信息会与口头问诊内容自然融合。这类非语言的视觉与听觉线索,对有效诊断、患者信任和医患沟通都至关重要。 具备临床推理与对话能力的 AI 系统,有望大幅提升医疗专业知识和医疗服务的可及性,让未来医生能把时间集中在医患互动中最有意义的环节上。在早期研究中,我们的临床推理与对话研究型 AI 系统 Articulate Medical Intelligence Explorer(AMIE)已在文本诊断对话中展现出专家级水平,并被证明可有效地辅助临床医生进行鉴别诊断。最近,我们将 AMIE 的能力从诊断延伸到了疾病的长期治疗与管理

我们还将 AMIE 的能力扩展至专科级评估,涵盖肿瘤学心脏病学眼科学,以及基于图像与临床文献的多模态诊断推理,并在由患者演员参与的模拟环境中进行了验证。与此同时,我们正通过以医生为中心的监管框架推动这些研究成果向临床实践转化,并已开展首批真实世界临床研究,包括与贝斯以色列女执事医疗中心合作的临床可行性研究,以及与Included Health合作开展的全国性随机对照研究

尽管取得了这些进展,我们的研究中仍存在一个根本性局限:基于文本的界面会舍弃临床实践中的视觉与听觉维度。患者必须将复杂的躯体症状转化为书面描述,这一过程会丢失诊断信息,且对数字素养或健康素养有限的患者尤为不利。纯文本系统无法独立观察有助于临床推理的视觉和听觉线索,也无法引导患者完成影响鉴别诊断的体格检查动作。

如今,我们在《Towards expert-level medical AI for real-time video consultations》中推出了实时的 AMIE(Video)版本,以应对上述局限。AMIE(Video)基于 GeminiProject Astra 构建,能够进行同步的临床视频问诊,实时感知非语言临床线索、引导患者演员完成虚拟体格检查,并进行诊断推理。

在一项包含 100 个场景、300 场实时问诊以及 30 名具备 Board 认证资质的初级保健医生(PCPs)的多臂随机对照研究中,我们首次展示了 AI 系统在实时临床视频问诊中达到专家级水平的能力。

观看视频

YouTube 视频链接

AMIE (Video):异步多智能体架构

通过视频进行有效的临床对话需要在相互冲突的需求之间取得平衡:系统必须以自然的对话速度响应患者,同时执行审慎的临床推理,并持续处理视觉和听觉数据流。目前,单一智能体无法满足所有这些要求。深度推理需要时间,但对话停顿会损害患者信任和融洽关系。

为应对这一挑战,AMIE (Video) 采用异步多智能体架构,将任务分配给三个并行工作的专用智能体:

  • 对话智能体(Talker agent):面向患者的智能体,负责驱动响应迅速、低延迟的口语交互。它在融入其他智能体指导的同时,保持自然的对话流畅度。
  • 规划智能体(Planner agent):在后台运行,该智能体持续完善系统的临床推理,更新鉴别诊断和管理方案,识别信息缺口,并对多样化的临床目标重新排序优先级。
  • 感知智能体(Perception agent):该智能体持续审查音频和视频流,识别具有临床意义的非语言线索(如明显的痛苦迹象、体征或听觉信号),并将这些观察结果置于当前对话的语境中进行综合判断。

这种解耦设计让 AMIE (Video) 在进行诊断推理和视听感知的同时,仍能保持自然的对话延迟——如果这些处理不分离,就会带来难以接受的等待。自动化评估证实,在这个三智能体架构中,每个 agent 都为临床指标的改善做出了重要贡献,比如问诊能力、临床推理和治疗建议,同时也提升了对话质量相关指标,包括以患者为中心的沟通技巧和响应延迟。

AMIE (Video)-1

AMIE 用于实时临床视频问诊的整体架构、评估研究及关键发现。

以自动化评估引导开发

构建视听医疗 AI 的一个关键挑战,是如何大规模地刻画系统的感知与推理能力。为了指导开发,我们从医学文献中梳理出一套与远程医疗相关的临床视听能力分类体系,涵盖非言语视觉线索、听觉信号和体格检查动作,并据此搭建了一套自动化评估套件。

这个评估框架结合了针对性的单轮视听评估和多轮模拟语音问诊。单轮视听评估用于测试具体的临床感知与推理场景(例如正确识别解剖学上的左右侧,或识别呼吸窘迫的征象)。多轮模拟语音问诊则评估端到端的对话表现,评估时会把视觉线索以文字描述的形式注入模拟场景(例如,在帕金森病场景中,AI 患者模拟器被要求展示自己的笔迹时,会注入这样一句口头描述:“[举起纸对着镜头,字迹歪扭细小]”)。这些互补的评估让我们能够快速迭代系统设计,并在开展人类评估之前,就充分了解 AMIE (Video) 的能力与失败模式。

通过随机化视频研究进行评估

为了在更具挑战性且更贴近现实的端到端音视频临床问诊场景中评估临床能力,我们开展了一项大规模、随机化的客观结构化临床考试(OSCE)研究,采用同步视频问诊界面。

为在评估中覆盖更广泛的疾病谱,该研究涵盖100个临床场景,涉及五个身体系统,包括心肺、腹部、头/眼/耳/鼻/喉(HEENT)、神经/精神以及肌肉骨骼系统。15位经过培训的患者演员完成了300次标准化问诊,分布在三个研究组中:

  • AMIE(视频):运行视频配置的AMIE进行实时视频问诊。
  • AMIE(文本):仅文本版本,作为基线以剥离音视频能力的贡献。
  • PCP(视频):10位经 board 认证的家庭医生通过同一视频界面进行问诊。

一个由20名经验丰富的初级保健医生组成的独立评审团,使用既定的临床评分标准对所有问诊进行评估,包括通用临床能力量表和针对每个场景定制的详细病例专项评分准则。

AMIE (Video)-2

AMIE与PCP的视频问诊质量评估,涵盖诊断准确性、临床评价者评分及患者演员偏好。

关键结果

专家级临床表现:在核心临床能力方面,包括病史采集的详尽程度、诊断准确性、管理适宜性及沟通质量,临床评价者对AMIE(视频)的评分与PCPs相当。AMIE(视频)在这些维度上也持平或优于AMIE(文本)。

体格观察与检查优势:AMIE(视频)在激发体征发现并主动引导患者演员完成虚拟检查动作方面的平均评分显著高于PCPs和AMIE(文本)。这一优势也体现在各病例专项感知与检查评分中。

角色扮演患者更偏好视频体验:角色扮演患者强烈倾向于同步视频界面而非基于文本的聊天,认为其使用更容易、对健康问题的沟通效果更佳。与初级保健医生及基于文本的 AMIE 相比,他们在共情、医患关系建立以及对诊疗的信心方面对 AMIE(视频)均给予更好评估。

AMIE (Video)-3

模态消融研究比较了 AMIE 的视频配置与仅使用文本聊天的 AMIE。结果基于临床评估者的评分及角色扮演患者的偏好。

局限性与负责任的发展

本研究存在重要局限性,必须结合这些局限来解读结果。本研究的参与者均为在模拟临床环境中接受过训练的职业角色扮演患者,而非因自身健康状况就诊的真实患者。即便训练有素,角色扮演患者也无法完全复现真实临床就诊中的复杂性与不可预测性;且所涵盖的场景仅限于可通过表演真实呈现的疾病,遗漏了一些视听感知对诊断至关重要的重要临床表现。此外,针对系统的自动化评估虽未影响整体对话质量与诊断准确性,但仍发现偶发的感知与推理错误,系统仍存在可能干扰对话自然流畅性的间歇性技术问题。鉴于 Project Astra 的原型性质,这些技术考量属于未来开发可在系统层面解决的问题,超出了本文所探索的具体医疗应用场景。在得出任何关于现实世界应用价值的结论之前,必须在真实患者与真实临床场景中开展进一步研究。

展望未来

本研究表明,向具备专家级质量的音视频临床 AI 转型已切实可行。AMIE(视频)能够融入临床实践中的感知丰富性:观察非语言线索、引导体格检查,并通过语音对话自然交流——这些能力更贴近远程医疗视频问诊的体验。

在通往负责任的现实世界验证的道路上,仍有许多重要问题有待解决。我们的研究发现需要在真实患者身上得到验证,扩展到无法通过模拟呈现的临床场景,并依托健全的安全框架提供支撑。我们已经朝这个方向迈出了初步的步伐:与 Beth Israel Deaconess Medical Center 合作开展的真实世界可行性研究,为基于文本的 AMIE 在临床实践中的安全性和实用性提供了初步证据;与 Included Health 合作进行的全国性随机研究正在进一步评估 AI 在真实世界虚拟医疗中的应用。这些研究经验将共同帮助我们在未来以负责任的方式把音视频能力融入临床实践。虽然前路依然漫长,但这些结果标志着向 AI 系统迈出了重要一步——未来,这类系统有望通过感知临床实践中的复杂感官信息,为医疗诊疗提供辅助。

致谢

本文所述研究是 Google Research 和 Google DeepMind 多个团队共同努力的成果。我们感谢所有合著者:Mahvish Nagda、Jihyeon Lee、Matthew Thompson、CJ Park、Tim Strother、Valentin Liévin、Roma Ruparel、Akshay Goel、Teya Bergamaschi、Suhana Bedi、Meet Shah、Pavel Dubov、Liviu Panait、Toshiyuki Fukuzawa、Sam Schmidgall、Craig Schiff、Joseph Xu、Aliya Rysbek、Yana Lunts、Jan Freyberg、Rebecca Hemenway、Sunny Virmani、David Racz、Carey Radebaugh、Joëlle Barral、Kavi Goel、Dale R. Webster、Katherine Chou、Avinatan Hassidim、Yossi Matias、James Manyika、Gregory Wayne、Tao Tu、Yun Liu、Ethan Goh、Christina Chen、Ryutaro Tanno 以及 Cameron Chen。

原始来源: Google Research 博客

评论 (0)