← 文章 / AI技术
微软研究院 3小时前 · 2026-08-31 12:47:38 · 1 阅读

CARE-X:面向临床实用放射学的VLM——辅助监督、奖励对齐学习与工具增强测量

工具增强的放射学视觉-语言模型(VLM)工作流程图。编排器将用户的图像查询路由至 VLM,后者进行图像分析,调用测量工具计算心脏和胸腔宽度以及心胸比(CTR),并返回带有视觉叠加层的诊断指标。

研究声明:CARE-X 是一个研究模型,并非微软的产品或医疗器械。它尚未获得任何监管机构的许可或批准,也不适用于临床诊断、筛查或患者护理。以下所述结果均为回顾性研究发现,不能证明 CARE-X 在任何临床用途中的安全性、有效性和适用性。所提及的潜在工作流程属于未来研究方向,并非现有功能或推荐用途。

概览

  • 面临的挑战:胸部 X 光片解读涵盖多种任务,既需要具有表现力的报告生成能力,也需要校准良好的诊断预测。
  • CARE-X 是一个面向多样化临床解读任务的统一胸部 X 光片 VLM。它将生成能力与结构化预测相结合,既能输出自由文本推理,也能给出确定性结果。
  • CARE-X 采用强化学习(DAPO)方法,在多任务环境中针对临床正确性进行奖励优化。
  • 在与 CARE-X 独立的一项研究实验中,我们将 Qwen3-VL-4B-Instruct 与确定性测量工具配对使用,用以评估直接计算相较于纯视觉估算能否提升在依赖测量指标的任务上的表现。
  • 已在来自 Narayana Health 的真实印度临床数据上完成验证,涵盖罕见 ICU 病理变化以及经 CT 确诊的器官增大情况。

放射科医生所需:任务多样性、灵活性与临床保真度

一个真正具有临床实用价值的放射学 AI 系统,必须能够支持广泛的任务类型、适应不同的工作流程,并输出医学上准确的结果。

放射科医生及其他临床医生将胸部 X 光用于多种不同的目的。一个真正具有临床实用价值的 AI 系统必须能够胜任这一系列任务。它可能需要为一份报告生成详尽的检查所见和简洁的诊断意见,回答关于某项发现是否存在、缺席或具体位置的问题,识别医疗器械并评估其放置位置,或是精确定位图像中异常所在的区域。

这些任务还要求不同形式的输出,从叙述性的报告到校准过的诊断评分。而且最重要的是,它们都必须保证临床准确性。一份报告表面上看可能写得完美,却在临床上错误百出——比如遗漏了某项发现、把否定关系搞反了,或是弄错了位置。同一项发现在不同情境下可能无关紧要,也可能至关重要。

CARE-X 作为一个研究模型,正是为了探索如何用一种统一的方法来应对这些多样化需求而开发的。该系统结合了生成式与判别式能力、临床对齐的优化方法,以及基于工具的推理,从而在保持临床准确性的同时,支持更广泛的放射科工作流程。

当前放射科视觉语言模型的不足

尽管最近的模型在任务广度上令人印象深刻,但放射科医生的实际需求与现有系统所能提供的之间仍存在关键差距:

  1. 诊断决策缺乏校准置信度。 生成式视觉语言模型以自由文本形式输出诊断结果,但通常不提供校准后的置信度分数。在临床场景中,置信度至关重要。临床医生无法根据不同临床情境调节灵敏度与特异度的权衡——而这是实际部署中的关键需求。判别式模型具备这一特性,却缺乏开放式生成的灵活性。
  2. 交叉熵损失无法优化临床忠实性。 标准训练方法对所有词元级错误一视同仁,无论其临床后果如何。坐标错误与无关紧要的措辞差异受到的惩罚毫无差别;"是"可能被翻转为"否",尽管两者临床含义截然不同;遗漏危及生命的发现,与省略次要观察,所承受的训练惩罚也可能相同。因此,模型的优化目标并未明确指向患者诊疗中最关键的内容。
  3. 不具备处理依赖测量的发现的能力。 部分放射学发现的判断不能仅依赖视觉识别。例如心脏增大、纵隔增宽等征象,取决于精确的测量。模型也许能正确识别胸片是 AP 位还是 PA 位拍摄,但判断心脏增大需要测量心脏宽度与胸廓宽度,并计算心胸比。这些数值应当通过实际测量与计算获得,而非仅凭视觉近似估算,同时还需考虑投照体位、曝光条件、患者旋转等因素。

上述不足表明,仅有流畅的生成模型远远不够。系统必须兼具广泛的任务覆盖能力、结构化预测能力、与临床对齐的优化能力,以及在需要直接测量时提供定量工具的能力。


CARE-X:一个模型,灵活输出

CARE-X 将这些多样化的解读能力整合于同一模型中,根据各任务需求采用生成式或双路径推理:

任务类型CARE-X 所做的工作推理模式
报告生成:所见生成详细的"所见"部分生成式
报告生成:印象生成简洁的诊断印象生成式
存在与否定评估
判断是否存在病理并处理否定表达双模式:生成式 + 辅助头
病灶位置评估识别异常出现的部位生成式
细粒度多标签疾病分类对多个标签下的异常进行分类生成式
多标签管线和导管分类识别可见的医疗器械生成式
管线和导管的异常放置检测判断器械位置是否放置不当双模式:生成式 + 辅助头
异常短语定位定位文本描述的病理发现双模式:生成式 + 辅助头
解剖结构定位定位 29 个解剖区域双模式:生成式 + 辅助头
表 1:CARE-X 的任务覆盖范围与推理模式

双模式推理指单次前向传播即可同时输出自回归文本和带置信度分数的结构化辅助头预测。这样既保留了自由文本的灵活性,又能针对需要控制工作点的任务提供可调阈值的输出。

CARE-X 架构与训练方法

CARE-X 基于 SigLIP2-so400M 视觉编码器和 Phi-4-mini-instruct(3.8B)语言模型构建,二者通过轻量级适配器连接。为同时支持自由文本生成和结构化临床预测,模型在共享的语言主干上扩展了任务特定的辅助头,用于分类和视觉定位。这些辅助头在共享表征的同时输出校准后的诊断预测和空间定位信号。它们并非独立训练,而是与语言建模目标联合训练,使结构化监督能够丰富共享表征,并提升同一任务上的生成性能。

训练流程。CARE-X 采用三阶段监督微调管线(视觉预训练、适配器/辅助头训练、LoRA 适配),随后进行基于 DAPO 的强化学习。DAPO 针对临床报告生成、诊断准确性和空间定位质量优化任务特定的奖励。

CARE-X 架构,包含 SigLIP2 视觉编码器、Phi-4-mini 骨干网络、分类与定位辅助头、语言建模头,以及用于报告生成、VQA 和定位任务的 DAPO 对齐。
图 1. CARE-X 模型。(左)基于任务特定头(分类、定位、语言建模)的有监督微调,共享同一个 Phi-4-mini-instruct 骨干网络。分类头输出校准的 P(Yes)/P(No) 分数;定位头输出带置信度的边界框坐标;语言建模头生成自由文本回复。(右)针对报告生成、定位和 VQA 多任务强化对齐的 DAPO 方法,使用任务特定奖励。

辅助监督:结构化预测强化生成能力

本工作的一个核心发现是:将判别式辅助头与生成式 VLM 联合训练,能丰富共享表征,从而在相同任务上获得更强的生成性能,同时输出校准良好的结构化预测。

定位能力提升

辅助定位头始终优于生成式解码的定位效果。在解剖结构定位任务(Chest ImaGenome)上,mAP 和 mIoU 分别提升 +28.2 pp 和 +6.2 pp;提升幅度最大的是短语定位任务(PadChest),mAP 和 mIoU 分别提升 +24.6 pp 和 +14.1 pp。复合空间损失增强了共享表征中的几何精度。

DAPO 缩小与专用检测头的差距

经 DAPO 训练的生成式输出接近甚至超过 SFT 辅助检测头。在解剖结构定位任务上,CARE-X 的生成式输出(mAP 为 0.868)超越了 SFT 检测头(0.865)。这一结果具有重要的实际意义——它证明奖励对齐学习可以使自回归空间解码达到与结构化预测相当的水平,让临床医生在推理时只需使用单一生成模式,无需依赖辅助头。

可调工作点的校准分类

除了增强表征能力外,分类头还带来一项独特的部署优势:经过校准的概率分数配合可调阈值,使临床医生仅凭单次前向推理就能在高灵敏度筛查与高特异度确认之间灵活切换——这是纯生成式架构无法提供的功能。

模型推理设置灵敏度 ↑PPV ↑F1 ↑
CARE-X生成式0.9320.8950.913
CARE-X (Th=0.5)辅助头0.9430.8850.913
CARE-X (Th=0.6)辅助头0.8550.9270.890
CheXOne生成式0.8780.8540.866
MedGemma生成式0.7980.8860.839
表 2:Chest ImaGenome 上的异常分类性能。可调阈值便于选择不同的工作点。

在四个基准上均实现出色的报告生成效果

在论文的对比范围内,CARE-X 在 MIMIC-CXR、IU-Xray、CheXpert-Plus 和 ReXGradient 上大多数指标都达到了最佳表现。CRIMSON 作为一项留出评估指标,专门考察异常发现并按临床严重程度对错误加权,表明这些提升反映的是临床意义上的改进,而非针对奖励函数的过拟合。

图 2. CARE-X 与基线报告生成模型在四个胸部 X 光数据集(ReXGradient、MIMIC-CXR、IU-Xray 和 CheXpert-Plus)上的 CRIMSON 得分(↑)。CARE-X(高亮)在每个数据集上都取得了最高的 CRIMSON 得分。

CARE-X 在 ReXVQA 上达到 94% 准确率

截至 2026 年 8 月,CARE-X 在 ReXrank RexVQA 排行榜上排名第一。在 ReXVQA 基准(涵盖五个临床相关类别、共 41,007 个问答对)上,CARE-X 取得了 94% 的整体准确率,比排名第二的公开报告模型高出 6 个百分点。

图 3:ReXVQA 在五个影像所见质量维度上的准确率——否定、存在性、定位、鉴别诊断和几何信息,以及综合表现。CARE-X 在所有维度上都优于 CheXOne-R1 和 MedGemma,其中在鉴别诊断、定位评估和否定理解上的领先优势最大。 工具增强的测量:感知与计算的交替 某些放射学所见依赖于定量测量而非视觉模式。在一项独立于 CARE-X 的研究实验中,我们构建了一个推理阶段的流水线,将 Qwen3-VL-4B-Instruct 与确定性测量工具结合,使模型能够在图像理解和精确计算之间交替进行。Qwen3-VL-4B-Instruct 在整个推理过程中持续保留对胸片的视觉访问,按需调用工具来识别解剖标志点、计算测量值并评估诊断阈值。由此形成了一个多轮推理循环,将感知与测量交替进行,使模型能够在得出诊断前将视觉上下文与精确的定量证据相结合。
Diagram illustrating a workflow for a medical assistant using a vision-language model (VLM) to analyze chest X-ray images and provide diagnostic metrics. Key components include orchestrator handling prompts and tool calls, assistant performing perception and tool calls to measure cardiac and thoracic widths, and synthesizing diagnosis with visual overlays and calculated cardiothoracic ratio (CTR) displayed in red and blue.
图 4. 工具增强的定量推理流水线。协调器负责多轮循环的调度:VLM 对图像进行推理(感知),发出结构化的工具调用,接收确定性结果,并综合得出最终诊断。
尽管该方法无需任何任务特定的训练,但在所有基于测量的评估条件下都大幅优于仅依赖感知的推理。结果表明,对于依赖阈值的诊断,直接计算临床定义的测量值比单纯依赖视觉近似更可靠。

更广泛地来看,这种结合测量的方法能够扩展临床实践中从胸片常规获取的定量评估范围,从而改善临床工作流程。例如,主动脉扩张通常不在 CXR 上量化,往往是在因其他指征拍摄的 CT 扫描中偶然发现的。由于延迟发现可能导致不良心血管事件,基于 CXR 的可靠筛查有望实现主动脉扩张的更早识别与随访。

ConditionPerception F1Tool F1Δ F1
Cardiomegaly74.5696.00+21.4
Mediastinal Widening72.6397.47+24.8
Aortic Knob Enlargement60.3199.76+39.5
Ascending Aorta Enlargement39.33100.00+60.7
Descending Aorta Enlargement†28.57100.00+71.4
Average+43.6
表 3:纯感知 vs. 工具增强测量。在五项疾病上,F1 平均提升 43.6 个百分点。

在印度临床数据上的验证:罕见 ICU 病症与 CT 确诊的扩张

研究伦理与数据使用:Narayana Health 的评估使用了经去标识化的回顾性临床数据,并已通过相关机构伦理审查与数据使用审批。Narayana Health 批准了本研究结果的发表。

研究 1:住院与 ICU 病症

为在研究环境下评估真实世界的泛化能力,我们在 Narayana Health 的 1,047 张去标识化胸片上对 CARE-X 进行了测试,标注了五种罕见、高急性的病症,患病率在 2.6% 到 5.2% 之间——这反映了真实临床分布,在这类场景中漏诊往往带来严重后果。

FractureMediastinal ShiftPneumoperitoneumPneumothoraxTubes & Lines Abnormal Placement
ModelSens / SpecSens / SpecSens / SpecSens / SpecSens / Spec
CheXOne0.41 / 0.900.80 / 0.780.67 / 0.98 0.85 / 0.720.03 / 0.97
MedGemma0.05 / 1.001.00 / 0.530.00 / 1.000.52 / 0.730.18 / 0.87
CARE-X0.62 / 0.640.83 / 0.860.89 / 0.940.83 / 0.750.66 / 0.77
表 4:印度医院数据上的 ICU 病理分类。CARE-X 取得了最均衡的表现。

CARE-X 在五项病变中的三项上达到了最高的灵敏度,同时保持了合理的特异度,展现出对低患病率临床场景的泛化能力。

研究 2:CT 确认的扩大性病变

在一项旨在衡量纯召回效能的回顾性研究中,我们评估了依赖测量的病变,例如纵隔增宽相关表现(包括主动脉增宽、肺门肿块和肺动脉增宽),所用队列为 122 例经 CT 确认金标准的门诊阳性病例,以避免胸片上临界增宽表现的医师主观性。在叠加设置下,VLM 同时接收原始 X 光片和另一张带有相关解剖结构分割掩膜的图像,从而提供空间引导但不直接使用测量工具。

工具增强版本达到了 94.26% 的召回率,较最佳纯感知基线提升了 10.65 个百分点。在 CT 或超声心动图可及性有限的场景下,依托胸片这类普及度高的影像模组进行可靠分诊,既能减少不必要的转诊,也能避免漏诊。

图表
图 5:在仅依赖感知、叠加辅助推理和工具增强推理三种方式下,对 CT 确诊主动脉增宽队列的召回率。(研究 2)

在另一项相关研究(已被 EACTS 2026 会议接收)中,针对轻度主动脉扩张,基于测量驱动的推理方法在 43 例 CT 确诊病例中检出了 40 例(灵敏度 93%),而初次影像读片中仅识别出 5 例(12%)——因为在这些胸片检查中,主动脉增宽通常并非主要适应症。这意味着额外发现了 35 例在初次 CXR 解读中被遗漏的轻度病例。这些结果表明,引入明确的定量测量有助于识别那些仅凭视觉观察难以判定的临界性增宽。

这些结果能说明什么、不能说明什么

以上数据均为召回率,即我们能捕获多少真阳性。初始研究聚焦于此,因为在分诊场景中,漏诊通常是代价更高的错误模式;而 CT 确诊的真实标签为我们提供了一种清晰的衡量方式,无需依赖放射科医生对疑难病例的共识。

然而,召回率仅反映了诊断性能的一个维度。一个对所有病例都报阳性的模型召回率可达 100%,但实际毫无用处。一项扩展研究正在进行中,将纳入 CT 确诊的阴性队列。初步结果令人鼓舞,后续计划进一步验证在胸片上进行主动脉定量测量作为主动脉扩张筛查工具的可行性。


CARE-X:迈向临床可用的放射科 AI

CARE-X 证明,在统一的放射学 AI 模型中,判别式目标和生成式目标可以有效结合。通过联合训练分类、定位和语言能力,该模型既支持灵活地生成报告,又能输出经过校准、可调节阈值的预测。独立开展的测量研究进一步凸显了学习推理与确定性计算之间一种务实的分工:VLM 负责视觉理解并识别相关证据,而依赖测量的诊断则通过透明的工具化计算完成。在具有临床挑战性的 Narayana Health 队列上进行的回顾性评估,为该方法在真实放射学场景中的应用潜力提供了令人鼓舞的证据。这项研究的临床意义还体现在:基于 AI 的主动脉扩张筛查应用入选了 IHF 创新中心 2026 年世界医院大会的展示决赛,认可其在心血管疾病早筛与临床决策支持方面的潜力。

展望未来,CARE-X 可以通过结构化报告生成、更丰富的鉴别诊断支持,以及将工具更紧密地集成到模型内部,进一步拓展现有能力。该框架还可以引入更广泛的临床上下文,如实验室检查结果和患者病史,从而实现更全面的临床推理。


CARE-X 是一个研究模型,并非微软的产品或医疗器械。它尚未获得任何监管机构的许可或批准,也未针对临床诊断、筛查、患者护理或临床决策进行设计或验证。文中所述结果均为回顾性研究结果,不能证明其在临床使用中的安全性、有效性或适用性。

论文共同作者:

Mercy RanjitAnirban PoryaNiharika VadlamudiNikhilesh ESathvik JoelPrasanth V VTanuja GanuAbhyuday SwamyPranay UmredkarPradeep NarayanVivek Rajagopal

合作单位:Medha AINarayana Health

原始来源: 微软研究院

评论 (0)