← 文章 / AI技术
NVIDIA 开发者博客 6小时前 · 2026-09-24 07:12:18 · 3 阅读

NV-Reason-CT:专为放射科思维链推理设计的开放3D CT视觉语言模型

放射科 AI 在识别胸部 X 光片、病理切片及 2D 扫描中的异常方面已取得显著进展。然而,作为一种信息量大且临床价值极高的检查手段——3D 计算机断层扫描(CT)——目前尚未被现代 视觉语言模型(VLM)充分覆盖。前沿的通用模型在处理容积数据时表现不佳,且多数开放式的医疗 AI 模型缺乏放射科医生验证 AI 诊断结论所需的多轮对话深度。

英伟达推出了专为 3D CT 分析打造的 NV-Reason-CT,旨在填补这一空白。该 VLM 将思维链推理扩展至完整的容积数据,能够生成结构化的诊断报告,模拟放射科医生的内部思考过程,并支持针对胸部和腹部的多轮后续对话。该模型基于 NV-Reason-CXR 开创的推理方法论构建,后者已在一项获得 RSNA 2026 认可的多读者临床研究中得到验证,证实了在保持诊断准确性的同时有效节省了医生的时间。

NV-Reason-CT 是一个开源的研发基础平台,并非自主诊断系统或已获监管批准的临床产品。它是一个 AI 基础模型,供研究人员和开发者用于构建专业 CT 分析应用,并可根据具体使用场景进行后期训练。

为何 3D CT 推理需要不同的方法

一项腹部 CT 检查可包含 300 至 600 层轴位切片,这些切片编码了跨三个空间维度的解剖学背景信息,而标准的 2D 编码器无法从相互独立的切片中重构出这些信息。

这种容积复杂度给医疗 AI 带来了层层叠加的挑战,涉及感知、推理及对话深度等方面:

  • 感知:标准 VLM 将图像输入视为二维令牌网格。若将 CT 容积数据视为独立的 2D 图像堆叠处理,会丢失定义肿块、积液及浸润等结构所必需的切片间空间关系。这些结构的形态、范围及密度只有在三维空间中才具备真正的临床意义。
  • 推理能力:即便模型正确识别出异常,往往也只输出诊断标签,而无法解释“为什么”。放射科医生的思维并非基于标签,而是建立在系统性的解剖学审查、鉴别诊断及置信度评估之上。无法复现这一推理过程的 AI,既难以审计,无法从中教学,也无法安全地融入临床工作流。
  • 对话深度:面对可疑发现,放射科医生绝不会初见即结案。他们会追问细节、重新审视鉴别诊断,并将不同解剖区域的发现相互关联。大多数现有模型缺乏支持这种迭代式临床推理的多轮对话能力。

为 CT 分析提供完整的 3D 推理

NV-Reason-CT 结合了专用的 3D Vision Transformer (ViT) 编码器与经过训练的生成式语言模型,后者能生成模仿放射科医生系统化分析 CT 容积数据的思维链推理。

不同于将 2D 编码器独立应用于各个切片来适配 CT 的方法,NV-Reason-CT 将 CT 容积视为真正的 3D 输入进行处理。这保留了层面间的解剖学连续性,使模型能够像放射科医生浏览影像序列时那样,对结构进行整体性推理。

核心模型功能包括以下内容:

  • 结构化报告生成:NV-Reason-CT 可生成详细的结构化报告。NVIDIA 团队精心整理了一个覆盖 30 种胸部和 29 种腹部异常的 CT 本体(ontology)来引导和评估模型——例如肺结节、气胸、肝病变、肾囊肿等——其格式自然映射至临床文档工作流。
  • 模拟放射科医生的思维链:NV-Reason-CT 还能生成模仿放射科医生思维过程的推理链。模型以资深放射科医生阅片的风格,产出逐步的内部思考——系统性检查解剖区域、呈现相关发现、考量鉴别诊断并阐述不确定性——。
  • 多轮对话追问:临床医生和研究人员可以针对具体发现继续提问,要求模型澄清鉴别诊断思路,或在任何环节深入探究其推理过程。这种多轮对话能力让 NV-Reason-CT 不再只是报告生成器,而是可交互的诊断助手。
  • 完整的 3D ViT 编码器:专门构建的 3D 视觉编码器原生处理 CT 体数据,能够提取基于 2D 的方案无法捕捉的体积特征。此外,3D 视觉 token 的网格坐标也会传入 LLM,并通过 3D MRoPE 在 LLM 的各层中建模 token 之间的空间关系。这一架构设计让模型能够理解空间范围、断面形态以及切片之间的关联——这些正是准确解读 CT 的感知基础。

NV-Reason-CT 的架构如何为体积推理而专门设计?

模型架构由 Qwen3.5-4B LLM 与 3D ViT(Primus/Colipri)组成。所有权重均在大规模 CT 数据集(含结构化报告、推理链路和多步 VQA 数据,均为内部设计)上进行了端到端重训。标准 Transformer 架构的 VLM 是为 2D 图像设计的,若简单地把体数据压平成一系列 2D 切片来适配 CT,就会丢失定义体积性病灶的空间结构。

编码器架构改编自 Primus 3D ViT,训练前以 Colipri 权重初始化。CT 体数据被重采样为 192³ 体素、2 mm 各向同性分辨率,并采用不重叠的 8x8x8 patch token,最终得到 24x24x24 = 13,824 个视觉 token 上下文。所有视觉 token(连同其 3D 网格坐标)不做合并或降采样,全部传入 LLM。LLM 中引入了 3D MRoPE,用于建模视觉 token 之间的三维空间关系。

语言模型部分的训练目标是让模型像放射科医生那样推理:系统地逐个解剖区域审查,同时记录正常与异常发现,表达经过校准的不确定性,最终给出结构化结论。模型被设计成像老师一样作答,而不是简单分类:解释问题、梳理证据,并通过清晰可见的逻辑步骤得出诊断。

NV-Reason-CT 采用怎样的训练方法?

基于 NV-Reason-CXR 提出的方法,NV-Reason-CT 采用两阶段训练流程:先进行监督微调,再进行强化学习(RL)。

阶段 1:使用放射科医生推理数据进行监督微调

初始阶段使用混合数据训练模型,包括结构化报告、专家放射科医生的推理标注以及通用视觉问答(VQA)。放射科医生针对 CT 检查贡献了详细的思维链口述,捕捉其内部审查过程,包括在每个解剖区域观察什么、哪些发现被视为重要、权衡哪些鉴别诊断,以及如何得出最终评估。

由此形成的课程涵盖约 55 万个结构化问答样本,覆盖胸部和腹部区域,包含章节级解剖问答、侧重侧别和定位的发现问答、严重度级别问答以及二值异常识别。为提升鲁棒性,还纳入了针对无效提示词和图文不匹配对的拒绝样本。

训练数据包括 CT-RATE、NIH CT 数据集和 CancerVerse。该数据集还补充了由大型语言模型蒸馏生成的高质量合成推理数据,并以专家放射科医生的标注作为接地示例。混合数据集为模型提供了丰富信号,使其了解在各种 CT 发现下结构化放射学推理的特征。

阶段 2:通过 RL 优化推理质量

第二阶段使用组相对策略优化(GRPO)来精化推理质量。基于异常和诊断识别准确率的奖励函数引导模型生成不仅结构良好且临床正确的推理。GRPO 的奖励机制具备解剖感知能力。模型在每个解剖区域内的准确性得到强化,而非使用单一全局信号,从而改善全胸腹部发现分布上的校准。

这种两阶段方法(先学习推理模式,再强化正确性)使 NV-Reason-CT 能够在多样的 CT 表现中泛化,而无需对完整训练分布进行详尽的推理链标注。

基准测试表现

NV-Reason-CT 在主要的 3D CT 理解公开基准测试中达到了最先进的结果。

在 CT-RATE(3D CT 理解的主要公开基准)上,NV-Reason-CT 的表现优于所有已发布的基线模型,包括 3D 对比模型(VoxelFM、Pillar-0、CT-CLIP、Merlin)、2D/3D 融合 MLLM(ClinFusion-8B)以及基于切片的尖端模型(MedGemma 1.5)。这是首次有单一开放模型能同时实现具有竞争力的 CT 分类和报告生成能力。

模型类型Macro-F1Macro-AUROC
NV-Reason-CT原生 3D 生成式 VLM0.6140.871
VoxelFM3D 纯图像预训练0.5810.870
Pillar-03D 对比学习0.5440.861
ClinFusion-8B2D/3D 融合生成式 MLLM0.442n/r
CT-CLIP3D 对比学习0.3980.733
Merlin3D 对比学习0.3580.662
MedGemma 1.5最多 85 张轴状位切片0.303n/r
表 1. CT-RATE 分类结果(18 个标签,固定统一阈值)。NV-Reason-CT 使用直接的 Yes/No 提示进行评估,未使用分类头或任务特定适配)

除了基准测试性能外,NV-Reason-CT 还获得了美国国立卫生研究院(NIH)放射科医师的积极临床评价,他们验证了结构化报告的质量以及思维链推理轨迹的临床合理性。

“NV-Reason-CT 提供了系统性的逐步推理,这反映了我们实际分析 CT 检查的思考方式,”美国国立卫生研究院高级临床医师 Baris Turkbey 医学博士(F.S.A.R.)表示。“能够审查模型思维过程——而不仅仅是其结论——使得信任并采纳其发现成为可能。”

临床验证与实际影响

NV-Reason-CT 的价值超越了基准测试分数。审查过模型输出的放射科医师和临床研究人员一致强调,有两项能力使其区别于早期的 CT AI 系统:

  • 节省结构化报告时间:一份覆盖 60 多种异常的详细结构化报告,即使对经验丰富的放射科医生来说也非常耗时。NV-Reason-CT 几秒钟就能生成,且推理过程便于医生快速浏览、验证和修改——在保留医生把关的前提下,大幅减轻日常报告的认知负担。
  • 可审计的可解释性:传统医疗 AI 模型只输出标签或分数,而 NV-Reason-CT 会输出推理过程。这使得模型结论可以被审计,这是黑盒系统做不到的:放射科医生可以阅读思维链,判断模型推理与自己的判断是否一致,并标记分歧之处。这种透明度正是临床落地所必需的。

NV-Reason-CT 如何助力研究和医疗 AI?

NV-Reason-CT 的定位是一个基础模型,供更广泛的医疗 AI 社区在其之上构建。

研究人员可以利用模型 checkpoint 和后训练配方,研究医学影像中的思维链推理,在机构专属的 CT 数据集上微调,或将 NV-Reason-CT 集成到多模态研究管线中。配套的分割和 SDG 模型包括 NV-Generate-CTMR 和 NV-Segment-CTMR。

医疗 AI 公司——包括放射科工作流供应商、PACS 开发商和临床决策支持平台——可以将 NV-Reason-CT 适配到特定的临床应用中,把结构化的 CT 推理集成到现有放射科阅片工作流里。Aidoc、HOPPR、Rad AI、Mosaic Clinical Technologies 和 Raidium 等公司所处的领域,恰好需要一个能力强、开放、可对话的 3D CT 模型来填补真实的能力空白。

NV-Reason-CT 运行示例与输出

下面的示例加载 NV-Reason-CT,并对一个 3D CT 体数据进行一次推理。Checkpoint 可从 Hugging Face 获取。GitHub 仓库中包含推理脚本、训练配置和后训练配方。

import torch
from transformers import AutoModelForImageTextToText, AutoProcessor

model_name = "nvidia/NV-Reason-CT" 

model = AutoModelForImageTextToText.from_pretrained(
    model_name, 
    trust_remote_code=True,
    attn_implementation="sdpa",
    torch_dtype=torch.float16,
).eval().to("cuda")

processor = AutoProcessor.from_pretrained(model_name, trust_remote_code=True)

messages = [
    {
        "role": "user",
        "content": [
            {"type": "image"},
            {"type": "text", "text": "full chest CT reasoning analysis"}
        ]
    }
]

# Create prompt using chat template

text = processor.apply_chat_template(
    messages,
    add_generation_prompt=True,
    tokenize=False,
    enable_thinking=True
)

# Process inputs

inputs = processor(
    text=prompt,
    images3d=["chest_ct.nii.gz"],
    anatomy_region="chest",
    return_tensors="pt",
).to(model.device)

# Generate chain-of-thought reasoning and structured report

with torch.inference_mode():
    generated_ids = model.generate(
        **inputs,
        max_new_tokens=4096,
        do_sample=False,
        use_cache=True,
    )

# Decode

new_tokens = generated_ids[:, inputs.input_ids.shape[1]:]
response = processor.batch_decode(
    new_tokens,
    skip_special_tokens=True,
    clean_up_tokenization_spaces=False,
)[0]

print(response)

输出摘录

我们将系统地审查这份胸部增强CT(静脉注射对比剂)。首先,一个重要的技术和支持设备细节:左侧有一个输液港(port catheter),导管尖端终止于上腔静脉,这是预期中的中心静脉位置。 我将首先检查肺部及气道。中央气道通畅,因此没有主要的气管或主支气管阻塞。然而,当我们关注右肺时,右下叶是最显著的异常区域。右下叶存在一个大的肿块样病变,并伴有右下叶部分塌陷。这是一个有意义的发现,因为伴有阻塞后改变或体积丢失的肿块通常提示恶性病变。 右下叶还伴有另一个肿块样病变 [...]。 综上所述,胸部的主要发现是右肺下叶大块伴部分塌陷,以及右肺下叶附加的肿块样病变和纵隔及右肺门淋巴结肿大。这种模式提示胸部恶性肿瘤伴淋巴结受累。此外,双侧散在不均质磨玻璃影(ground-glass opacities),目前性质不定,可能是炎症、感染或肿瘤性质。此外,还有下胸椎骨质破坏伴中度椎管狭窄,以及数个右肋板状硬化病变。

NV-Reason-CT 在 NVIDIA 医疗 AI 生态系统中的定位

NV-Reason-CT 是 NVIDIA 医疗 AI 开放模型家族的一部分,旨在协同工作贯穿整个放射学流程:

  • NV-Generate-CTMR:合成逼真的 3D CT 和 MRI 体积数据,用于训练数据增强和研究
  • NV-Segment-CTMR:对 3D CT 和 MRI 体积数据进行自动化的器官和病灶分割
  • NV-Reason-CXR:用于胸部 X 光分析的思维链推理
  • NV-Reason-CT:用于全 3D CT 分析的思维链推理

这些模型共同构成了端到端放射 AI 流水线的基石——从合成数据生成,到分割,再到透明、可对话的临床推理。

欢迎探索 NVIDIA Medical AI 生态系统,了解更多信息。

上手 NV-Reason-CT,实现放射科医生的思维链推理

NV-Reason-CT 为医学中信息密度最高的影像模态之一带来了思维链推理。该系统将专用的全 3D ViT 编码器与经过推理训练的语言模型相结合,能够为 CT 体数据生成结构化的诊断报告和放射科医生式的分步推理,覆盖胸部和腹部发现,并支持多轮对话。

订阅NVIDIA 新闻,并在LinkedInXYouTube 上关注 NVIDIA Healthcare,获取最新动态。

原始来源: NVIDIA 开发者博客

评论 (0)