返回行业动态
研究前沿

英伟达开源 NV-Reason-CT:把思维链推理带进 3D CT 全身影像分析

英伟达发布开放的 3D CT 视觉语言模型 NV-Reason-CT,以真正的体数据而非二维切片为输入:3D 视觉编码器把 CT 重采样为 192³ 体素并生成 13824 个视觉 token,经 3D MRoPE 把空间坐标传入 Qwen3.5-4B 语言模型。模型可生成覆盖 30 种胸部与 29 种腹部异常的结构化报告、放射科式思维链与多轮追问。CT-RATE 上自报 Macro-F1 为 0.614,官方明确其不是自主诊断系统。

来源:NVIDIA 开发者博客:NV-Reason-CT 开放 3D CT 视觉语言模型原标题:Introducing NV-Reason-CT Open 3D CT VLM for Radiologist Chain-of-Thought Reasoning查看原文
深蓝色调放射影像中心,中央悬浮半透明三维人体胸腔体数据全息影像,环绕多层同心扫描光带与粒子

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

英伟达在其开发者博客上发布 NV-Reason-CT,一个专为三维 CT 影像打造的开放视觉语言模型。与主流做法不同,它不把 CT 当作一叠互不相关的二维切片,而是以真正的体数据为输入:一个专门构建的 3D 视觉 Transformer 编码器把 CT 重采样为 192³ 体素、2 毫米各向同性分辨率,切成 8×8×8 的非重叠 patch,得到 13824 个视觉 token,并把每个 token 的三维网格坐标通过 3D MRoPE 传给语言模型,让模型在推理时保留跨层面的解剖连续性。

  • 结构化报告:内部整理了覆盖 30 种胸部异常与 29 种腹部异常的 CT 本体,涵盖肺结节、气胸、肝内病灶、肾囊肿等
  • 放射科式思维链:按解剖区域系统检查、列出相关发现、考虑鉴别诊断并表达不确定性
  • 多轮追问:可就具体发现追问,要求澄清鉴别诊断或深挖推理过程
  • 架构:3D 视觉 Transformer(Primus/Colipri)加 Qwen3.5-4B 语言模型,全部权重端到端重训
  • 训练:两阶段——先用约 55 万条结构化问答、专家放射科医师思维链标注与合成推理数据做监督微调,再用 GRPO 强化学习按解剖区域感知的奖励打磨推理质量
  • 数据:CT-RATE、NIH CT 数据集与 CancerVerse,辅以经专家标注锚定的合成推理数据

成绩与边界

英伟达在 CT-RATE 基准上报告 Macro-F1 为 0.614、Macro-AUROC 为 0.871,并称优于其对比列表中的已发表系统;同时称美国国立卫生研究院的放射科医师审阅了模型生成的报告与推理轨迹,认为临床可信。这些均为厂商自报数据。

  • 定位:官方明确这是开放研发基座,不是自主诊断系统,也不是获批临床产品
  • 验证缺口:架构、训练与基准证据均来自开发方,尚缺独立复现、跨医院与跨人群评估以及错误分析
  • 推理痕迹:模型输出的推理文本应视为可审计的解释,而非内部计算过程的完整记录
  • 权责:检查点与训练配方开放,但数据治理、合规边界与临床使用责任由使用方承担

对企业的意义

这条发布把开放医疗基座模型的竞争推进到信息密度最高的模态之一。对医院与医疗 AI 团队来说,可获得的是一套可后训练、可审计的起点,而不是一个可直接上线的产品;真正的分水岭在于后续是否出现独立复现与面向具体临床用途的监管递交。英伟达同时把它与同系列的合成数据、器官与病灶分割、胸片推理模型并列,指向的是一条从数据生成到分割再到结构化推理的放射科流程分工。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。