← 文章 / AI技术
The Decoder 2小时前 · 2026-09-22 05:55:02 · 0 阅读

布里斯托研究者:医学已掌握“黑箱”处理经验,AI 可从中学习

Image description

核心要点

  • 布里斯托大学的研究人员提出了一种系统评估医疗 AI 可靠性的测试框架,其模式借鉴了药物审批流程。
  • 他们提出的方法名为 “Learning Ensemble”,重点检验三个维度:系统的运行边界与训练数据、其在所有患者群体中的可靠性,以及其在日常临床场景中的实际适用性。
  • 该流程旨在防止系统在实战中因依赖无关图像模式而失效,或错误评估患者风险。

布里斯托大学研究人员提出了一套框架,让开发者可以系统地测试医疗 AI 在临床环境中的可靠性。该框架参考了医药行业将新药推向市场的标准。

医疗 AI 系统在早期测试中往往表现良好,但一旦进入临床使用便容易失效,因为它们往往会捕捉训练数据中与真实诊断无关的特征。

药物领域也面临类似的未知挑战,许多药物的具体体内作用机制尚未完全弄清。即便如此,医学界已发展出可靠使用这些化合物的方法。每种药物都附有一份结构化信息包,明确其起效条件,包括剂量、给药时间和适用患者群体。正是这份信息包将一种化学物质转化为可靠的治疗方案。

受此启发,布里斯托的研究人员为医疗 AI 开发者提出了类似的信息包方案。

三件套工具包

他们提出的 “Learning Ensemble” 涵盖了开发者在系统用于患者前必须记录并核查的三个方面。

第一方面关注系统的应用边界,包括目标医生或诊所、运行硬件,以及用于训练的患者数据。一项 2021 年的研究 展示了这一点的重要性:一个旨在通过 X 光片识别新冠感染的 AI 系统,并未识别肺部病灶,而是依赖了图像中与诊断偶然相关的无关细节。一旦该系统部署到不同的诊所,便立即失效。

第二个领域是不同患者群体间的可靠性。平均命中率是不够的,因为一个系统整体表现可能很好,却在某些群体上持续出错。另一项 2021 年的研究发现,AI 系统在读取 X 光影像时,对医疗服务不足人群的疾病检出率要低得多。部署这样的系统,恰恰会伤害那些本来就医条件就更差的患者。 第三个领域在研究者看来最为重要,即系统是否真正契合其预期的临床用途。技术上跑得通的系统,在临床上仍可能毫无价值。比如有个 AI 系统把合并肺炎的哮喘患者评估为低死亡风险。在训练数据里,这类患者确实存活率更高,但那只是因为急诊科对他们采取了格外积极的治疗。而对于给新患者做风险评分的分诊工作来说,这个结果完全没有意义。 作者们把这项工作视为一个起点。在实践中构建可靠的医疗 AI 系统,依然是一个需要反复试错的艰难过程,离不开专业知识、外部审查和持续调整。他们提出的框架,是为了给开发者提供一种共同语言和结构,帮助更早地发现问题。
原始来源: The Decoder

评论 (0)