论文精读

PriorRG:先验引导的对比预训练与粗到细胸片报告生成

PriorRG 利用患者特定先验知识生成胸部 X 光报告,通过两阶段训练(先验引导对比预训练 + 粗到细解码)提升临床准确性与流畅度,在 MIMIC-CXR 上显著优于现有方法。

· 约 2 分钟阅读

PriorRG:先验引导的对比预训练与粗到细胸片报告生成

一篇把“患者历史先验”引入放射报告生成的近期工作,两阶段设计清晰,对医疗 VLM 的时序建模有参考价值。

它解决什么

现有方法仅基于单张胸部 X 光图像生成报告,完全忽略了患者的临床先验知识(既往病史、检查记录、疾病进展),导致无法捕捉疾病动态变化。PriorRG 的核心思路是:同一患者的多次检查之间蕴含丰富的时空语义信息,应当被利用起来。

方法要点

  • 先验引导的对比预训练:将患者历史报告作为先验知识,通过对比学习让模型学会对齐当前影像与历史文本之间的时空语义,建立“影像—病史”关联。
  • 粗到细解码(Coarse-to-Fine Decoding):先生成报告骨架(关键发现与疾病标签),再逐句展开为完整自然语言描述,避免一步到位导致的细节丢失或幻觉。
  • 双数据集验证:在 MIMIC-CXR 和 MIMIC-ABN 两个公开数据集上评估,BLEU 与 F1 分数均显著超越此前的 SOTA 方法。

结果

在 MIMIC-CXR 上,PriorRG 的 BLEU 和 F1 指标全面优于单图像基线和多模态对照方法。更重要的是,引入先验后模型能更准确地追踪疾病进展(如肺炎吸收情况、结节变化趋势),这在临床场景中比单纯的单次描述更有实用价值。

对我的启发

  • 医疗报告生成不能只看“一张图”,时序上下文是区分优秀报告和平庸报告的关键差异点。
  • 粗到细解码是个通用技巧,不限于放射报告——任何需要结构化输出的生成任务都可以借鉴这个两阶段思路。
  • 先验知识的注入方式(对比预训练 vs 拼接输入)值得在后续 Agent 工作流中实验对比。

继续阅读