论文精读

XrayGPT:用医学视觉语言模型做胸片报告摘要

XrayGPT 冻结医学视觉编码器、线性对齐微调 LLM,构建会话式胸片摘要与问答模型,医生评估超 70% 回复科学准确。

· 约 2 分钟阅读

XrayGPT:用医学视觉语言模型做胸片报告摘要

一篇把“视觉编码器 + LLM”做成会话式放射科助手的早期代表作,方法不复杂但工程取舍很值得记。

它解决什么

放射科报告撰写重复度高,医生希望有能“看图说话”、还能回答追问的助手。XrayGPT 的目标就是用医学视觉语言模型(VLM)生成高质量胸部 X 光摘要,并支持开放式问答。

方法要点

  • 冻结视觉编码器 + 线性对齐:不重训视觉骨干,只训一个线性投影把医学图像特征映射到 LLM 语义空间,配合指令微调,结构极简、好复现。
  • 用自由文本报告造数据:从自由文本报告生成约 21.7 万条交互式高质量摘要,反过来改善胸片数据的排列与覆盖。
  • 指令集驱动对话:通过微调高质量指令集,让模型既能出摘要也能答追问,而不是只做单轮 caption。

结果

在测试子集上,超过 70% 的回复被认证医生判定为科学准确,平均得分 4/5。这个“医生在环评估”的设定,比单纯刷自动指标更有说服力。

对我的启发

  • 线性对齐 + 冻结编码器的轻量路线,正好对应 智医助手 里 VLM Decider 的低成本接入方式——先用小改动验证价值,再决定是否重训。
  • 21.7 万条摘要来自报告自身的“自监督造数”,对本地知识库缺标注医学语料时是可直接借鉴的数据飞轮。

本文整理自本地知识库论文笔记(XrayGPT: Chest Radiographs Summarization using Large Medical Vision-Language Models),更多论文阅读沉淀见 本地知识库

继续阅读