XrayGPT:用医学视觉语言模型做胸片报告摘要
一篇把“视觉编码器 + LLM”做成会话式放射科助手的早期代表作,方法不复杂但工程取舍很值得记。
它解决什么
放射科报告撰写重复度高,医生希望有能“看图说话”、还能回答追问的助手。XrayGPT 的目标就是用医学视觉语言模型(VLM)生成高质量胸部 X 光摘要,并支持开放式问答。
方法要点
- 冻结视觉编码器 + 线性对齐:不重训视觉骨干,只训一个线性投影把医学图像特征映射到 LLM 语义空间,配合指令微调,结构极简、好复现。
- 用自由文本报告造数据:从自由文本报告生成约 21.7 万条交互式高质量摘要,反过来改善胸片数据的排列与覆盖。
- 指令集驱动对话:通过微调高质量指令集,让模型既能出摘要也能答追问,而不是只做单轮 caption。
结果
在测试子集上,超过 70% 的回复被认证医生判定为科学准确,平均得分 4/5。这个“医生在环评估”的设定,比单纯刷自动指标更有说服力。
对我的启发
- 线性对齐 + 冻结编码器的轻量路线,正好对应 智医助手 里 VLM Decider 的低成本接入方式——先用小改动验证价值,再决定是否重训。
- 21.7 万条摘要来自报告自身的“自监督造数”,对本地知识库缺标注医学语料时是可直接借鉴的数据飞轮。
本文整理自本地知识库论文笔记(XrayGPT: Chest Radiographs Summarization using Large Medical Vision-Language Models),更多论文阅读沉淀见 本地知识库。