论文精读
MMedAgent:学会使用医疗工具的多模态智能体
MMedAgent 是首个面向医疗领域的多模态 Agent,通过指令微调自主选择六大工具解决七类任务,性能优于 GPT-4o 且更新成本极低。
MMedAgent:学会使用医疗工具的多模态智能体
医疗 AI 从“单模型”走向“工具调用”的关键一步——让模型自己决定该用哪个工具、怎么组合,而不是人工编排固定流程。
它解决什么
通用大模型在医疗场景面临两个核心问题:一是缺乏专用工具(无法直接读 DICOM、跑分割模型、查知识库),二是“一把梭”式生成容易在专业任务上出错。MMedAgent 的思路是:不追求一个模型干所有事,而是教模型学会调用专业工具。
方法要点
- 六大内置工具:医学影像分类/分割、视觉问答、报告生成、知识检索、实体抽取、多模态推理——覆盖放射科主要工作流。
- 指令微调驱动工具选择:通过高质量指令数据训练模型自主判断“当前任务该调哪个工具”,而非硬编码路由规则。
- 七类任务统一框架:在同一架构下处理影像分析、报告生成、临床问答等不同模态的任务,降低系统复杂度。
- 高效更新:新工具或新任务只需补充少量指令样本,无需全量重训,这点对快速迭代的医疗场景非常关键。
结果
在多个医疗基准测试中,MMedAgent 的表现优于同规模开源方法,甚至在部分任务上超越 GPT-4o。更重要的是它的工具调用准确率高——选对了工具,后续的专用模型才能发挥真正价值。
对我的启发
- 这和我在做的智医助手 Agent 工作流思路高度一致:LLM 做调度与编排,专业模型做执行。MMedAgent 证明了这条路线在医疗领域的可行性。
- 工具设计的粒度很重要——太粗(一个“诊断”工具包打天下)失去意义,太细(每个病种一个工具)维护成本爆炸。六大工具的划分是个值得参考的平衡点。
- 指令微调比 few-shot prompting 在工具选择稳定性上好很多,后续可以借鉴这个“先微调工具选择器、再跑执行链”的两阶段设计。