项目 / Projects
多模态医疗诊断 Agent 工作流(核心算法)
基于 RAG 与工具调用的多模态医疗诊断 Agent 工作流:层级化 Planning、PubMedBERT 医学检索、结构化诊断计划、多模型 VLM Decider 与 Function Calling 工具链,测试数据集端到端评估 F1=60% / Balanced Acc=73%。
项目背景
这是一个独立的多模态医疗诊断算法研究项目,目标是构建一套 端到端的多模态医疗诊断 Agent 工作流:从医学知识检索、诊断任务规划、病例级工具调用,到结构化结果总结与评估。它面向医学影像辅助诊断中知识密集、多模态融合困难、流程复杂、可解释性不足等痛点。
技术方案
- 层级化 Agent Workflow
- Task-level Planning:把复杂诊断任务拆解为医学知识检索、图像预处理、特征提取、定量分析、VLM 判断、结果汇总等可执行步骤。
- Case-level Diagnosis:在单个病例上执行上述计划,支持固定计划与动态计划两种模式。
- RAG 医学知识检索
- 基于 PubMedBERT 对医学知识库、疾病知识与诊断指南向量化检索,为 Planner 提供外部证据,降低大模型直接生成诊断流程时的知识幻觉。
- 结构化诊断计划
- 把每一步诊断操作定义为「输入对象—调用工具—输出结果—后续依赖」的执行单元,使流程可解析、可执行、可追踪,为 Function Calling 与 Evaluator 提供统一接口。
- 多模态 VLM Decider
- 集成 Qwen-VL、InternVL、Janus、BioMedCLIP,构建多模型 Decider,用于医学图像理解、图文语义对齐与病例级诊断推理。
- Function Calling 工具链
- 封装视盘分割、视杯分割、图像预处理、定量指标计算等工具,使 Agent 能按诊断计划调用外部视觉工具,形成「医学知识 + 图像证据 + VLM 推理」的诊断链路。
- Coding Agent 自动执行
- 根据 Planner 生成的诊断计划动态生成 Python 执行函数,实现病例级流程自动化执行与结果聚合。
- Summary 与 Evaluator
- 对诊断结果结构化总结,并计算 F1 Score、Balanced Accuracy,为工作流优化提供量化依据。
关键实现
- 计划即接口:结构化计划格式让 Planner、Function Calling、Evaluator 共享同一套 schema,避免各自为政。
- 多模型路由:Decider 不直接绑定单一 VLM,而是按任务类型选择模型(理解 / 对齐 / 推理),预留替换空间。
- 评估驱动迭代:每次闭环都输出 F1 / Balanced Accuracy,作为下一轮计划与工具选择的信号。
指标与成果
在 测试数据集 上完成端到端评估,实现从检索、计划、工具调用、vCDR 定量到 VLM 推理与指标评估的完整闭环。以 Qwen 作为推理模型时:
- F1 Score = 60%
- Balanced Accuracy = 73%
均优于不使用工作流直接推理诊断的结果(gpt-4o 56.4 / 21.1),验证了「检索 + 计划 + 工具 + 评估」闭环相对纯生成的价值。
与算法 / AI 应用开发的关联
这是简历中「RAG、VLM、Agent Workflow」能力的集中体现,也是后续做算法 / AI 应用开发的样本项目:它涵盖了任务规划、工具调用、结果总结与评估闭环的完整 Agent 应用机制,可直接迁移到其它多模态决策场景。
反思与后续
- Decider 路由策略可学习化,按任务难度自动选模型以平衡成本与精度。
- 计划生成可引入反思(Reflection)做多轮自我修正。
- 评估口径需和临床错误成本进一步对齐,防止准确率掩盖少数类风险。