项目 / Projects

多模态医疗诊断 Agent 工作流(核心算法)

基于 RAG 与工具调用的多模态医疗诊断 Agent 工作流:层级化 Planning、PubMedBERT 医学检索、结构化诊断计划、多模型 VLM Decider 与 Function Calling 工具链,测试数据集端到端评估 F1=60% / Balanced Acc=73%。

已实现角色 核心算法与 Agent 工作流开发周期 2025.09 - 2026.05

项目背景

这是一个独立的多模态医疗诊断算法研究项目,目标是构建一套 端到端的多模态医疗诊断 Agent 工作流:从医学知识检索、诊断任务规划、病例级工具调用,到结构化结果总结与评估。它面向医学影像辅助诊断中知识密集、多模态融合困难、流程复杂、可解释性不足等痛点。

技术方案

  1. 层级化 Agent Workflow
    • Task-level Planning:把复杂诊断任务拆解为医学知识检索、图像预处理、特征提取、定量分析、VLM 判断、结果汇总等可执行步骤。
    • Case-level Diagnosis:在单个病例上执行上述计划,支持固定计划与动态计划两种模式。
  2. RAG 医学知识检索
    • 基于 PubMedBERT 对医学知识库、疾病知识与诊断指南向量化检索,为 Planner 提供外部证据,降低大模型直接生成诊断流程时的知识幻觉。
  3. 结构化诊断计划
    • 把每一步诊断操作定义为「输入对象—调用工具—输出结果—后续依赖」的执行单元,使流程可解析、可执行、可追踪,为 Function Calling 与 Evaluator 提供统一接口。
  4. 多模态 VLM Decider
    • 集成 Qwen-VL、InternVL、Janus、BioMedCLIP,构建多模型 Decider,用于医学图像理解、图文语义对齐与病例级诊断推理。
  5. Function Calling 工具链
    • 封装视盘分割、视杯分割、图像预处理、定量指标计算等工具,使 Agent 能按诊断计划调用外部视觉工具,形成「医学知识 + 图像证据 + VLM 推理」的诊断链路。
  6. Coding Agent 自动执行
    • 根据 Planner 生成的诊断计划动态生成 Python 执行函数,实现病例级流程自动化执行与结果聚合。
  7. Summary 与 Evaluator
    • 对诊断结果结构化总结,并计算 F1 Score、Balanced Accuracy,为工作流优化提供量化依据。

关键实现

  • 计划即接口:结构化计划格式让 Planner、Function Calling、Evaluator 共享同一套 schema,避免各自为政。
  • 多模型路由:Decider 不直接绑定单一 VLM,而是按任务类型选择模型(理解 / 对齐 / 推理),预留替换空间。
  • 评估驱动迭代:每次闭环都输出 F1 / Balanced Accuracy,作为下一轮计划与工具选择的信号。

指标与成果

测试数据集 上完成端到端评估,实现从检索、计划、工具调用、vCDR 定量到 VLM 推理与指标评估的完整闭环。以 Qwen 作为推理模型时:

  • F1 Score = 60%
  • Balanced Accuracy = 73%

均优于不使用工作流直接推理诊断的结果(gpt-4o 56.4 / 21.1),验证了「检索 + 计划 + 工具 + 评估」闭环相对纯生成的价值。

与算法 / AI 应用开发的关联

这是简历中「RAG、VLM、Agent Workflow」能力的集中体现,也是后续做算法 / AI 应用开发的样本项目:它涵盖了任务规划、工具调用、结果总结与评估闭环的完整 Agent 应用机制,可直接迁移到其它多模态决策场景。

反思与后续

  • Decider 路由策略可学习化,按任务难度自动选模型以平衡成本与精度。
  • 计划生成可引入反思(Reflection)做多轮自我修正。
  • 评估口径需和临床错误成本进一步对齐,防止准确率掩盖少数类风险。