标签 / TAG
# 多模态
视觉语言模型与图文跨模态对齐实践。
共 4 篇文章
论文精读
统一多模态 Transformer 用于临床诊断的表征学习
提出基于 Transformer 的统一多模态表征学习模型,将影像与文本融入同一架构,在肺病识别与预后预测上分别比单模态和分离式方法高出 12% 和 9%。
论文精读
MMedAgent:学会使用医疗工具的多模态智能体
MMedAgent 是首个面向医疗领域的多模态 Agent,通过指令微调自主选择六大工具解决七类任务,性能优于 GPT-4o 且更新成本极低。