项目 / Projects
基于 CNN-Transformer 融合的淋巴瘤医学图像分割
面向低对比度、小样本淋巴瘤灰度图像的分割模型:以改进 TransUNet(ResNet50 + Transformer 增强 + Attention Gate)兼顾局部细节与全局语义,Dice 85%+ / IoU 80%+,为智医助手视觉工具提供算法底座。
项目背景
淋巴瘤医学灰度图像存在 目标区域与背景对比度低、边界模糊、前景区域占比小、数据量有限 等问题。本项目构建一个基于 CNN-Transformer 融合的医学图像分割模型,提升模型对病灶区域的局部细节感知与全局语义建模能力,并为多模态医疗诊断 Agent 提供可调用的视觉工具。
方法
以 TransUNet 为基础架构,做三处增强:
- ResNet50 编码器 + Transformer 增强
- 采用预训练 ResNet50 提取 5 个尺度的多层次特征,冻结早期层以保留预训练视觉知识,缓解小样本场景下训练不稳定与过拟合。
- 在 ResNet50 深层特征上引入多头自注意力机制与可学习位置编码,通过残差连接与层归一化提升训练稳定性,增强对低对比度目标的全局建模。
- Attention Gate 解码器
- 解码阶段引入 Attention Gate,对编码器传递的浅层特征进行门控筛选,抑制背景噪声、突出目标区域,提高边界模糊区域的分割质量。
- 联合损失与评估
- Dice Loss 与 Cross-Entropy Loss 联合训练,Dice 系数与 IoU 双指标评估,配合早停机制降低过拟合风险。
数据处理流程
设计完整的灰度图像处理管线:灰度转 RGB、BGR 红色标注提取、mask 二值化、8:2 数据集划分、随机水平翻转与归一化,提高数据可用性与模型泛化。
指标与成果
在 8:2 数据划分 下:
- Dice 系数达到 85%+
- IoU 指标达到 80%+
优于传统 U-Net 基线,验证了 CNN 局部建模与 Transformer 全局建模结合在低对比度医学图像分割中的有效性。
与智医助手 / Agent 的关联
本模型是智医助手多模态诊断 Agent 中 视觉工具调用的算法基础:其推理被封装为确定性工具(输入影像 → 输出 mask 与定量指标),通过 Function Calling 接入诊断计划,支撑视盘 / 视杯分割、vCDR 定量等环节。
反思与后续
- 可引入更轻量的分割骨干,降低推理延迟以适配实时诊断。
- 探索把分割结果作为多模态 Decider 的结构化输入,而不仅仅是中间特征。
- 在更多模态(如 PET-CT)上验证泛化,对应已申请的淋巴瘤分割相关专利。