论文 / Papers
论文地图
我阅读的论文记录
展示日期为笔记内嵌的本地阅读时间 · 已记录 2/132 篇 · 来源:本地知识库(Obsidian)
Qwen-AgentWorld: Language World Models for General Agents
通用大模型与Agent2026-07-01提出QwenAgentWorld语言世界模型,通过CPT、SFT及RL三阶段训练模拟多领域环境,在多项基准测试中显著优于通用大模型。
笔记:OB-论文/OBP_Qwen-AgentWorld Language World Models for General Agents.mdVibeThinker-3B: Exploring the Frontier of Verifiable Reasoning in Small Language Models
通用大模型与Agent2026-06-28报告介绍VibeThinker3B小模型,通过课程微调、多域强化学习及自蒸馏提升可验证推理能力,在多项基准测试中达到顶尖水平。
笔记:OB-论文/OBP_VibeThinker-3B Exploring the Frontier of Verifiable Reasonin.mdXiao et al 2025 A Comprehensive Survey of Large Language Models and Multimodal Large Language
数据集与评测2025本文综述了医学领域大型语言模型与多模态大模型的架构、数据集构建及评估方法,分析了临床应用挑战并展望未来发展方向。
笔记:RG-文献/P_(翻译)Xiao et al_2025_A Comprehensive Survey of Large Language.md基于多模态图像数据的多层次融合疾病诊断模型研究 彭鹏
多模态融合2024针对多模态数据融合难题,提出DFSDM与MmMlFM模型,结合特征选择、多层次融合及自适应决策策略,显著提升了皮肤病诊断准确率。
笔记:RG-文献/P_基于多模态图像数据的多层次融合疾病诊断模型研究_彭鹏.md基于人工智能的多模态融合诊断
多模态融合2024本文综述了人工智能在多模态数据融合下提升牙周炎精准诊断的进展,旨在突破传统主观评估局限并支持个性化治疗策略。
笔记:RG-文献/P_基于人工智能的多模态融合诊断.md基于知识增强与多模态融合的医疗视觉问答模型 张殿元
多模态融合2024提出一种融合知识图谱与多模态机制的医疗视觉问答模型,在VQARAD和PathVQA数据集上验证了其在开放域问答任务中的有效性。
笔记:RG-文献/P_基于知识增强与多模态融合的医疗视觉问答模型_张殿元.md面向深度学习的多模态融合技术研究综述 何俊
多模态融合2024本文综述了面向深度学习的多模态融合技术,分析了联合、协同及编解码器三种架构的优缺点,并探讨了多核学习等具体方法与未来研究方向。
笔记:RG-文献/P_面向深度学习的多模态融合技术研究综述_何俊.md缺失模态场景下,以数据为中心的鲁棒情感分析方法
多模态融合2024针对模态缺失场景下的多模态情感分析,提出以数据为中心的代理驱动鲁棒融合方法PRMF,通过高斯潜空间映射与动态注入提升模型在不确定缺失下的鲁棒性与性能。
笔记:RG-文献/P_缺失模态场景下,以数据为中心的鲁棒情感分析方法.md融合外部知识与证据的场景图注意力网络多模态谣言检测
多模态融合2024针对多模态谣言检测中跨模态关联难捕捉及深层语义不匹配问题,提出融合外部知识与证据的场景图注意力网络方法,在Weibo和Twitter数据集上显著提升了宏准确率与F1值。
笔记:RG-文献/P_融合外部知识与证据的场景图注意力网络多模态谣言检测.mdBSAFusion
多模态融合2024提出BSFAF策略解决未对齐医学图像融合难题,利用MDFFR减少模态差异并采用双向分步对齐实现特征融合与互补信息保留。
笔记:RG-文献/P_BSAFusion.mdLearning Collaborative Knowledge with Multimodal Representation for Polyp Re-Identification
多模态融合2024针对结肠息肉重识别中的域差距问题,提出DMCL多模态协同学习框架,通过动态特征融合提升模型泛化能力与检索性能。
笔记:RG-文献/P_2408.05914v2.mdMitigating Pervasive Modality Absence Through Multimodal Generalization and Refinement
多模态融合2024针对多模态大模型中普遍存在的模态缺失问题,提出MGR框架通过提炼泛化特征与图方法校准偏差,显著提升下游任务性能。
笔记:RG-文献/P_Mitigating Pervasive Modality Absence Through Multimodal Gen.mdOmniFuse: A general modality fusion framework for multi-modality learning on low-quality medical data
多模态融合2024针对低质量多模态医疗数据问题,提出OmniFuse框架解决模态缺失、信息失衡及噪声纠缠挑战,显著提升诊断精度与适用性。
笔记:RG-文献/P_OmniFuse A general modality fusion framework for multi-modal.mdTransMed
多模态融合2024针对医疗影像数据少且具长程依赖问题,提出结合CNN与Transformer的TransMed模型进行多模态分类
笔记:RG-文献/P_TransMed.mdA Primer on Reinforcement Learning in Medicine for Clinicians
强化学习(医学)2024本文面向临床医生介绍强化学习(RL)核心概念、在个性化治疗及重症监护中的应用潜力与整合挑战。
笔记:RG-文献/P_A Primer on Reinforcement Learning in Medicine for Clinician.mdFang 等。 - 2024 - Offline Inverse Constrained Reinforcement Learning
强化学习(医学)2024针对医疗离线强化学习中的安全决策问题,提出约束Transformer模型,利用因果注意力与非马尔可夫层捕捉关键状态及不安全行为,降低死亡率风险。
笔记:RG-文献/P_Fang 等。 - 2024 - Offline Inverse Constrained Reinforcement L.mdGemini
视觉语言2024介绍Gemini多模态模型家族在图文音视频理解及推理上的SOTA表现,阐述其训练策略、版本划分及应用部署方案。
笔记:RG-文献/P_Gemini.mdLearning Transferable Visual Models From Natural Language Supervision
视觉语言2024提出利用自然语言监督预训练视觉模型的方法,在海量图文对上实现零样本迁移,性能媲美专用基线且无需特定数据集微调。
笔记:RG-文献/P_Learning Transferable Visual Models From Natural Language Su.md2024.findings-acl.296
数据集与评测2024针对医疗视觉问答任务中模型能力不足的问题,提出MLeVLM多模态大语言模型,通过构建高质量指令数据集与特征对齐模块提升识别、诊断等层级能力并优于现有方法。
笔记:RG-文献/P_2024.findings-acl.296.mdLarge-scale Video Classification with Convolutional Neural Networks
数据集与评测2024该文在百万级视频数据集上评估CNN用于大规模动作分类的性能,提出多分辨率聚焦架构加速训练并验证了时空网络的有效性。
笔记:RG-文献/P_Large-scale Video Classification with Convolutional Neural N.md2410.07525
通用大模型与Agent2024针对医疗强化学习中的不安全决策问题,提出约束Transformer模型,利用因果注意力与非马尔可夫层优化策略,显著降低死亡率及危险行为概率。
笔记:RG-文献/P_2410.07525.mdAgent Harness Engineering
通用大模型与Agent2024本文综述了LLM智能体执行架构(Harness)工程化进展,提出七层分类法并映射开源项目,指出可靠性取决于基础设施而非模型本身。
笔记:RG-文献/P_Agent Harness Engineering.mdAgentClinic
通用大模型与Agent2024提出AgentClinic多模态基准评估LLM在模拟临床环境表现,发现序列决策显著降低诊断准确率且Claude3.5与Llama3工具使用能力突出
笔记:RG-文献/P_AgentClinic.mdBert
通用大模型与Agent2024提出BERT预训练模型,利用双向Transformer架构在海量无标注文本上联合左右上下文进行预训练,显著提升了多种NLP任务性能。
笔记:RG-文献/P_Bert.mdBetter & Faster Large Language Models via Multi-token Prediction
通用大模型与Agent2024提出多token预测架构提升LLM样本效率与推理速度,实验显示代码任务表现显著优于基线且无训练开销。
笔记:OB-论文/OBP_Better & Faster Large Language Models via Multi-token Predic.mdDeepSeek R1 translate
通用大模型与Agent2024该研究通过强化学习训练出DeepSeekR1Zero与R1模型,解决了可读性问题并实现推理能力涌现,性能对标OpenAIo11217且开源了多个蒸馏版本。
笔记:RG-文献/P_DeepSeek R1_translate_zh.mdDeepSeek V3 translate
通用大模型与Agent2024DeepSeekV3是混合专家架构大语言模型,采用多头潜在注意力及无辅助损失负载均衡策略,在14.8万亿token上预训练并实现高效推理与闭源模型相当性能
笔记:RG-文献/P_DeepSeek V3_translate_zh.mdDeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence
通用大模型与Agent2024DeepSeekV4系列通过混合注意力架构、超连接及Muon优化器实现百万级上下文高效处理,推理效率显著提升并刷新开源模型SOTA记录。
笔记:OB-论文/OBP_DeepSeek-V4 Towards Highly Efficient Million-Token Context I.mdGame-TARS: Pretrained Foundation Models for Scalable Generalist Multimodal Game Agents
通用大模型与Agent2024提出GameTARS多模态游戏智能体模型,通过统一动作空间与持续预训练提升泛化能力,在Minecraft等任务中表现优于现有SOTA及主流大模型。
笔记:RG-文献/P_Game-TARS Pretrained Foundation Models for Scalable Generali.mdGPT-4
通用大模型与Agent2024报告介绍了GPT4多模态大模型的开发与评估,其通过预训练与对齐优化在专业基准测试中表现优异并具备可靠的基础设施扩展性。
笔记:RG-文献/P_GPT-4.mdHY-World 2.0
通用大模型与Agent2024腾讯推出HYWorld 2.0多模态世界模型,通过全景生成、轨迹规划等四阶段方法,实现从文本或单图到可导航3D高保真场景的构建与模拟。
笔记:OB-论文/OBP_HY-World 2.0.mdPerceiver: General Perception with Iterative Attention
通用大模型与Agent2024提出Perceiver模型利用非对称注意力机制迭代蒸馏输入至潜在瓶颈,实现多模态大规模数据处理且性能优于专用模型
笔记:RG-文献/P_Perceiver General Perception with Iterative Attention.mdSelf-improving generative foundation model for synthetic medical image generation and clinical applications
通用大模型与Agent2024针对高质量医疗影像数据稀缺问题,提出MINIM统一生成模型,通过文本指令合成多器官、多模态图像以增强现有数据集并提升下游任务性能。
笔记:RG-文献/P_Self-improving generative foundation model for synthetic med.mdSkillOpt: Executive Strategy for Self-Evolving Agent Skills
通用大模型与Agent2024提出SkillOpt框架,将Agent技能视为外部状态进行文本空间优化,通过验证门控实现稳定可控的技能迭代与迁移。
笔记:OB-论文/OBP_SkillOpt Executive Strategy for Self-Evolving Agent Skills.mdViT
通用大模型与Agent2024提出将Transformer直接应用于图像块序列进行视觉识别的方法ViT,证明无需CNN即可在大规模预训练下达到优异效果且计算资源更少
笔记:RG-文献/P_ViT.mdWang 等 - 2024 - Self-improving generative foundation model for syn
通用大模型与Agent2024提出MINIM统一医学图像文本生成模型,利用扩散架构与强化学习实现自我改进,显著提升多模态医疗AI任务性能并辅助临床诊断。
笔记:RG-文献/P_(翻译)Wang 等 - 2024 - Self-improving generative foundation mod.md21835029-刘安岐-基于强化学习和临床知识的脓毒症诊疗方案推荐
医学视觉语言2024针对脓毒症抗生素滥用问题,提出融合临床知识的深度强化学习方案及多策略互补方法,显著改善患者预后并缩短用药时长。
笔记:RG-文献/P_21835029-刘安岐-基于强化学习和临床知识的脓毒症诊疗方案推荐.md2407.02483
医学视觉语言2024提出面向医疗领域的多模态智能体MMedAgent,通过指令微调使其能自主选择六大工具解决七类任务,性能优于GPT4o且更新高效。
笔记:RG-文献/P_2407.02483.md基于多模态医疗数据的肺部肿瘤预测方法研究 李腾飞
医学视觉语言2024研究针对肺癌多模态数据挑战,提出MClip、DMAM及CPathomic模型实现跨模态对齐与融合,显著提升了诊断预测性能。
笔记:RG-文献/P_基于多模态医疗数据的肺部肿瘤预测方法研究_李腾飞.md基于改进型多模态信息融合深...强化学习的自主超声扫描方法 徐加开
医学视觉语言2024针对深度强化学习自主超声扫描精度低、训练慢等问题,提出融合多模态感知与DSACPERDP算法的方法,显著提升了任务成功率与效率。
笔记:RG-文献/P_基于改进型多模态信息融合深...强化学习的自主超声扫描方法_徐加开.md知识提取-MedChain
医学视觉语言2024提出MedChain基准与Agent框架解决LLM在临床决策中的不足,通过个性化交互任务验证其优于现有方法并推动医疗AI应用
笔记:RG-文献/P_知识提取-MedChain.md知识提取-MoE-LLaVA
医学视觉语言2024提出MoETuning策略与MoELLaVA架构解决多模态稀疏学习性能退化问题,实现高效低成本的视觉语言模型训练与应用。
笔记:RG-文献/P_知识提取-MoE-LLaVA.mdA generalist medical language model for disease diagnosis assistance
医学视觉语言2024提出MedFound通用医疗大模型,通过思维链自引导与偏好对齐优化诊断推理,在八专科及罕见病场景下优于基线模型并具备临床辅助可行性。
笔记:RG-文献/P_A generalist medical language model for disease diagnosis as.mdA Genomic-Pathologic Annotated Risk Model to Predict Recurrence in Early-Stage Lung Adenocarcinoma
医学视觉语言2024研究构建PRecur模型整合基因组与病理特征预测早期肺腺癌复发风险,结果显示该模型优于传统TNM分期系统。
笔记:RG-文献/P_A Genomic-Pathologic Annotated Risk Model to Predict Recurre.mdA multi-modal fusion model with enhanced feature representation for chronic kidney disease progression prediction
医学视觉语言2024提出DeepOmixFLEX模型融合临床、组学及病理影像数据,通过增强特征表征提升慢性肾病进展预测性能。
笔记:RG-文献/P_A multi-modal fusion model with enhanced feature representat.mdA novel level set model initialized with guided filter for automated PET-CT image segmentation
医学视觉语言2024提出一种基于引导滤波融合PET与CT的主动轮廓模型,结合归一化项提升肺肿瘤分割精度,效果优于深度学习及独立数据方法。
笔记:RG-文献/P_A novel level set model initialized with guided filter for a.mdA review on multimodal medical image fusion: Compendious analysis of medical modalities, multimodal databases, fusion techniques and quality metrics
医学视觉语言2024本文综述了多模态医学影像融合技术,分析了常用数据库与质量指标,旨在解决单一模态诊断信息不足的问题并提升诊断准确性。
笔记:RG-文献/P_A review on multimodal medical image fusion Compendious anal.mdA transformer-based weakly supervised computational pathology method for clinical-grade diagnosis and molecular marker discovery of gliomas
医学视觉语言2024提出基于金字塔Transformer的弱监督模型ROAM,实现胶质瘤临床级诊断与分子标志物发现,准确捕捉病理特征。
笔记:RG-文献/P_A transformer-based weakly supervised computational patholog.mdAdapted large language models can outperform medical experts
医学视觉语言2024研究通过适配八种大语言模型处理四类临床摘要任务,发现其表现优于或等同于医疗专家,可减轻文书负担。
笔记:RG-文献/P_Adapted large language models can outperform medical experts.mdAdvancing Conversational Diagnostic AI with Multimodal Reasoning
医学视觉语言2024该研究提出AMIE系统利用Gemini模型实现多模态医疗数据推理与状态感知对话,在OSCE模拟中显示优于初级医生的诊断与管理能力。
笔记:RG-文献/P_Advancing Conversational Diagnostic AI with Multimodal Reaso.mdAutomated generation of chest X-ray imaging diagnostic reports by multimodal and multi granularity features fusion
医学视觉语言2024提出基于多模态粒度特征融合的模型生成胸片诊断报告,利用Swin Transformer与BioBERT提取图像及病史语义,改进损失函数提升效果。
笔记:RG-文献/P_Automated generation of chest X-ray imaging diagnostic repor.mdAutomated Spinal MRI Labelling from Reports Using a Large Language Model
医学视觉语言2024提出利用大语言模型从放射学报告中自动提取脊柱MRI标签的通用流程,在五种病理条件下验证有效且性能媲美GPT4.
笔记:RG-文献/P_Park 等。 - 2024 - Automated Spinal MRI Labelling from Reports.mdBiomedCLIP
医学视觉语言2024提出PMC15M数据集与BiomedCLIP多模态基础模型,在百万级图文对预训练下实现多项医疗影像任务SOTA性能并优于专用放射学模型
笔记:RG-文献/P_BiomedCLIP.mdBIOMEDIC A AnOpenBiomedical Image-Caption Archive, Dataset,
医学视觉语言2024针对生物医学多模态数据匮乏问题,构建了BIOMEDICA开源框架处理PubMed Central开放获取子集,生成超2400万图文对及预训练模型BMCCLIP,在多项任务中实现零样本分类性能提升。
笔记:RG-文献/P_BIOMEDIC_A AnOpenBiomedical Image-Caption Archive, Dataset,.mdClinical knowledge-guided deep reinforcement learning for sepsis antibiotic dosing recommendations
医学视觉语言2024提出结合临床知识的深度强化学习模型SAIDQN优化脓毒症抗生素方案,测试集显示79.07%患者预后良好且符合指南。
笔记:RG-文献/P_Clinical knowledge-guided deep reinforcement learning for se.mdDeAF: A multimodal deep learning framework for disease prediction
医学视觉语言2024提出DeAF框架解决多模态训练冲突,分两阶段对齐特征并融合影像与临床数据,提升疾病预测效果。
笔记:RG-文献/P_DeAF A multimodal deep learning framework for disease predic.mdDeep learning based multimodal biomedical data fusion: An overview and comparative review
医学视觉语言2024本文综述了基于深度学习的多模态生物医学数据融合方法,对比分析了不同层级的融合策略及大模型带来的挑战与机遇。
笔记:RG-文献/P_Deep learning based multimodal biomedical data fusion An ove.mdDeepOmix: A scalable and interpretable multi-omics deep learning framework and application in cancer survival analysis
医学视觉语言2024提出DeepOmix框架整合多组学数据预测癌症生存期,融合深度学习与先验知识,在低级别胶质瘤中验证了功能模块的预后价值。
笔记:RG-文献/P_DeepOmix A scalable and interpretable multi-omics deep learn.mdEvaluation and accurate diagnoses of pediatric diseases using artificial intelligence
医学视觉语言2024研究利用深度学习与NLP技术挖掘136万儿科就诊记录中的EHR数据,构建MLC模型辅助诊断多种儿童疾病,准确率媲美资深医师。
笔记:RG-文献/P_Evaluation and accurate diagnoses of pediatric diseases usin.mdGIT
医学视觉语言2024提出GIT模型统一视觉语言任务,简化架构为单图像编码器与文本解码器,在多项基准测试中超越人类表现并确立新SOTA。
笔记:RG-文献/P_GIT.mdHEALNet
医学视觉语言2024提出HEALNet多模态融合架构处理影像与组学数据,在TCGA癌症数据集上实现生存分析SOTA性能并鲁棒应对缺失模态
笔记:RG-文献/P_HEALNet.mdHET-RL: Multiple pulmonary disease diagnosis via hybrid efficient transformers based representation learning model using multi-modality data
医学视觉语言2024提出HETRL混合高效Transformer模型,融合影像与文本多模态数据及表征学习技术,显著提升肺部疾病诊断准确率12%至9%,优于单一图像或传统多模态方法。
笔记:RG-文献/P_HET-RL Multiple pulmonary disease diagnosis via hybrid effic.mdHuatuoGPT-o1 translate
医学视觉语言2024针对医学领域推理验证难的问题,提出基于可验证问题与验证器的两阶段方法(搜索微调+强化学习),构建了首个具备复杂推理能力的医疗LLM HuatuoGPTo1并超越基线模型。
笔记:RG-文献/P_HuatuoGPT-o1_translate_zh.mdHuatuoGPT-Vision translate
医学视觉语言2024针对医学视觉数据噪声问题,利用GPT4V无盲重构PubMed图文对构建130万样本数据集,训练出性能优于开源模型的HuatuoGPTVision多模态大模型。
笔记:RG-文献/P_HuatuoGPT-Vision_translate_zh.mdInsight: A Multi-Modal Diagnostic Pipeline using LLMs for Ocular Surface Disease Diagnosis
医学视觉语言2024针对眼表疾病诊断痛点,提出多模式管道MDPipe,利用视觉翻译器量化图像并整合临床元数据微调LLM,显著优于GPT4等现有标准。
笔记:RG-文献/P_Yeh 等 - 2024 - Insight A Multi-Modal Diagnostic Pipeline usi.mdLarge-scale long-tailed disease diagnosis on radiology images
医学视觉语言2024针对放射学影像诊断数据稀缺及模型专业化局限问题,提出支持多模态与解剖部位的RadDiag基础模型,利用公开高质量数据集实现95.14% AUC并具备零样本泛化能力。
笔记:RG-文献/P_Large-scale long-tailed disease diagnosis on radiology image.mdLearning a Diagnostic Strategy on Medical Data With Deep Reinforcement Learning
医学视觉语言2024针对医疗数据特征获取成本高的问题,提出基于深度强化学习的诊断策略学习框架,通过序列编码与特征选择实现少样本精准诊断。
笔记:RG-文献/P_Learning a Diagnostic Strategy on Medical Data With Deep Rei.mdLLMs for clinical risk prediction
医学视觉语言2024本研究对比了GPT4与Clinalytix Medical AI在谵妄风险预测上的表现,发现LLM存在识别缺陷且不宜独立决策,应作为辅助工具使用。
笔记:RG-文献/P_LLMs for clinical risk prediction.mdMed-Gemini
医学视觉语言2024该研究提出MedGemini多模态医疗大模型家族,结合网络搜索与自定义编码器,在多项医学基准测试中超越GPT4并达到SOTA水平。
笔记:RG-文献/P_Med-Gemini.mdMed-PMC
医学视觉语言2024提出MedPMC范式评估多模态大模型临床能力,发现现有模型在个性化患者模拟下存在信息收集不足与决策偏差问题。
笔记:RG-文献/P_Med-PMC.mdMed-R1
医学视觉语言2024提出MedR1框架利用强化学习提升多模态大模型在医疗影像中的推理泛化能力与可信度,显著超越基线及更大参数模型。
笔记:RG-文献/P_Med-R1.mdMedAgent-Pro-多模态诊断agent工作流
医学视觉语言2024提出MedAgentPro多模态诊断智能体工作流,通过层级化推理与检索增强生成实现循证医学诊断,优于主流VLMs及专家模型。
笔记:RG-文献/P_MedAgent-Pro-多模态诊断agent工作流.mdMedAgents
医学视觉语言2024提出MEDAGENTS框架,利用LLM代理进行角色扮演协作讨论以增强零样本医疗推理能力,在多个数据集上验证了其有效性。
笔记:RG-文献/P_MedAgents.mdMedChain
医学视觉语言2024针对LLM在真实临床决策中表现不足的问题,提出MedChain数据集及集成反馈机制的Agent系统,显著提升了动态信息获取与序列任务处理能力。
笔记:RG-文献/P_MedChain.mdMedClip
医学视觉语言2024针对医疗数据稀缺及假负样本问题,提出MedCLIP框架解耦图文对比学习并引入医学知识损失函数,实现小样本下优于SOTA的零样本预测与检索性能。
笔记:RG-文献/P_MedClip.mdMedical MLLM Is Vulnerable: Cross-Modality Jailbreak and Mismatched Attacks on Medical Multimodal Large Language Models
医学视觉语言2024研究揭示医疗多模态大模型存在跨模态越狱与不匹配攻击漏洞,提出MCM优化方法提升攻击成功率,警示需加强临床环境下的安全防御措施。
笔记:RG-文献/P_Medical MLLM Is Vulnerable Cross-Modality Jailbreak and Mism.mdMedical Multimodal Foundation Models in Clinical
医学视觉语言2024本文综述了医疗多模态基础模型在临床诊断与治疗中的应用、挑战及未来方向,分析了数据集与架构进展并展望其推动精准医学的前景。
笔记:RG-文献/P_Medical Multimodal Foundation Models in Clinical.mdMedXIAOHE: A Comprehensive Recipe for Building Medical MLLMs
医学视觉语言2024提出MedXIAOHE医疗多模态大模型,通过实体感知持续预训练与强化学习提升推理能力,在多项基准测试中超越开源及闭源系统。
笔记:RG-文献/P_MedXIAOHE A Comprehensive Recipe for Building Medical MLLMs.mdMerlin: a computed tomography vision–language foundation model and dataset
医学视觉语言2024提出Merlin三维CT视觉语言基础模型及数据集,利用多阶段预训练无需额外标注,在诊断、预后等任务上超越现有二维模型并缓解放射科医生负担。
笔记:RG-文献/P_Merlin a computed tomography vision–language foundation mode.mdMMedAgent: Learning to Use Medical Tools with Multi-modal Agent
医学视觉语言2024提出专为医疗领域设计的多模态智能体MMedAgent,通过指令微调数据集使其能自主选择六大工具解决七类任务,性能优于开源及GPT4o模型。
笔记:RG-文献/P_Li 等 - MMedAgent Learning to Use Medical Tools with Mult.mdMoE-LLaVA: Mixture of Experts for Large Vision-Language Models
医学视觉语言2024该文提出MoETuning策略构建稀疏多模态大模型MoELLaVA,仅激活Topk专家以降低成本,在视觉理解及幻觉基准上表现优异甚至超越更大规模模型。
笔记:RG-文献/P_MoE-LLaVA Mixture of Experts for Large Vision-Language Model.mdMultimodal AI predicts clinical outcomes of drug
医学视觉语言2024提出MADRIGAL多模态AI模型,融合结构、通路及转录组数据预测药物组合疗效与毒性,支持癌症精准治疗及新药筛选。
笔记:RG-文献/P_Multimodal AI predicts clinical outcomes of drug.mdMultimodal generative AI for medical image interpretation
医学视觉语言2024该文综述了多模态生成式AI在医学影像报告生成领域的进展与挑战,主张建立赋能临床的新型部署范式以辅助诊疗。
笔记:RG-文献/P_Multimodal generative AI for medical image interpretation.mdmultiPI-TransBTS: A multi-path learning framework for brain tumor image segmentation based on multi-physical information
医学视觉语言2024提出multiPITransBTS框架融合多物理信息与Transformer架构,在BraTS数据集上显著提升了脑肿瘤分割精度与鲁棒性。
笔记:RG-文献/P_multiPI-TransBTS A multi-path learning framework for brain t.mdPixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
医学视觉语言2024提出PixCLIP框架,通过自动标注构建长文本数据集并替换LLM编码器,实现任意粒度像素与文本对齐,在细粒度任务上超越SOTA且保留全局能力。
笔记:RG-文献/P_PixCLIP Achieving Fine-grained Visual Language Understanding.mdPriorRG: Prior-Guided Contrastive Pre-training and Coarse-to-Fine Decoding for Chest X-ray Report Generation
医学视觉语言2024提出PriorRG框架利用患者特定先验知识生成胸部X光报告,通过两阶段训练提升临床准确性与流畅度。
笔记:RG-文献/P_PriorRG Prior-Guided Contrastive Pre-training and Coarse-to-.mdPrompting Large Language Models for Supporting the Differential Diagnosis of Anemia
医学视觉语言2024研究利用GPT4等LLM及高级提示技术构建贫血鉴别诊断路径,实验表明其在临床决策支持中表现最佳且具潜力。
笔记:RG-文献/P_2409.15377v1.mdReinforcement Learning in Medical Diagnosis: An Overview
医学视觉语言2024本文综述了强化学习在医疗诊断中的应用,利用马尔可夫决策框架解决慢性病诊疗问题,结论认为其能构建动态治疗制度并辅助影像分析。
笔记:RG-文献/P_Reinforcement Learning in Medical Diagnosis An Overview.mdSmartCLIP: Modular Vision-language Alignment with Identification Guarantees
医学视觉语言2024针对CLIP模型在图文对齐中的信息错位与表征纠缠问题,提出SmartCLIP框架实现模块化灵活对齐,确保细粒度概念解耦并提升下游任务泛化能力。
笔记:RG-文献/P_SmartCLIP Modular Vision-language Alignment with Identificat.mdTeach Multimodal LLMs to Comprehend Electrocardiographic Images
医学视觉语言2024针对ECG图像解释挑战,构建百万级指令微调数据集与评估基准,提出专用MLLM模型PULSE,性能显著优于通用大模型。
笔记:RG-文献/P_2410.19008v1.mdTowards accurate differential diagnosis with large language models
医学视觉语言2024研究提出AMIE大语言模型辅助鉴别诊断,对比发现其独立性能优于医生且能提升临床决策质量与全面性。
笔记:RG-文献/P_Towards accurate differential diagnosis with large language.mdTransformer enabled multi-modal medical diagnosis for tuberculosis classification
医学视觉语言2024该研究提出基于交叉模态Transformer的融合方法,将医学影像与临床数据转化为统一表征,在肺结核分类任务中性能优于现有方法且分析速度更快。
笔记:RG-文献/P_Transformer enabled multi-modal medical diagnosis for tuberc.mdTxAgent: An AI Agent for Therapeutic Reasoning Across a Universe of Tools
医学视觉语言2024提出TXAgent智能体,利用多步推理与工具调用进行药物相互作用分析,在多项基准测试中超越现有大模型。
笔记:RG-文献/P_2503.10970v1.mdUniMedVL
医学视觉语言2024提出基于观察 知识 分析范式的UniMedVL统一多模态模型,实现医疗影像理解与生成的双向增强及性能提升
笔记:RG-文献/P_UniMedVL.mdXrayGPT: Chest Radiographs Summarization using Large Medical Vision-Language Models
医学视觉语言2024XrayGPT利用医学视觉编码器与微调LLM构建会话式VLM模型,生成高质量胸片摘要并回答开放式问题,经医生评估超70%回复科学准确。
笔记:RG-文献/P_(Deelp翻译)XrayGPT_ Chest Radiographs Summarization using Larg.mdZero-Shot Clinical Trial Patient Matching with Large Language Models
医学视觉语言2024提出零样本大语言模型系统匹配临床试验患者,通过两阶段检索优化效率与可解释性,在基准测试中达到最先进性能并大幅降低成本。
笔记:RG-文献/P_2402.05125v3.mdZhang et al 2024 BiomedGPT-1-18
医学视觉语言2024本文提出开源轻量级视觉语言基础模型BiomedGPT,通过多样化数据训练实现多模态任务处理,在多项生物医学实验中取得最先进结果并简化部署。
笔记:RG-文献/P_(翻译)Zhang et al_2024_BiomedGPT-1-18.mdZhang et al 2024 BiomedGPT-19-33
医学视觉语言2024提出BiomedGPT多模态大模型架构,统一处理文本与医学影像数据,通过消融实验验证了其在跨域迁移及任务全面性上的优势。
笔记:RG-文献/P_(翻译)Zhang et al_2024_BiomedGPT-19-33.mdZhang et al 2024 BiomedGPT-34-57
医学视觉语言2024BiomedGPT提出了一种多模态大模型架构,通过预训练与微调整合医学影像与文本数据,在图像分类等下游任务中展现出优于MedPaLM M的性能并提升了推理速度。
笔记:RG-文献/P_Zhang et al_2024_BiomedGPT-34-57.mdZhu et al 2024 Medical SAM 2
医学视觉语言2024提出MedSAM2模型,将医学影像视作视频处理以支持三维分割与单提示泛化能力,在多种模态下性能优于现有方法并具良好通用性。
笔记:RG-文献/P_Zhu et al_2024_Medical SAM 2.md(高效率多模态融合)Efficient Quantification of Multimodal Interaction at Sample Level
医学影像与分割2024提出基于点信息论的轻量级样本级多模态交互估计器LSMI,量化冗余与协同性,实现细粒度动态分析与模型优化应用
笔记:RG-文献/P_(高效率多模态融合)Efficient Quantification of Multimodal Interaction.md3DConvCaps
医学影像与分割2024提出结合卷积层与胶囊层的3D编码器解码器网络,解决CNN对形变敏感及丢失空间信息问题,在多个数据集上优于现有方法。
笔记:RG-文献/P_3DConvCaps.md3DUnet
医学影像与分割2024提出一种基于稀疏标注的三维体素分割网络,将二维操作扩展至三维并引入弹性形变增强,实现半自动或全自动的高效医学影像分割。
笔记:RG-文献/P_3DUnet.md分割论文综述
医学影像与分割2024综述了工业图像分割中深度学习模型的应用现状,涵盖传统算法、深度学习方法及融合策略,分析了监督与无监督框架并探讨未来挑战。
笔记:RG-文献/P_分割论文综述.md基于多模态深度强化学习的端到端无人车运动规划 丁开源
医学影像与分割2024提出TransProAct多模态Transformer融合模型结合本体感知与视觉输入,利用PPO算法解决无人车在复杂地形下的运动规划问题并提升泛化性。
笔记:RG-文献/P_基于多模态深度强化学习的端到端无人车运动规划_丁开源.md基于计算智能的肺癌诊断和分类技术在胸部CT扫描图像中的应用:一项综合综述
医学影像与分割2024该综述系统梳理了基于计算智能的肺癌CT诊断技术,涵盖机器学习、深度学习及混合模型,指出深度学习方法在分类准确率上表现最优且应用最广泛。
笔记:RG-文献/P_基于计算智能的肺癌诊断和分类技术在胸部CT扫描图像中的应用:一项综合综述.md基于深度强化学习的多模态医学图像配准
医学影像与分割2024针对传统图像配准依赖人工设计的缺陷,提出基于深度强化学习的端到端方法,通过策略网络与价值网络实现自动学习特征表示及相似性测度,显著降低目标配准误差并提升大形变处理能力。
笔记:RG-文献/P_基于深度强化学习的多模态医学图像配准.md结合ResNet和Transformer 的MST框架,用于3D医学图像诊断
医学影像与分割2024提出结合ResNet与Transformer的MST框架,将DINOv2扩展至3D医学影像,在乳腺、胸部及膝关节数据集中诊断性能优于传统卷积网络且可解释性更强
笔记:RG-文献/P_结合ResNet和Transformer 的MST框架,用于3D医学图像诊断.mdA deep learning system for predicting time to progression of diabetic retinopathy
医学影像与分割2024该研究开发并验证了DeepDR Plus深度学习系统,仅凭眼底图像预测糖尿病患者视网膜病变进展时间,实现个性化筛查间隔优化。
笔记:RG-文献/P_A deep learning system for predicting time to progression of.mdA transformer-based representation-learning model with unified processing of multimodal input for clinical diagnostics
医学影像与分割2024提出一种基于Transformer的统一多模态表征学习模型,融合影像与文本数据辅助临床诊断,在肺病识别及预后预测上显著优于单模态或分离式多模态方法。
笔记:RG-文献/P_A transformer-based representation-learning model with unifi.mdAccurate classification of pulmonary nodules by a combined model of clinical, imaging, and cell-free DNA methylation biomarkers: a model development and externa
医学影像与分割2024研究构建结合临床、影像及cfDNA甲基化标志物的PulmoSeek Plus模型,在外部验证中显著提升了肺结节良恶性分类的AUC性能。
笔记:RG-文献/P_Accurate classification of pulmonary nodules by a combined m.mdClassification of lymphoma subtypes in PET/CT images based on a bidirectional feature fusion method
医学影像与分割2024针对PET/CT淋巴瘤分型难题,提出双向特征融合模型,结合深度学习与机器学习显式特征及通道压缩方法提升分类精度。
笔记:RG-文献/P_Classification of lymphoma subtypes in PET CT images based o.mdLLM-driven Multimodal Target Volume Contouring in Radiation Oncology
医学影像与分割2024提出LLMSeg多模态AI模型,结合临床文本与影像信息解决放疗靶区勾画难题,在乳腺癌外验证中表现优于传统单模态模型且具数据高效性。
笔记:RG-文献/P_(参考)2311.01908v4.mdLung-EffNet: Lung cancer classification using EfficientNet from CT-scan images
医学影像与分割2024提出基于EfficientNet的LungEffNet模型用于CT肺癌分类,经数据增强处理不平衡问题,在测试集上准确率达99.1%且优于其他CNN架构。
笔记:RG-文献/P_Lung-EffNet Lung cancer classification using EfficientNet fr.mdMamba Linear-Time Sequence Modeling with Selective State Spaces
医学影像与分割2024提出Mamba架构利用选择性状态空间模型实现线性时间序列建模,在语言、音频及基因组等多模态任务上性能超越同等规模Transformer。
笔记:RG-文献/P_Mamba_Linear-Time Sequence Modeling with Selective State Spa.mdMedical Slice Transformer
医学影像与分割2024提出Medical Slice Transformer框架将DINOv2扩展至三维医学影像分析,在乳腺、胸部及膝关节数据集上验证了其优于ResNet的诊断性能与可解释性。
笔记:RG-文献/P_Medical Slice Transformer.mdMultimodal mixing convolutional neural network and transformer for Alzheimer’s disease recognition
医学影像与分割2024提出MMDF模型融合MRI影像与临床记录数据,结合ViT和MA1DCNN骨干网络提升阿尔茨海默病识别性能
笔记:RG-文献/P_Multimodal mixing convolutional neural network and transform.mdTransUnet
医学影像与分割2024提出TransUNet架构,结合CNN与Transformer优势解决长程依赖问题,在多种医学影像分割任务中表现优于现有方法。
笔记:RG-文献/P_TransUnet.md多模态模型的综述的全文翻译
综述全景2024本文系统综述了多模态大语言模型(MLLM)的评价方法、任务分类及基准测试现状,指出评估是推进该领域发展的关键学科。
笔记:RG-文献/P_多模态模型的综述的全文翻译.md多模态人工智能大模型综述及展望 丁培耕
综述全景2024本文综述了多模态大模型的技术架构、发展历程及代表性算法,指出其通过多模态对齐显著提升了通用人工智能性能。
笔记:RG-文献/P_多模态人工智能大模型综述及展望_丁培耕.md多模态数据融合研究综述 张虎成
综述全景2024综述多模态数据融合技术现状,分析联合、协同等四种融合方法及显隐式对齐策略优缺点,展望其在医疗等领域应用挑战与方向。
笔记:RG-文献/P_多模态数据融合研究综述_张虎成.mdA Comprehensive Survey of Large Language Models and Multimodal Large Language Models in Medicine
综述全景2024本文综述了大语言模型与多模态大模型在医学领域的发展、原理及应用场景,分析了其优势与挑战并展望未来方向。
笔记:RG-文献/P_A Comprehensive Survey of Large Language Models and Multimod.mdAI-powered integration of multimodal imaging in precision medicine for neuropsychiatric disorders
综述全景2024综述了AI与多模态神经影像融合技术如何助力精神心理疾病的早期诊断、精准干预及个性化治疗策略制定。
笔记:RG-文献/P_AI-powered integration of multimodal imaging in precision me.mdASurvey on Multimodal Large Language Models
综述全景2024本文综述了多模态大模型(MLLM)的架构、训练策略及评估方法,探讨了其在细粒度与多场景下的扩展性及幻觉抑制技术。
笔记:RG-文献/P_ASurvey on Multimodal Large Language Models.mdLLM Survey Chinese
综述全景2024本文综述了大语言模型从统计到神经再到预训练的发展历史,重点分析了LLM的涌现能力、适配微调及对齐等关键技术方向与未来挑战。
笔记:RG-文献/P_LLM_Survey_Chinese.mdLLM增强RL综述
综述全景2024本文综述了大语言模型增强强化学习的概念、分类与方法,提出四角色框架以明确研究范畴并指明未来方向。
笔记:RG-文献/P_LLM增强RL综述.mdReview of multimodal machine learning approaches in healthcare
综述全景2024本文综述了医疗领域多模态机器学习方法,涵盖影像、文本及表格数据融合策略,指出效果取决于具体任务与数据特性。
笔记:RG-文献/P_Review of multimodal machine learning approaches in healthca.mdSurvey on Large Language Model-Enhanced Reinforcement Learning: Concept, Taxonomy, and Methods
综述全景2024本文综述了大型语言模型增强强化学习的最新进展,提出结构化分类法将LLM分为信息处理器等四类角色,并分析了其应用与挑战。
笔记:RG-文献/P_(翻译)2404.00282v3.mdChat-Doctor(Yunxiang et al. 2023)的数据集
医学视觉语言2023该研究基于LLaMA模型微调出ChatDoctor医疗聊天机器人,利用10万条真实医患对话及检索增强技术,显著提升了医学问答的准确性与可靠性。
笔记:RG-文献/P_(翻译)Chat-Doctor(Yunxiang et al. 2023)的数据集.mdYang et al 2023 MedMNIST -- A large-scale lightweight benchmark for 2D and 3D biomedical
医学视觉语言2023提出MedMNIST v2基准数据集,包含18种标准化生物医学影像(70万张),支持轻量级模型在多样任务上的公平评估与泛化性研究。
笔记:RG-文献/P_Yang et al_2023_MedMNIST v2 -- A large-scale lightweight ben.mdKirillov 等 - 2023 - Segment Anything
医学影像与分割2023提出Segment Anything项目,构建包含1亿掩膜的SA1B数据集与SAM模型,实现零样本图像分割任务迁移。
笔记:RG-文献/P_Kirillov 等 - 2023 - Segment Anything.md提出SentenceBERT模型,利用孪生和三元组网络结构生成句子嵌入,将语义相似度检索耗时从BERT的65小时降至约5秒且保持精度。
arXiv:1908.10084
没有匹配的论文。