Qwen-AgentWorld:面向通用智能体的语言世界模型
Qwen-AgentWorld 用 CPT+SFT+RL 三阶段训练语言世界模型,模拟七类环境动态,在 Agent 基准上最高提升 12.3%,提出世界建模与代理统一/解耦两条路径。
分类 / CATEGORY
基于本地 Obsidian 知识库的真实笔记,含方法、结论与个人落地思考;不收录未读或杜撰的来源。
共 10 篇文章
从这里开始 / Selected
Qwen-AgentWorld 用 CPT+SFT+RL 三阶段训练语言世界模型,模拟七类环境动态,在 Agent 基准上最高提升 12.3%,提出世界建模与代理统一/解耦两条路径。
Qwen-AgentWorld 用 CPT+SFT+RL 三阶段训练语言世界模型,模拟七类环境动态,在 Agent 基准上最高提升 12.3%,提出世界建模与代理统一/解耦两条路径。
PriorRG 利用患者特定先验知识生成胸部 X 光报告,通过两阶段训练(先验引导对比预训练 + 粗到细解码)提升临床准确性与流畅度,在 MIMIC-CXR 上显著优于现有方法。
Google 提出的纯注意力机制架构,彻底抛弃 RNN/CNN 的序列建模范式,在机器翻译任务上取得 SOTA 并开启了后续大模型时代的基础架构。
OpenAI 提出的对比语言-图像预训练方法,在 4 亿图文对上训练后实现零样本视觉识别,在 30+ 数据集上媲美甚至超越专用监督模型。
提出基于 Transformer 的统一多模态表征学习模型,将影像与文本融入同一架构,在肺病识别与预后预测上分别比单模态和分离式方法高出 12% 和 9%。
Xiao 等综述梳理医学大模型从监督学习到多模态融合的范式演进、数据集与评估体系,并指出数据隐私与幻觉是临床落地的主要障碍。
综述将 LLM 在强化学习中的角色分为信息处理器、奖励设计者、决策者与生成器四类,并讨论样本效率与奖励设计的挑战及机器人/自动驾驶前景。
MedSAM-2 沿用 SAM 2 的视频处理哲学,将 2D 切片视作视频帧,实现三维体积的单提示分割与跨时间泛化,在多模态医学影像上优于现有方法。
MMedAgent 是首个面向医疗领域的多模态 Agent,通过指令微调自主选择六大工具解决七类任务,性能优于 GPT-4o 且更新成本极低。
XrayGPT 冻结医学视觉编码器、线性对齐微调 LLM,构建会话式胸片摘要与问答模型,医生评估超 70% 回复科学准确。