论文精读

Qwen-AgentWorld:面向通用智能体的语言世界模型

Qwen-AgentWorld 用 CPT+SFT+RL 三阶段训练语言世界模型,模拟七类环境动态,在 Agent 基准上最高提升 12.3%,提出世界建模与代理统一/解耦两条路径。

· 约 2 分钟阅读

Qwen-AgentWorld:面向通用智能体的语言世界模型

智能体不能只学“策略”,还得懂“环境怎么变”。Qwen-AgentWorld 把这件事做成了可训练的语言世界模型。

研究问题

通用智能体(General Agents)普遍缺一个核心认知机制:对环境动态的预测。现有大模型代理只盯着“下一步动作”,忽视状态转移规律。本文构建基于语言模型的“世界模型”(Language World Model, LWM),让模型能模拟多领域环境。

方法要点

  1. 双版本 LWM:35B-A3B 与 397B-A17B,覆盖工具、终端、搜索等七个领域,用超千万条真实环境交互轨迹训练。
  2. 三阶段训练:持续预训练注入状态转移动力学 → 监督微调激活“下一状态预测”推理链 → 混合评分与规则奖励的 RL 提升模拟保真度。
  3. 两条应用路径:解耦模式(世界模型当独立模拟器,给代理做可扩展仿真,对不可逆操作/私有部署更稳);统一模式(作高效预热,迁移到各类代理基准)。

结果

AgentWorldBench 上,Qwen-AgentWorld 显著优于前沿模型,Claw-Eval、Terminal-Bench 等任务最高提升 12.3% 与 9.0%。验证了“预测即行动”的必要性。

落点

  • 解耦仿真对“不可逆操作”的稳健性,正好对应 智医助手 里诊疗动作的沙箱预演——先在世界模型里推一遍,再落到真实流程。
  • 其长链思维推理模式,对淋巴瘤等复杂疾病在低资源条件下的诊断决策泛化有直接参考价值。

本文整理自本地知识库论文笔记(OB-004 Qwen-AgentWorld),更多 Agent 方向论文见 本地知识库

继续阅读