2026-06-25 · 🧠 模型← 本期
Qwen-AgentWorld: Language World Models for General Agents
如果你在做 agent,绕不开一个老问题:智能体要学会规划,就得先能预判「我这一步做下去,环境会变成什么样」。这正是「世界模型」(world model)干的事——给定当前的观察和一个动作,预测下一步的环境状态。它一直被当成推理和规划的核心认知机制,但过去更多出现在游戏、机器人仿真、视频生成这类场景里。通义团队这次发布的 Qwen-AgentWorld,把这套思路搬到了语言模型上,并称它是首个能模拟 agentic 环境的语言世界模型。
要理解它的定位,得先分清两种「世界模型」。一种是像素级或物理级的仿真器,预测的是图像帧或物理量;另一种是这里说的「语言世界模型」,它用语言模型来描述和预测环境的状态转移,靠的是长链思维推理(long chain-of-thought)一步步推演接下来会发生什么。对一个跨域的通用 agent 来说,环境往往本来就以文本形式呈现(工具返回、页面内容、系统状态),用语言模型直接建模这种状态转移,路径上更顺。
模型放出两档,命名是 MoE(混合专家)的写法:Qwen-AgentWorld-35B-A3B 和 Qwen-AgentWorld-397B-A17B。A3B、A17B 指的是每次推理实际激活的参数量约 3B 和 17B,远小于总参数(35B 和 397B),这是 MoE 用更少算力撑起更大容量的常见做法。两档分别面向算力受限和追求上限的场景。论文称这两个模型覆盖 7 个域,但具体是哪 7 个,原文摘要未逐一列出。
训练用了一套三段式流水线,每一步分工明确。CPT(持续预训练)从状态转移动态和增强后的专业语料里,先把通用的世界建模能力「灌」进模型;SFT(监督微调)负责激活「下一状态预测」这种推理形态,让模型学会按观察加动作去推下一步;RL(强化学习)则用一套定制框架、配上「评分准则 + 规则」的混合奖励(hybrid rubric-and-rule rewards),把模拟的保真度再磨高。支撑这套训练的是超过 1000 万条真实环境的交互轨迹,覆盖那 7 个域——数据规模和「来自真实环境」是这条值得看的地方。
为了评测语言世界模型这件还比较新的事,团队配套发布了 AgentWorldBench。它的构建方式是收集 5 个前沿模型在 9 个既有基准上的真实交互,再据此搭成一个评测集。换句话说,它衡量的是「模型对真实智能体行为下环境变化的预测有多准」,而不是直接刷某个任务分。论文给出的结论是 Qwen-AgentWorld 明显优于现有前沿模型,并且用它做 world-model 预热训练(warm-up)之后,下游 7 个 agentic 基准都有提升。
对不同技术栈的人,这条的意义不太一样。做 agent 和规划的,可以关注「用语言世界模型替代或补充专用环境仿真器」这条路是否走得通;做 RL 和环境工程的,更值得看的是它把真实交互轨迹喂进 CPT/SFT/RL 来提升模拟保真度的做法,以及 AgentWorldBench 这个评测视角本身。
诚实的保留也要说清楚。摘要里给的是「显著优于前沿模型」「下游 7 个基准都有提升」这类定性结论,但没有公开具体的分数、对比的对手名单和提升幅度,这些原文未给出,无法判断领先是大是小。是否开源权重、7 个域具体是哪些、AgentWorldBench 用的是哪 5 个模型和哪 9 个基准,目前的材料也没说明。再加上这是 arXiv v1 的首发,结论还需第三方未污染评测来印证。方向有意思,但量化结论暂时只能照原文转述、不宜过度解读。