Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

Ai2/UW TMax: 开源 RL 终端 agent 配方与 Qwen3.5-9B 终端 agent

如果你在做 coding agent 或任何要在命令行里自动干活的系统,这条值得停下来看。Ai2 和华盛顿大学放出的 TMax 不是又一个只给你 API 的终端工具,而是一整套开源的强化学习配方,外加一个能直接下载的 9B 终端 agent。所谓终端 agent,就是模型不再只是吐文本,而是真的在 shell 里敲命令、跑测试、读报错、迭代修改,直到把一个工程任务做完——这正是当下 agent 落地最吃力、也最值钱的能力之一。 终端任务难训,难在它是多步、长程、且每一步都有真实副作用的环境:一条命令敲错可能污染后续所有状态,奖励信号又往往只在最后才出现。这类问题靠监督微调很难学透,强化学习是更自然的路子,但RL 在这种环境下的配方一直零散且大多锁在闭源团队手里。TMax 想补的就是这个公开空白。 方法上,TMax 用的是 DPPO 来训练策略。训练数据来自 OpenThoughts 的 TMax-15k,其中包含 14600 个可交互的强化学习环境——也就是说模型不是在静态数据上学,而是在上万个可反复试错的终端场景里摸爬滚打。基座是 Qwen3.5 系列的 9B 稠密模型,规模刻意压在小档位,这让结果对算力有限的团队更有参考价值。 结果是这套配方的说服力所在。TMax-9B 在 Terminal Bench 2.0 上拿到 27.2%,作者称这是 10B 参数以下最强的开源权重终端 agent,并且已经逼近闭源的 Claude Haiku 4.5(29.8%)——一个不到十亿量级、可本地部署的开源模型能贴近一个商用闭源模型,这个差距值得注意。在更轻量的 Terminal Bench Lite 子集上,TMax-9B 达到 53.0%,在作者自己做的一系列 TMax 消融配置里领跑。 真正区别于多数发布的,是它的开放程度。Ai2 不止开了模型权重,还把训练数据、甚至一次训练全过程的 RL rollout 都放了出来。对想自己复现或改进终端 agent RL 的研究者,能拿到别人训练时产生的原始轨迹是稀缺资源——它把"配方"从一句口号变成了可审阅、可复跑的东西。配套的 paper、博客、GitHub 和 HuggingFace 资源也都公开。 诚实地看几点保留:27.2% 这个绝对数字说明终端 agent 整体仍处早期,能稳定做完的任务比例还不高,离 Claude Haiku 4.5 仍有约 2.6 个百分点的差距,且对方是更通用的闭源模型。Terminal Bench Lite 上 53.0% 的领先是相对作者自己的消融而言,跨家族的横向对比原文未给出。另外 Terminal Bench 2.0 与 Lite 的具体题量和评测细节这里也没有展开。即便如此,对想把 coding/终端 agent 跑在自己机器上、又想看清 RL 配方每一环节的团队,这是近期少有的把权重、数据和训练过程一并摊开的实在参考。
相关