Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

Darwin Mobile Agent: A Roadmap for Self-Evolution

如果你在做手机端 GUI agent,或者更广义地想用真实环境而非合成数据训强化学习策略,这条值得看。它戳的是一个所有人都绕不过去的工程痛点:真机交互的数据采集太慢。一台云手机一次跑一条轨迹,要凑够 RL 需要的海量交互数据,时间和成本都扛不住。Darwin Mobile Agent 把这件事当成基础设施问题来解,而不是又出一个刷榜模型。 它的出发点是"苦涩的教训"(the Bitter Lesson)这套思路:与其往系统里塞人类设计的规则和先验,不如让 agent 在一个比它自身复杂得多的环境里大量交互,让能力自己长出来。作者把移动 GUI 选作这个"大世界"(Big World)的实际代理——手机界面状态空间足够大、足够开放,又有现成的可交互载体,比纯仿真环境更贴近真实。 工程上的核心是异步 agent-环境回路,跑在多个并行的云手机实例上。要点在"异步"和"并行"两个词:传统同步采样里,agent 发一个动作、等环境返回、再发下一个,单实例串行,吞吐量被环境延迟卡死;改成跨多实例的异步回路后,多台云手机同时产数据、互不阻塞,把采样吞吐量拉上来,这才让真机环境下的大规模 RL 在算力账上说得通。这是整套基础设施要解的第一性问题。 在方法蓝图层面,作者提出一份分阶段路线图,目标是从自演化 agent 的三根支柱上逐步移除人工先验。第一根是任务课程(task curricula):训练任务该学什么、按什么顺序学,目前多靠人工编排,路线图希望让它自动生成。第二根是结果验证(outcome verification):怎么判断一条轨迹算成功,这步通常依赖人写的奖励或人工标注。第三根是记忆管理(memory management):agent 跨任务怎么存取经验。三者都是当前 agent 系统里塞满人类设计的地方,论文把"去先验"当成统一目标贯穿这三块。 需要说清楚的是,这篇本期只验证了路线图的第一阶段,也就是 GUI 域内的策略优化(policy optimisation)——证明这套基础设施在做策略优化时具备足够的稳定性与可扩展性。后两个阶段(自动化的任务课程、结果验证)还停留在概念路线图,没有落地实验。 诚实的保留也在这里:这更像一份工程基座加方法蓝图,而不是一篇拿数字说话的结果论文。原文没有给出任务成功率、基准得分这类量化指标,所以它"比基线强多少"无从判断。对想自己搭真机 RL 训练管线的团队,开源这套异步云手机基础设施是最直接的价值;至于"去除人类先验、走向自演化"这个更大的主张,目前只兑现了第一步,剩下的要等后续工作。
相关