01共同第一作者 · arXiv 2026 · 已开源

MobileForge

MobileForge: Annotation-Free Adaptation for Mobile GUI Agents with Hierarchical Feedback-Guided Policy Optimization

让 Agent 在真实目标应用中自己探索、生成任务、获得层级反馈,并把失败经验转化为可训练的策略更新。

67.2%Qwen3-VL-8B · AndroidWorld Pass@355.2% → 67.2%
77.6%ForgeOwl-8B · AndroidWorld Pass@369.0% → 77.6%
41.0%ForgeOwl-8B · MobileWorld SR37.6% → 41.0%

Research overview

这项工作解决什么问题?

移动应用数量多、变化快,依赖人工编写任务、专家轨迹和奖励标签的适配方式成本高;已有无标注学习又常把任务生成、真实交互、评测反馈和策略优化割裂开,粗粒度结果也难以直接用于稳定训练。

论文贡献
  • MobileGym:把目标应用探索、课程任务挖掘、Rollout 执行和层级评测统一到真实交互环境中。
  • HiFPO:把任务结果、步骤级过程反馈和纠错提示整理为 Hint-contextualized Step-level GRPO 更新。
  • 仅使用自动生成的无标注数据,在域内 AndroidWorld 和域外 MobileWorld 上同时验证适配与迁移能力。
我的工作
  • 共同完成整体方案设计和核心实现,参与打通应用探索、任务生成、多轮尝试、反馈评估与后训练闭环。
  • 重点构建交互采样与评测流程,把任务级、步骤级反馈及失败提示整理为 Step-level GRPO 训练数据。
  • 基于 VeRL 完成策略优化和实验分析,聚焦无专家轨迹下的反馈细化与失败经验复用。
01Motivation

现有适配方法缺少真正的无标注闭环

教师轨迹依赖强模型与外部监督;稀疏奖励又只能给出轨迹级信号。MobileForge 的目标是在目标应用真实交互中同时获得任务、反馈和策略更新。

MobileForge 与既有适配方法对比
MobileForge 与知识增强、教师合成训练和稀疏奖励 Rollout 的对比。查看高清原图 ↗
既有方案

依赖强教师、专家轨迹或外部奖励标注,难以持续覆盖快速变化的新应用。

MobileForge

在目标应用中自动探索、挖掘任务、执行 Rollout、获得层级反馈并更新策略。

02Framework

MobileGym 负责生成经验,HiFPO 负责把经验变成能力

MobileForge 总体框架
MobileForge 总体框架:真实目标应用中的任务与反馈闭环。查看高清原图 ↗
MobileGym 框架
MobileGym:目标应用探索、课程任务挖掘、Rollout 与层级评测。查看高清原图 ↗
HiFPO 流程
HiFPO:多轮提示复用、任务/步骤筛选和 Step-level GRPO。查看高清原图 ↗
A

Target-app Exploration

在真实应用中探索可达界面与交互轨迹,为任务生成提供应用内证据。

B

MobileGym-Curriculum

基于探索轨迹挖掘可执行课程任务,避免任务脱离目标应用。

C

Hierarchical Evaluation

同时产生最终结果、步骤过程质量和纠错提示三层反馈。

D

HiFPO

复用前序尝试的提示,筛选有效步骤并执行 Step-level GRPO。

03Main results

无标注生成的数据可以训练出更强策略

MobileForge 同时提升通用基座模型和 GUI 专用模型,并在域外 MobileWorld 保持收益。

MobileForge 主实验结果
数据规模、域内适配与域外泛化的主要结果。查看高清原图 ↗
实验设置基线本文方法结论
AndroidWorld / Qwen3-VL-8B55.2% Pass@367.2% Pass@3+12.0 pct
AndroidWorld / GUI-Owl-1.5-8B69.0% Pass@377.6% Pass@3+8.6 pct
MobileWorld GUI-Only / ForgeOwl-8B37.6% SR41.0% SR域外迁移
900-task / Hard tasks19.3% Pass@129.8% Pass@1+54.4% relative
04Ablations

真正驱动提升的是细粒度反馈、正确筛选与覆盖度

MobileForge 消融实验
提示、多轮 Rollout、训练目标、评测模型与课程覆盖的系统消融。查看高清原图 ↗
+25.0 pp

纠错提示改善后续尝试

提示将失败反馈转化为下一轮可复用经验,使第二次尝试成功率由 52.0% 提升至 77.0%。

50.9%

HiFPO 优于直接 SFT

在相同无标注数据上,Hint-contextualized GRPO 在 900-task 设置中取得最强结果。

15 / 117

任务筛选需要保留局部失败

移除已掌握任务,同时保留 all-fail 轨迹中的局部正确步骤,得到最强域外结果。

27.3%

轨迹 grounding 扩大课程覆盖

基于探索轨迹生成任务,覆盖范围明显高于只观察 Landing Screen。

05Cases & errors

提示如何改变轨迹,以及能力仍卡在哪里

提示驱动的多轮 Rollout 案例
第一次尝试失败后,纠错提示帮助 Agent 在下一轮完成恢复与后续操作。查看高清原图 ↗
MobileForge 错误分析
不同基座与适配模型在功能标签上的能力变化。查看高清原图 ↗