01共同第一作者 · arXiv 2026 · 已开源
MobileForge
MobileForge: Annotation-Free Adaptation for Mobile GUI Agents with Hierarchical Feedback-Guided Policy Optimization
让 Agent 在真实目标应用中自己探索、生成任务、获得层级反馈,并把失败经验转化为可训练的策略更新。
Research overview
这项工作解决什么问题?
移动应用数量多、变化快,依赖人工编写任务、专家轨迹和奖励标签的适配方式成本高;已有无标注学习又常把任务生成、真实交互、评测反馈和策略优化割裂开,粗粒度结果也难以直接用于稳定训练。
- MobileGym:把目标应用探索、课程任务挖掘、Rollout 执行和层级评测统一到真实交互环境中。
- HiFPO:把任务结果、步骤级过程反馈和纠错提示整理为 Hint-contextualized Step-level GRPO 更新。
- 仅使用自动生成的无标注数据,在域内 AndroidWorld 和域外 MobileWorld 上同时验证适配与迁移能力。
- 共同完成整体方案设计和核心实现,参与打通应用探索、任务生成、多轮尝试、反馈评估与后训练闭环。
- 重点构建交互采样与评测流程,把任务级、步骤级反馈及失败提示整理为 Step-level GRPO 训练数据。
- 基于 VeRL 完成策略优化和实验分析,聚焦无专家轨迹下的反馈细化与失败经验复用。
01Motivation
现有适配方法缺少真正的无标注闭环
教师轨迹依赖强模型与外部监督;稀疏奖励又只能给出轨迹级信号。MobileForge 的目标是在目标应用真实交互中同时获得任务、反馈和策略更新。

依赖强教师、专家轨迹或外部奖励标注,难以持续覆盖快速变化的新应用。
在目标应用中自动探索、挖掘任务、执行 Rollout、获得层级反馈并更新策略。
03Main results
无标注生成的数据可以训练出更强策略
MobileForge 同时提升通用基座模型和 GUI 专用模型,并在域外 MobileWorld 保持收益。

| 实验设置 | 基线 | 本文方法 | 结论 |
|---|---|---|---|
| AndroidWorld / Qwen3-VL-8B | 55.2% Pass@3 | 67.2% Pass@3 | +12.0 pct |
| AndroidWorld / GUI-Owl-1.5-8B | 69.0% Pass@3 | 77.6% Pass@3 | +8.6 pct |
| MobileWorld GUI-Only / ForgeOwl-8B | 37.6% SR | 41.0% SR | 域外迁移 |
| 900-task / Hard tasks | 19.3% Pass@1 | 29.8% Pass@1 | +54.4% relative |
04Ablations
真正驱动提升的是细粒度反馈、正确筛选与覆盖度

纠错提示改善后续尝试
提示将失败反馈转化为下一轮可复用经验,使第二次尝试成功率由 52.0% 提升至 77.0%。
HiFPO 优于直接 SFT
在相同无标注数据上,Hint-contextualized GRPO 在 900-task 设置中取得最强结果。
任务筛选需要保留局部失败
移除已掌握任务,同时保留 all-fail 轨迹中的局部正确步骤,得到最强域外结果。
轨迹 grounding 扩大课程覆盖
基于探索轨迹生成任务,覆盖范围明显高于只观察 Landing Screen。
05Cases & errors




