03第二作者 · arXiv 2026 · 已开源
MemGUI-Agent
MemGUI-Agent: An End-to-End Long-Horizon Mobile GUI Agent with Proactive Context Management
把“如何管理上下文”变成模型自己输出的动作,让长程 GUI Agent 在控制 Prompt 长度的同时保留关键事实。
Research overview
这项工作解决什么问题?
ReAct 式 Agent 被动累积每一步截图、思考和动作,长程任务中 Prompt 持续膨胀,重要的跨应用事实被大量历史稀释,最终表现为忘记进度、反复操作或凭空补全结果。
- ConAct(Context-as-Action):同一策略同时生成 GUI 动作和上下文管理动作。
- 三个结构化上下文字段:折叠动作历史、折叠 UI 状态、近期步骤记录。
- MemGUI-3K:2,956 条轨迹和 64,430 个评测通过的有效步骤,用于 SFT 与离线分析。
- 重点参与主动上下文管理方案和完整训练评测链路建设。
- 参与从 128 个种子任务扩展任务、采集教师模型轨迹,并进行轨迹级与步骤级质量过滤。
- 基于 Qwen3-VL-8B 完成 LoRA SFT、消融与域外泛化评测。
01Motivation
长程任务的瓶颈不是上下文不够长,而是不会管理上下文
ReAct 持续追加截图、思考和动作,导致 Prompt 膨胀与关键信息稀释。

历史线性增长,关键信息被重复截图和冗余推理淹没。
主动折叠历史、写入精确 UI 事实,并保留近期步骤记录。
03MemGUI-3K
上下文管理需要通过高质量轨迹学习
仅给模型 ConAct 输出格式并不足以稳定触发记忆与折叠,因此构建带完整动作标注的监督数据。
04Main results
更低的上下文成本,换来更强的长程性能

| 实验设置 | 基线 | 本文方法 | 结论 |
|---|---|---|---|
| MemGUI-Bench / 235B zero-shot | 24.2% / 46.9% | 37.5% / 62.5% | Pass@1 / Pass@3 |
| MemGUI-Bench / 8B | 9.4% Pass@1 | 23.4% Pass@1 | +14.0 pct |
| MobileWorld / 235B | 14.5% SR | 29.1% SR | +14.6 pct |
| MobileWorld / 8B | 9.4% SR | 17.9% SR | +8.5 pct |
每步平均输入更短
长程区域内上下文增长更平缓,避免历史无限膨胀。
8B 模型显著提升
MemGUI-Bench Pass@1 从 9.4% 提升至 23.4%。
235B 域外泛化
MobileWorld 成功率由 14.5% 提升至 29.1%。
8B 域外泛化
训练收益不仅来自对 MemGUI-Bench 格式的拟合。
05Skill & ablation
模型学到的是记忆决策,而不只是输出格式
离线能力分析
| 模型 | UI Action | Memory Trigger | Folding | Format |
|---|---|---|---|---|
| 8B-Instruct | 29.2 | 19.9 | 8.8 | 94.9 |
| MemGUI-8B-SFT | 36.3 | 48.0 | 26.1 | 99.9 |
最大增益来自记忆触发和历史折叠,而非简单格式学习。
组件消融
| 设置 | Pass@1 | Pass@3 | IRR |
|---|---|---|---|
| ReAct baseline | 5.0 | 27.5 | 19.5 |
| + UI memory | 17.5 | 42.5 | 39.1 |
| + history folding | 22.5 | 32.5 | 25.7 |
| Full ConAct | 40.0 | 62.5 | 51.0 |
三个组件互补:折叠控制长度,记忆保留事实,自描述提供局部 grounding。




