02共同作者 · ACM MM 2026 · 已开源
MemGUI-Bench
MemGUI-Bench: Benchmarking Memory of Mobile GUI Agents in Dynamic Environments
不再只测 Agent 会不会点击,而是系统评估它能否跨步骤、跨应用、跨轮次记住并复用信息。
Research overview
这项工作解决什么问题?
既有移动端基准中只有 5.2%–11.8% 的任务真正涉及记忆,也没有跨会话学习评测,因此短任务上的高成功率无法反映 Agent 在真实长程工作流中的信息保持与经验积累能力。
- 基于 11 个 Agent、5 类架构总结短期与长期记忆分类体系。
- 构建 128 个任务、26 个应用、64 组镜像任务;89.8% 需要跨时间与跨空间记忆。
- MemGUI-Eval:三阶段 Progressive Scrutiny 与 7 个层级指标,兼顾准确性和评测成本。
- 参与 MemGUI-Bench 记忆评测基准建设及 GUI Agent 训练评测链路工作。
- 围绕长程任务的短期信息保持、跨应用证据链和跨轮次学习参与实验与结果分析。
01Motivation
短任务上的高成功率掩盖了真实的记忆缺口
既有基准中真正涉及记忆的任务比例仅为 5.2%–11.8%,也缺少跨会话学习协议。
03MemGUI-Eval
三阶段渐进审查兼顾准确率与成本
先用低成本证据筛查,再进行完整语义判断,只在不确定时回看定向历史截图。

04Six research questions
六个问题揭示当前 Agent 的记忆能力边界
现有 GUI Agent 的记忆能力如何?
标准基准隐藏了 4–10× 的能力缺口;端到端模型在记忆密集任务上尤其薄弱。
32.8%最佳单次成功率
记忆机制是必要还是可选?
短期记忆是必要能力;长期记忆对单次任务不是必需,但对跨会话学习至关重要。
−30.0 pp移除短期记忆的最大跌幅
跨应用复杂度如何影响表现?
从单应用到四应用,成功率下降 16–40 个百分点,跨应用信息迁移是主要瓶颈。
4 apps最复杂任务跨度
更长上下文是否有效?
多轮长上下文使 M3A 从 32.8% 提升到 51.6%,但较小上下文窗口模型仍受限。
+18.8 ppM3A 多轮收益
长期记忆能否带来跨会话学习?
带显式长期记忆的 Agent 在后续任务中最高获得 21.9 个百分点提升。
+21.9 pp跨会话学习收益
记忆增强的计算代价是什么?
更强记忆架构带来明显 Token 与时间开销,需要在能力和效率之间折中。
4.5–5.9×部分 Agent Token 开销
| 实验设置 | 基线 | 本文方法 | 结论 |
|---|---|---|---|
| Agentic workflow / M3A | 32.8% Pass@1 | 47.7% Pass@3 | 多轮尝试仍有限 |
| Agentic workflow / Agent-S2 | 27.3% Pass@1 | 49.2% Pass@3 | 显式记忆收益明显 |
| End-to-end / GUI-Owl-7B | 6.2% Pass@1 | 10.2% Pass@3 | 长程能力缺口大 |
| MemGUI-Eval / N=256 | — | 93.1% F1 | 高配评测设置 |
05Failure analysis
58.9% 的非超时失败与记忆幻觉相关
失败不仅是没记住,还包括记忆了错误过程、输出了未完成结果或无法跨应用迁移证据。

记忆幻觉
在非超时失败中占主导,说明仅增加上下文长度无法解决信息组织问题。
系统失败模式
从部分记忆幻觉到知识缺失,为后续记忆架构设计提供定位框架。
能力差距
记忆密集任务暴露了标准短程基准无法体现的系统性短板。








