02共同作者 · ACM MM 2026 · 已开源

MemGUI-Bench

MemGUI-Bench: Benchmarking Memory of Mobile GUI Agents in Dynamic Environments

不再只测 Agent 会不会点击,而是系统评估它能否跨步骤、跨应用、跨轮次记住并复用信息。

128Memory-intensive tasks26 apps · 68 scenarios
89.8%记忆密集型任务占比既有基准仅 5.2%–11.8%
58.9%非超时失败中的记忆幻觉343 failures analyzed

Research overview

这项工作解决什么问题?

既有移动端基准中只有 5.2%–11.8% 的任务真正涉及记忆,也没有跨会话学习评测,因此短任务上的高成功率无法反映 Agent 在真实长程工作流中的信息保持与经验积累能力。

论文贡献
  • 基于 11 个 Agent、5 类架构总结短期与长期记忆分类体系。
  • 构建 128 个任务、26 个应用、64 组镜像任务;89.8% 需要跨时间与跨空间记忆。
  • MemGUI-Eval:三阶段 Progressive Scrutiny 与 7 个层级指标,兼顾准确性和评测成本。
我的工作
  • 参与 MemGUI-Bench 记忆评测基准建设及 GUI Agent 训练评测链路工作。
  • 围绕长程任务的短期信息保持、跨应用证据链和跨轮次学习参与实验与结果分析。
01Motivation

短任务上的高成功率掩盖了真实的记忆缺口

既有基准中真正涉及记忆的任务比例仅为 5.2%–11.8%,也缺少跨会话学习协议。

MemGUI-Bench 与既有基准对比
任务规模、跨应用、自动重置、长期记忆与评测指标的系统对比。查看高清原图 ↗
既有评测方法局限
规则评测难泛化,完整视觉评测成本高;渐进式审查在两者之间取得平衡。查看高清原图 ↗
128记忆密集任务
26真实应用
89.8%跨时间与空间记忆
64组镜像任务
02Benchmark design

基准同时测短期信息保持与跨轮次学习

MemGUI-Bench 任务统计
68 个真实场景、26 个应用、三个难度层级和四类跨应用跨度。查看高清原图 ↗
MemGUI-Bench 统一架构
快照恢复、并行执行、动作与截图记录,以及短期/长期记忆评测。查看高清原图 ↗
A

Memory Taxonomy

区分短期信息保持与跨会话长期经验,并覆盖 5 种 Agent 架构。

B

Snapshot Tasks

通过快照恢复动态环境,保证复杂任务可重复执行和公平比较。

C

Mirror Pairs

用成对任务区分单次记忆和多次尝试中的经验迁移。

D

Progressive Scrutiny

先低成本筛查,再做语义判断,必要时定向回看历史截图。

03MemGUI-Eval

三阶段渐进审查兼顾准确率与成本

先用低成本证据筛查,再进行完整语义判断,只在不确定时回看定向历史截图。

MemGUI-Eval 三阶段流程
Cost-effective Triage → Full Semantic Analysis → Targeted Visual Verification。查看高清原图 ↗
第一阶段评测成功案例
最后三张截图已足够确认任务成功。查看高清原图 ↗
第二阶段评测失败案例
结合动作描述与执行前后状态识别失败。查看高清原图 ↗
第三阶段视觉核验案例
对不确定任务定向回看历史视觉证据。查看高清原图 ↗
04Six research questions

六个问题揭示当前 Agent 的记忆能力边界

RQ1

现有 GUI Agent 的记忆能力如何?

标准基准隐藏了 4–10× 的能力缺口;端到端模型在记忆密集任务上尤其薄弱。

32.8%最佳单次成功率
RQ2

记忆机制是必要还是可选?

短期记忆是必要能力;长期记忆对单次任务不是必需,但对跨会话学习至关重要。

−30.0 pp移除短期记忆的最大跌幅
RQ3

跨应用复杂度如何影响表现?

从单应用到四应用,成功率下降 16–40 个百分点,跨应用信息迁移是主要瓶颈。

4 apps最复杂任务跨度
RQ4

更长上下文是否有效?

多轮长上下文使 M3A 从 32.8% 提升到 51.6%,但较小上下文窗口模型仍受限。

+18.8 ppM3A 多轮收益
RQ5

长期记忆能否带来跨会话学习?

带显式长期记忆的 Agent 在后续任务中最高获得 21.9 个百分点提升。

+21.9 pp跨会话学习收益
RQ6

记忆增强的计算代价是什么?

更强记忆架构带来明显 Token 与时间开销,需要在能力和效率之间折中。

4.5–5.9×部分 Agent Token 开销
长上下文能力对比
多轮上下文带来明显提升,但上下文窗口仍决定上限。查看高清原图 ↗
跨会话学习曲线
显式长期记忆改善多次尝试中的经验迁移。查看高清原图 ↗
实验设置基线本文方法结论
Agentic workflow / M3A32.8% Pass@147.7% Pass@3多轮尝试仍有限
Agentic workflow / Agent-S227.3% Pass@149.2% Pass@3显式记忆收益明显
End-to-end / GUI-Owl-7B6.2% Pass@110.2% Pass@3长程能力缺口大
MemGUI-Eval / N=25693.1% F1高配评测设置
05Failure analysis

58.9% 的非超时失败与记忆幻觉相关

失败不仅是没记住,还包括记忆了错误过程、输出了未完成结果或无法跨应用迁移证据。

MemGUI-Bench 失败模式热力图
Partial / Process / Output Memory Hallucination、Knowledge Deficiency 与 Intent Misunderstanding 的分布。查看高清原图 ↗
58.9%

记忆幻觉

在非超时失败中占主导,说明仅增加上下文长度无法解决信息组织问题。

5 类

系统失败模式

从部分记忆幻觉到知识缺失,为后续记忆架构设计提供定位框架。

4–10×

能力差距

记忆密集任务暴露了标准短程基准无法体现的系统性短板。