Agent · GUI Intelligence · Post-training
让智能体在真实环境中
学会行动与进化
我是吴高,浙江大学控制科学与工程硕士研究生,研究聚焦移动端 GUI Agent、 长程记忆与大模型后训练。目前在阿里巴巴通义实验室从事 Agent Rollout 基础设施研发。

我关注的不是让 Agent 在一次演示里“看起来会用手机”,而是让它在真实、动态、长程的环境中具备稳定行动、主动记忆和持续进化的能力。
我的经历贯穿算法与工程两端:从构建 GUI Agent 记忆评测基准、设计主动上下文管理,到利用层级反馈完成无标注后训练;也参与过企业级智能回测平台和大规模 Agent Rollout 基础设施建设。
这让我能够从任务定义出发,完成数据构建、模型训练、评测分析、系统接入和规模化运行,而不是只停留在单点模型实验。
Selected research
沿着一条清晰的研究主线
从评测智能体的记忆能力,到赋予其主动管理上下文的能力,再到构建无标注自进化闭环。
Experience
把研究做深,也把系统做实
教育、科研与产业实践共同构成我的能力路径。
阿里巴巴通义实验室
AI 研发实习生
面向 Qwen 系列模型后训练与评测,参与统一 Agent Rollout 基础设施建设,负责运行环境、任务生命周期、异常诊断与失败恢复。
100+ 任务模板 · 4 万级并发 · 百万级日处理量快手主站技术部
AI 研究实习生
参与企业级 Android 通用智能回测平台建设,推动自然语言任务理解、自动执行、结果验证与知识沉淀落地。
端到端成功率 90% · 正负例判定准确率 95%浙江大学
控制科学与工程 · 硕士
研究方向为移动端 GUI Agent、长程记忆、经验自进化与大模型后训练。
公开论文 3 篇 · 共同一作 / 二作 / 共同作者西北工业大学
自动化 · 本科
GPA 3.73/4.1,专业排名 11/178,保研至浙江大学。
一等奖学金 · 优秀毕业生 · 优秀大学生More work
更多项目实践
带噪交互场景下的 GUI Agent 经验记忆自进化系统
以轨迹解析、经验抽取、质量门控、向量检索、LLM 重排和提示注入构建运行时知识层,把失败轨迹沉淀为可复用经验。
金融 Text-to-SQL 训练与推理优化
构建 PostgreSQL 执行验真数据闭环,完成 LoRA SFT、GRPO 和昇腾环境推理优化。
Toolkit