Agent · GUI Intelligence · Post-training

让智能体在真实环境中
学会行动与进化

我是吴高,浙江大学控制科学与工程硕士研究生,研究聚焦移动端 GUI Agent、 长程记忆与大模型后训练。目前在阿里巴巴通义实验室从事 Agent Rollout 基础设施研发。

查看科研工作
吴高
2027 届算法工程师
77.6%
AndroidWorld Pass@3MobileForge / ForgeOwl-8B
62.5%
长程任务 Pass@3MemGUI-Agent-235B
4 万级
任务并发Agent Rollout 基础设施
01 / ABOUT

我关注的不是让 Agent 在一次演示里“看起来会用手机”,而是让它在真实、动态、长程的环境中具备稳定行动、主动记忆和持续进化的能力。

我的经历贯穿算法与工程两端:从构建 GUI Agent 记忆评测基准、设计主动上下文管理,到利用层级反馈完成无标注后训练;也参与过企业级智能回测平台和大规模 Agent Rollout 基础设施建设。

这让我能够从任务定义出发,完成数据构建、模型训练、评测分析、系统接入和规模化运行,而不是只停留在单点模型实验。

Selected research

沿着一条清晰的研究主线

从评测智能体的记忆能力,到赋予其主动管理上下文的能力,再到构建无标注自进化闭环。

01 评测记忆02 主动管理记忆03 闭环自进化

Experience

把研究做深,也把系统做实

教育、科研与产业实践共同构成我的能力路径。

01

阿里巴巴通义实验室

AI 研发实习生

面向 Qwen 系列模型后训练与评测,参与统一 Agent Rollout 基础设施建设,负责运行环境、任务生命周期、异常诊断与失败恢复。

100+ 任务模板 · 4 万级并发 · 百万级日处理量
02

快手主站技术部

AI 研究实习生

参与企业级 Android 通用智能回测平台建设,推动自然语言任务理解、自动执行、结果验证与知识沉淀落地。

端到端成功率 90% · 正负例判定准确率 95%
03

浙江大学

控制科学与工程 · 硕士

研究方向为移动端 GUI Agent、长程记忆、经验自进化与大模型后训练。

公开论文 3 篇 · 共同一作 / 二作 / 共同作者
04

西北工业大学

自动化 · 本科

GPA 3.73/4.1,专业排名 11/178,保研至浙江大学。

一等奖学金 · 优秀毕业生 · 优秀大学生

More work

更多项目实践

COMPETITION / LEAD

金融 Text-to-SQL 训练与推理优化

构建 PostgreSQL 执行验真数据闭环,完成 LoRA SFT、GRPO 和昇腾环境推理优化。

38.05% → 75.58%验证集准确率

Toolkit

研究与工程工具箱

01

模型后训练

LoRA SFTGRPO奖励设计VeRLms-swift
02

Agent 算法

GUI Agent长程记忆Context Management经验检索LLM-as-a-Judge
03

系统工程

大规模 Rollout任务编排运行环境治理PostgreSQLAndroid 自动化