
摘要本文解读 ICML 2026 论文《SE-GA: Memory-Augmented Self-Evolution for GUI Agents》。该论文提出记忆增强的自演化 GUI 智能体 SE-GA通过融合测试时分层记忆扩展 TTME、记忆增强自演化训练 MASE与Hindsight Goal-Shifting 数据重标注让智能体在真实界面环境中不依赖预定义任务与人工标注地持续进化其特别之处在于把交互历史从「一次性上下文」固化成「策略参数」。实验表明7B 规模的 SE-GA 在 ScreenSpot 上取得 89.0 的平均分、AndroidControl-High 成功率 75.8%、GUIOdyssey 83.9%、AndroidWorld 在线环境 39.0%全面超越同参数规模基线并逼近 72B 的 UI-TARS为长程 GUI 自动化与智能体记忆系统提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQSE-GA 解决的核心问题是什么TTME 的三层记忆分别是什么Hindsight Goal-Shifting 是如何把失败变成监督信号的SE-GA 与 UI-TARS 等基线相比优势在哪自演化训练为什么需要自适应裁剪这个方法可以迁移到机器人等其它具身场景吗参考链接论文基本信息项目内容标题英文SE-GA: Memory-Augmented Self-Evolution for GUI Agents标题中文SE-GA记忆增强的自演化 GUI 智能体作者Shilong Jin, Lanjun Wang, Zhuosheng Zhang机构天津大学智能与计算学部 / 新媒体与传播学院 · 上海交通大学计算机学院会议ICML 2026arXivarXiv:2605.16883项目网站github.com/jinshilong-dev/SE-GA背景与动机GUI图形用户界面是连接人类意图与数字执行的通用桥梁。过去几年视觉语言模型VLM把界面理解从「解析 HTML/DOM 的多模块管线」推进到「直接看像素、直接出动作」的端到端范式代表工作是 UI-TARS、Aguvis 与 OS-Atlas。但作者指出现有 GUI Agent 在长程任务上仍存在两个结构性缺陷。第一是部分可观测与历史依赖。真实界面任务里关键信息可能只出现在很早的步骤比如某次登录、某个筛选条件却在后续持续影响决策而多数方法只把当前截图和有限长度的上下文喂给模型长序列中早期子目标会被逐步稀释一次早期错误就可能在后续步骤被放大成不可逆的失败。第二是任务高度重复却无法复用经验。真实任务往往不是孤立的而是既有任务的变体或组合理论上应当复用过去成功的策略。但当前智能体要么使用在固定数据集上训练出来的静态策略要么依赖临时的检索拼装提示缺少统一的记忆组织因此无法从历史交互中提炼策略也无法把显式经验编码进策略参数。作者用一句话概括了目标把 GUI 智能体从「静态命令执行器」变成「动态学习者」。为此论文给出两个组件——TTME 负责测试时的分层记忆扩展MASE 负责把经验写回策略的记忆增强自演化训练并把 GUI 导航形式化为部分可观测马尔可夫决策过程POMDP$\langle \mathcal{S}, \mathcal{A}, \mathcal{O}, \mathcal{T}, \mathcal{R}, \gamma \rangle$其中智能体实际只能观测到界面截图 $o_t$ 与用户指令 $Q$。从历史脉络看这条路线并不孤立。2022–2023 年的 Mind2Web 与 GPT-4V 把 GUI 导航形式化为静态屏幕解析与零样本定位2024–2025 年 CogAgent、OS-Atlas、Aguvis、UI-TARS 让端到端纯视觉 Agent 成为主线2025 年前后 ShowUI 一类工作把层次记忆引入 Agent 工作流但检索仍以文本语义为主忽略了 GUI 元素的空间与结构复杂度。SE-GA 的位置正是把「记忆组织」与「自演化训练」这两条此前分离的线索第一次合并成一个闭环。研究主线从问题到结论图 7SE-GA 研究主线——问题、动机、设计、方法、实验到结论的递进Mermaid 流程图基准/方法设计SE-GA 的总体设计是一个「交互—记忆—训练」的数据飞轮。在在线环境中智能体进行模型无关、交互驱动的遍历每一步由 TTME 产生大量三元组每个三元组由动作、动作前后的界面截图以及对应的记忆条目组成。这些数据随后交给 MASE先做接地训练以维持基础能力并防止灾难遗忘再做自演化训练把新经验固化进策略参数。整个过程不需要预定义任务集合也不需要人工标注。在推理侧每个时间步智能体的输入被组织为 $x_t (o_t, Q, M_{retrieved})$即当前截图、用户指令与检索出的记忆三者拼接再由策略 $\pi_\theta(a_t \mid x_t)$ 输出动作。TTME 维护的分层记忆库记为 $\mathcal{M} (M^{EPI}, M^{SEM}, M^{EXP})$并且它同时是一个动态缓冲区任务执行过程中不断累积新的成功轨迹供之后的检索复用。图 1SE-GA 总览——先在在线环境中进行无模型、交互驱动的遍历由 TTME 产生大量「动作 前置/后置截图 记忆」三元组MASE 再用这些数据完成自演化。分类全景TTME 的三层记忆各有明确分工。情节记忆$M^{EPI}$ 记录状态转移 $m_k \langle o_k, a_k, o_{k1} \rangle$并用固定长度滑动窗口 $H$ 截断只保留 $\epsilon \max(1, t-H)$ 之后的部分充当短期工作记忆避免陈旧信息误导决策。语义记忆$M^{SEM}$ 存储键值对形式的通用交互规则检索时用当前指令的向量表示与规则键做余弦相似度 $S^{sem}$取最相关的 Top-$K$ 条提供跨任务的通用逻辑例如「访问受限页面前需要先登录」。经验记忆$M^{EXP}$ 存储完整轨迹、模型自己生成的反思摘要以及意图向量与任务视觉键检索时对文本意图相似度与界面截图视觉相似度做加权融合$S^{exp} \lambda \cdot \mathrm{Sim}(\phi(Q), k_{intent}) (1-\lambda) \cdot \mathrm{Sim}(\psi(o_t), k_{task})$。图 8SE-GA 方法分类全景——TTME 情节/语义/经验记忆与 MASE 接地/自演化训练及其分层奖励Mermaid 图方法细节MASE 的两个阶段分工明确。Stage I 接地训练用记忆感知的行为克隆在专家轨迹上最小化负对数似然 $\mathcal{L}{SFT}$数据来自 2K 样本目的是维持基础能力并防止后续强化学习引发灾难遗忘。Stage II 自演化训练在 GRPO 基础上做了三处针对性改进引入受 DAPO 启发的 token 级重要性比 $\rho{i,t}$ 做细粒度信用分配避免无关 token 主导更新采用自适应裁剪 $\rho^{clip} \mathrm{clip}(\rho_{i,t}, 1-\epsilon, 1\epsilon_{cur})$其上界 $\epsilon_{cur}$ 随训练进度余弦衰减早期放开更新、后期逐步收紧采用分层奖励 $R_{total} w_f R_{format} w_a R_{acc}$其中准确率奖励再按动作类型拆为类型奖励与参数奖励参数奖励取边界框命中、交并比阈值或精确匹配/数学校验。工程细节方面见论文附录训练建立在 DeepSpeed 之上使用 ZeRO-3 切分优化器状态、梯度与参数开启 BF16 混合精度并关闭 CPU offload参数高效微调只在 Stage II 启用 LoRArank 32、alpha 64、target all-linear、dropout 0.05以冻结主干、降低显存占用。两个阶段的学习率分别为 $2\times10^{-6}$ 与 $2\times10^{-5}$全局批大小为 16 与 256组大小为 16推理时最长 prompt 6144 token用于容纳三层记忆与高分辨率截图。全部实验在 4 张 NVIDIA A800 上完成。值得注意的是MASE 还包含一个关键的数据构造机制——Hindsight Goal-Shifting。给定一条失败轨迹 $\tau$如果它的有效前缀 $\tau_{0:k}$ 满足某个替代子目标 $g$就把这段前缀重标注为该子目标的成功样本形成扩充集合 $\mathcal{D}_{GS}$。这使得「失败即废弃」变成「失败即子任务监督」是有限数据下持续提升的关键。实验设计与结果评测覆盖四个基准兼顾静态定位、离线指令执行与在线动态交互基准规模评测重点ScreenSpot1,200 指令 · 5 类平台文本与图标元素的定位AndroidControl15,000 示范 · 833 个应用Low/High 双粒度指令执行GUIOdyssey7,735 episodes · 201 个应用跨应用工作流导航AndroidWorld116 个任务 · 20 个真实应用在线动态环境泛化评测指标为动作类型准确率、定位准确率与任务成功率基座模型是 70 亿参数的 Qwen2.5-VL对比基线共 15 个包括 GPT-4o、Claude3-Opus、Gemini-1.5-pro、Qwen2.5-VL 的 7B/72B、InternVL2、Aria-UI、UI-TARS 的 7B/72B、OS-Atlas、Aguvis、SeeClick、UGround、OS-Genesis 与 GUI-Critic-R1。由于部分前作未公开完整实现细节这些方法的数值沿用 UI-TARS 论文报告的结果以保证口径一致。主结果如下表加粗为本文模型规模ScreenSpot AvgAndroidControl-High SRGUIOdyssey SRGPT-4o-18.312.53.3UI-TARS72B88.474.788.6OS-Atlas7B82.571.262.0Qwen2.5-VL7B76.147.034.3SE-GA7B89.075.883.9在线环境 AndroidWorld 上SE-GA 取得 39.0% 的成功率明显高于 UI-TARS 的 33.0%、GUI-Critic-R1 的 27.6%、Qwen2.5-VL 7B 的 25.5% 与 GPT-4o 的 23.7%。消融给出两个组件的独立贡献配置AndroidControl-High SRGUIOdyssey SR完整 SE-GA73.883.9移除 TTME61.474.9移除 MASE59.760.4三轮自演化的持续提升进一步说明机制有效ScreenSpot 从 79.3 提升到 89.0AndroidControl-Low 从 68.3 提升到 88.6AndroidControl-High 从 55.9 提升到 75.8首轮即提升 15.4 个百分点GUIOdyssey 从 52.3 提升到 83.9累计 31.6 个百分点AndroidWorld 从 28.6 提升到 39.0但第二轮至第三轮增益递减反映出策略收敛与记忆库逐渐饱和。检索策略方面Top-$k$75.8 / 83.9与 Mixed76.2 / 82.1都优于只保留成功轨迹的 Success-only70.0 / 72.5。图 2SE-GA 在不同任务步数下的表现——随步数增长T0 到 30基线性能衰减而 SE-GA 保持稳定。论文附录还提供了两组界面级案例。第一组是 Hindsight Goal-Shifting 的重标注过程原始任务要求智能体在 BBC Sports 中查出下一场 MLB 比赛时间并在 Microsoft To Do 中创建提醒整体流程失败但有效前缀被重标注为「在搜索栏中查出下一场比赛」的成功样本。图 3失败轨迹示例——任务为在 BBC Sports 中查询下一场 MLB 比赛并在 Microsoft To Do 中创建提醒。图 4经 Hindsight Goal-Shifting 重标注后的成功轨迹——新指令为在搜索栏中查询下一场 MLB 比赛。第二组是跨四应用的超长程任务对照同一条「用 DuckDuckGo 选体育电影、亚马逊加零食、Facebook Messenger 邀请 Victor James、时钟应用设提醒」的任务UI-TARS 在应用切换中丢失早期子目标而失败SE-GA 则依靠分层记忆维持子目标连续性并复用历史策略完成任务。图 5UI-TARS 的失败轨迹示例——跨四个应用的运动主题娱乐规划任务未能完成。图 6SE-GA 在同一任务上的成功轨迹——分层记忆维持子目标连续性并复用历史策略。结果对比总结图 9结果对比总结——从基线 UI-TARS 72B 到 7B 的 SE-GA 的全面领先Mermaid 流程图关键发现长程增益最显著移除 TTME 后 AndroidControl-High 成功率由 73.8 降至 61.4-12.4 个百分点而短程任务仅损失 5.6 个百分点说明分层记忆主要解决的是长程一致性与部分可观测性问题。自演化是基础能力的来源移除 MASE 后 GUIOdyssey 从 83.9 暴跌至 60.4-23.5 个百分点AndroidControl-High 从 73.8 降至 59.7说明把经验写回参数比单纯检索更能提升底层决策能力。失败轨迹同样有价值只保留成功轨迹的 Success-only 检索在 AndroidControl-High 上仅 70.0而 Top-$k$ 达到 75.8、Mixed 达到 76.2证明失败数据提供了纠错监督信号。自演化可跨轮持续生效三轮迭代中四个基准全部单调提升GUIOdyssey 累计提升 31.6 个百分点在线环境 AndroidWorld 累计提升 10.4 个百分点。动作类型准确率天花板被刷新SE-GA 在 GUIOdyssey 上取得 96.5% 的动作类型准确率是全部评测模型中最高的甚至超过 UI-TARS-72B。执行质量体现在组件可分解TTME 与 MASE 各自都有独立可量化的消融退化量说明贡献不来自单点调参而来自记忆结构与训练信号的协同。局限性作者明确承认的一手局限是记忆检索效率随着交互数据累积分层记忆库尤其是经验记忆规模持续增长依赖嵌入相似度与视觉特征的检索会带来可观的计算开销可能拖慢延迟敏感场景的实时响应。此外当前数据集只有 4,007 条轨迹平均 11.89 步、最长 31 步其中短任务占 67%、中任务 22%、长任务 11%规模有限更大规模的交互语料才能充分检验泛化性方法上缺少显式的子目标分解面对跨越多个应用的超长流程仍显吃力移动端、网页端与桌面端之间的跨平台迁移也尚未系统评估。作者给出的三条方向是扩大训练数据与任务类型、引入层次化任务分解、研究跨平台迁移学习。从论文写作角度看本文叙事清晰以两个关键挑战设问、以「从静态执行器到动态学习者」定调、以具体数字兑现承诺但也存在几处可在定稿前修正的细节正文与消融部分对 AndroidControl-High 成功率的标注存在 75.8 与 73.8 两个数值扩展消融表的列标题把 AndroidControl-Low 误标为 AndroidControl-High另有主谓不一致与残留注释段等疏漏。常见问题FAQSE-GA 解决的核心问题是什么SE-GA 解决的是 GUI 智能体在长程任务中「记不住历史」与「学不会经验」两个问题前者由 TTME 的分层记忆缓解后者由 MASE 的两阶段自演化训练解决从而把智能体从静态执行器变成持续学习者。TTME 的三层记忆分别是什么TTME 维护情节记忆、语义记忆与经验记忆三层结构情节记忆用滑动窗口保存近期状态转移作为短期工作记忆语义记忆保存可迁移的抽象交互规则经验记忆保存历史成功轨迹与反思摘要三者共同支撑长程决策。Hindsight Goal-Shifting 是如何把失败变成监督信号的当一条失败轨迹的有效前缀满足某个替代子目标时算法就把它重标注为该子目标的成功样本。例如「查询比赛时间并创建提醒」失败后仅完成「在搜索栏查询比赛」的前缀会被验证并重标注从而把废弃数据转成子任务级监督。SE-GA 与 UI-TARS 等基线相比优势在哪在 7B 参数规模下SE-GA 的 ScreenSpot 平均分为 89.0超过 72B 的 UI-TARS88.4AndroidControl-High 成功率 75.8 逼近其 74.7在线 AndroidWorld 成功率 39.0% 高于 UI-TARS 的 33.0%同时动作类型准确率达到 96.5%。自演化训练为什么需要自适应裁剪GUI 任务中高置信度的正确 token 容易被对称裁剪过度约束因此 MASE 让裁剪上界随训练进度余弦衰减早期允许更大的策略更新以充分探索后期逐步收紧以保证收敛稳定。这个方法可以迁移到机器人等其它具身场景吗论文的可复用部分在于分层记忆结构与自演化训练流水线它们与具体界面无关但作者未在 GUI 之外的平台验证跨平台移动/网页/桌面乃至具身环境迁移仍是明确的未来方向。参考链接论文 arXiv 摘要页arXiv:2605.16883 SE-GA官方开源实现github.com/jinshilong-dev/SE-GA关键基线 UI-TARSarXiv:2501.12326动态在线评测环境 AndroidWorldarXiv:2405.14573GRPO 原始方法 DeepSeekMatharXiv:2402.03300DAPO 大规模强化学习系统arXiv:2503.14476智能体记忆综述arXiv:2512.13564自演化智能体综述arXiv:2507.21046给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件