ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

【ICML 2025】SAM2Act 论文解读|从视觉基础模型记忆迁移视角

【ICML 2025】SAM2Act 论文解读|从视觉基础模型记忆迁移视角 摘要本文解读 ICML 2025 论文《SAM2Act: Integrating Visual Foundation Model with A Memory Architecture for Robotic Manipulation》。该论文提出SAM2Act与SAM2Act两代机器人操作策略通过融合SAM2 视觉基础模型的多分辨率嵌入、级联多分辨率上采样与空间记忆架构让基于 RVT-2 的 6-DoF 3D 模仿学习策略同时获得高精度、强泛化与空间记忆能力其特别之处在于把 SAM2 的视频分割记忆机制记忆库 记忆编码器 记忆注意力直接迁移为操作策略的海马体并配套新建打破马尔可夫假设的 MemoryBench 评测基准。实验表明RLBench 18 任务平均成功率 86.8% 刷新 SOTA超 RVT-2 达 5.4pp、MemoryBench 记忆任务 94.3%比无记忆基线 37.6pp、The Colosseum 扰动掉点仅 -4.3%为机器人空间记忆型通用操作策略提供了重要借鉴。摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果评测协议主结果MemoryBench 任务设计附录 A分析实验与消融附录 C真机结果结果对比总结关键发现局限性常见问题FAQSAM2Act 和 SAM2Act 有什么区别MemoryBench 为什么能打破马尔可夫假设为什么记忆组件能带来 37.6pp 的提升训练需要多少算力和数据SAM2Act 只能做关键帧位姿级别的操作吗代码和项目开源了吗参考链接论文基本信息项目内容标题英文SAM2Act: Integrating Visual Foundation Model with A Memory Architecture for Robotic Manipulation标题中文SAM2Act视觉基础模型 × 记忆架构的机器人操作作者Haoquan Fang, Markus Grotz, Wilbert Pumacay, Yi Ru Wang, Dieter Fox, Ranjay Krishna, Jiafei Duan机构University of Washington · NVIDIA · Allen Institute for AI · Universidad Católica San Pablo会议ICML 2025arXivhttps://arxiv.org/abs/2501.18564项目网站https://sam2act.github.io/背景与动机机器人操作策略需要同时应对三大挑战多任务交互、对未见场景的泛化以及空间记忆。现有行为克隆BC策略在这三方面各有短板——在环境扰动光照、桌面颜色等下成功率大幅掉点而在同一视觉观测却需要不同动作的隐式记忆任务上更是几乎失效。从研究脉络看这项工作沿着PerAct体素化 3D 关键帧 BC→ The Colosseum泛化评测基准→ Manipulate-Anything → SAM2Act的主线推进。3D 操作 transformer 阵营中PerAct 使用体素表示RVT / RVT-2 使用 2.5D 多视图表示RVT-2 在 RLBench 上已达 81.4% 平均成功率PolarNet / M2T2 / Manipulate-Anything 则走点云重建路线视觉表示方向SAM / SAM2、DINOv2 等基础模型被用作预训练或冻结编码器SAM-E 即 RVT × SAM 编码器机器人记忆方向从导航语义地图到 VLM/LVM 的体素图与神经特征场再到 SAM2 的视频级流式记忆记忆机制的粒度与通用性不断提升。关键差距在于已有工作用 SAM 提升感知精度却从未把 SAM2 的流式记忆机制迁移到操作策略——分割与操作共享同一套空间表征而记忆正是它们之间缺失的桥梁。基线对比也印证了这一差距在 MemoryBench 记忆任务上无记忆的 SAM2Act55.0%与 RVT-254.0%几乎持平一旦接入记忆组件SAM2Act 一跃达到 94.3%。从历史视角看视觉基础模型经历了 2023 年 SAMICCV的提示驱动通用分割、2024 年 RVT-2 / SAM-E 把多视图 transformer 确立为 3D 操作骨干、2025 年 SAM2Act 完成从感知到决策的技术迁移直至 2025–2026 年被 FoundModels 等综述列为机器人视觉基础模型核心——SAM2Act 正是这条迁移弧上的关键节点。研究主线从问题到结论**图 6SAM2Act 研究主线Mermaid 流程图从机器人策略泛化与空间记忆缺失的问题出发经动机、设计与方法到四大基准评测并得出结论。基准/方法设计图 1SAM2Act 概览语言指令驱动的多视图行为克隆策略可执行高精度任务旋转台灯小旋钮、泛化到光照等环境变化经记忆架构升级为 SAM2Act 后可求解需要隐式空间记忆的任务记住钳子存放在哪。SAM2Act 的设计建立在三条核心决策之上基于 RVT-2 的 6-DoF 3D 模仿学习骨干以 RVT-2 的多视图 transformer 为基底coarse 分支生成缩放热图定位兴趣区fine 分支精化为精确动作热图语言用 CLIP 编码对齐空间坐标。SAM2 多分辨率视觉嵌入点云重建后渲染 3 个虚拟视角RGB 通道复制送入 SAM2 图像编码器产出 object-centric 的多分辨率分层嵌入用LoRArank 16微调做域适配避免大规模重训。记忆能力的显式设计SAM2Act 在 coarse 分支注入 SAM2 的记忆库Memory Bank每视角独立 FIFO 队列、记忆编码器Memory Encoder与记忆注意力Memory Attention让策略依据历史热图进行记忆驱动的推理预测热图扮演 SAM2 中 object mask 的角色同一套记忆机制从视频分割无缝迁移到动作预测。评测体系覆盖四个维度RLBench 18 个仿真任务精度、MemoryBench 3 个空间记忆任务记忆、The Colosseum 20 个任务 × 13 类扰动泛化以及 4 个真机任务落地验证。分类全景**图 7SAM2Act 技术构成全景Mermaid 结构图视觉编码SAM2 嵌入 LoRA、动作解码coarse→fine 多视图 transformer 级联上采样、记忆三件套与四类评测基准。方法细节图 2SAM2Act上与 SAM2Act下架构总览SAM2 编码器产出 prompt-conditioned 多分辨率嵌入多视图 transformer 对齐语言与空间坐标级联上采样生成平移热图SAM2Act 在 coarse 分支加入记忆编码器、记忆注意力与记忆库依据历史热图进行记忆驱动的推理。方法的核心设计要素有四多分辨率上采样三个凸上采样器级联逐级 2 倍提升空间分辨率每一步与 SAM2 的对应层级嵌入做元素相加并接 LayerNorm公式为 $X^{l1}\mathrm{LayerNorm}(U(X^l)\oplus E^l)$其中 $E^l$ 是 SAM2 第 $l$ 层嵌入——以最小化信息损失的方式把分层视觉特征直接注入热图解码。记忆组件适配记忆编码器融合 MVT多视图 transformer特征 平移热图下采样结果而非 SAM2 的图像嵌入使记忆表示同时包含语言指令与多视角语义而不仅是原始像素。冻结-微调范式SAM2Act 预训练完成后冻结 SAM2 编码器、MVT 与整个 fine 分支只微调 coarse 分支——因为 coarse 分支的热图承载最丰富的记忆上下文这一设计也大幅降低了适配成本。时空一致采样按连续关键帧序列采样 batch 并逐帧顺序前向避免新采样法导致的收敛缓慢训练采用先标准采样预训练、再新采样微调的两阶段策略。图 3SAM2Act 模块与多分辨率上采样三个凸上采样器级联逐级把 SAM2 多分辨率嵌入经元素相加与 LayerNorm 注入特征图空间分辨率逐级翻倍生成精确平移热图。训练与实现细节同样值得关注附录 B模型在32 块 H100/A100上训练batch size 256记忆窗口 8 时或 320记忆窗口 10 时学习率 3.2e-3按 $1.25\times10^{-5}\times$ batch size 线性缩放优化器为LAMB cosine decay共 90 epochs / 56.25K stepsSAM2 编码器用 LoRA rank 16 适配MemoryBench 各任务按单任务设置训练不同 GPU 配置下保持总 batch size 一致以保证对比公平。实验设计与结果评测协议仿真环境为 CoppeliaSim PyRep7-DoF Franka Panda 机械臂5 个 128×128 RGB-D 相机动作表示为关键帧位姿 OMPL 运动规划。数据规模RLBench 18 任务249 个变体每任务 100 条演示训练 / 25 条测试MemoryBench 3 任务The Colosseum 20 任务 × 13 类扰动真机 4 任务各 10–15 条动觉示教演示。基线为 PerAct、RVT、RVT-2、SAM-ERLBench 报 4 次评估统计Colosseum 报 3 次真机另对比 RVT-210 ID 10 OOD 次试验。图 4MemoryBench 仿真任务上与真机任务下三个空间记忆任务在按钮干扰后场景视觉不可区分必须靠记忆真机任务含 OOD 扰动测试。主结果方法RLBench 平均Colosseum 扰动掉点MemoryBench 平均RVT-281.4%-19.5%54.0%SAM-E70.6%--SAM2Act86.8%-4.3%55.0%SAM2Act--94.3%提升5.4pp15.2pp 更稳37.6pp结论非常清晰记忆组件带来决定性差距——无记忆的 SAM2Act 与 RVT-2 在 MemoryBench 上均约 54–55%SAM2Act 一跃至 94.3%。MemoryBench 任务设计附录 AMemoryBench 的核心设计是打破马尔可夫假设构造两条动作历史 → 同一观测 $o_t$ → 却需要不同动作的场景迫使策略回忆动作历史语言指令标准化以防止信息泄漏。三个任务覆盖 2D / 3D 空间与前向 / 反向推理用按钮中断制造记忆需求任务记忆维度流程随机基线reopen_drawerz 轴3D关抽屉 → 按按钮 → 重开原抽屉按钮后三抽屉视觉不可区分33%put_block_backxy 平面2D块移中心 → 按按钮 → 放回原位4 个红贴片25%rearrange_block反向推理中心块移空位 → 按按钮 → 把未动过的块移向中心2 块50%分析实验与消融附录 C作者还系统拆解了方法各部分对结果的贡献即 Oral 信号中的逐项受控消融P2 替换算子/表示用 SAM2 多分辨率嵌入 级联上采样替换 RVT-2 的原始凸上采样输入——去掉多分辨率嵌入使 RLBench 掉 1.1pp、Colosseum 掉点恶化 14.8pp相对 -344%换回 SAM 编码器掉 6.0pp替换为 DINOv2 / Depth Anything V2 均更低。P4 混淆隔离诊断MemoryBench 每次只隔离一个记忆维度z 轴 / xy 平面 / 反向推理并给出随机基线 33% / 25% / 50%——无记忆 SAM2Act55.0%≈ RVT-254.0%SAM2Act 达 94.3%提升可归因于记忆机制本身。P13 条件化适配而非重训练冻结 SAM2 编码器与 MVT / fine 分支仅 LoRArank 16 coarse 分支微调——低成本适配仍获 86.8% RLBench SOTA且 Colosseum 13 类扰动掉点最小。真机结果图 5真机设置Franka Panda Robotiq 2F-85 夹爪 exocentric RealSense D455 深度相机4 个真机任务各 10-15 条动觉示教演示。真机指标SAM2ActRVT-24 任务总成功率75%43%高精度灯旋钮任务60%0%记忆任务同一按钮按两次70%40%结果对比总结**图 8SAM2Act 结果对比总结Mermaid 流程图RVT-2 → SAM2Act → SAM2Act 在 RLBench、Colosseum 与 MemoryBench 上的数字对比记忆组件贡献 37.6pp。关键发现RLBench 刷新 SOTASAM2Act 在 18 个 RLBench 任务上平均成功率 86.8%超 RVT-2 达 5.4pp且 9/18 任务排名第一。高精度任务增益最大Insert Peg 超 RVT-2 达 44%约 2.1 倍Sort Shape 提升 29%——多分辨率嵌入对精细操作的价值最显著。环境扰动鲁棒性光照、桌面颜色等扰动下 Colosseum 掉点仅 -4.3%±3.6RVT-2 为 -19.5%比 RVT-2 稳 15.2pp个别扰动类别甚至出现正增益。记忆是决定性组件MemoryBench 上无记忆 SAM2Act55.0%与 RVT-254.0%持平SAM2Act 以 94.3% 大幅领先37.6pp 全部来自记忆架构本身。真机泛化可落地总成功率 75% vs RVT-2 的 43%高精度灯旋钮任务 60% vs 0%记忆任务同一按钮按两次70% vs 40%。消融验证每处设计去多分辨率嵌入 RLBench -1.1pp、Colosseum -14.8ppSAM 编码器替换 -6.0ppSAM2 → DINOv2 / Depth Anything V2 均更低。局限性不支持灵巧连续控制仅覆盖关键帧位姿级 6-DoF 操作难以扩展到连续、灵巧操控场景。固定记忆窗口记忆窗口长度因任务手工设定8 或 10无法自适应不同长度的任务。记忆限于空间信息记忆编码器只吃平移热图无法保留语义信息如颜色。单任务训练设置MemoryBench 上各任务独立训练并选择最优 epoch尚未验证多任务记忆泛化。作者展望是迈向具备空间记忆能力的 generalist manipulation policies并扩展记忆窗口与语义维度。常见问题FAQSAM2Act 和 SAM2Act 有什么区别SAM2Act 是把 SAM2 的多分辨率视觉嵌入 级联上采样融入 RVT-2 骨干解决精度与泛化SAM2Act 额外把 SAM2 的记忆库、记忆编码器、记忆注意力迁入 coarse 分支让策略具备空间记忆解决需要回忆历史动作的任务。MemoryBench 为什么能打破马尔可夫假设它构造了两条不同动作历史 → 同一视觉观测 → 却需要不同动作的场景例如关抽屉、按按钮后三个抽屉视觉上不可区分策略必须回忆刚才关的是哪个抽屉才能重开原抽屉。纯马尔可夫策略只看当前观测必然失败随机基线仅 33%。为什么记忆组件能带来 37.6pp 的提升无记忆的 SAM2Act55.0%与 RVT-254.0%在 MemoryBench 上几乎持平说明基线方法在记忆任务上已到瓶颈SAM2Act 通过记忆注意力在历史热图序列上做检索把当前观测 动作历史共同作为决策依据直接补上了缺失的信息维度。训练需要多少算力和数据模型在 32 块 H100/A100 上训练 90 epochs / 56.25K stepsRLBench 每任务 100 条演示SAM2 编码器仅用 LoRA rank 16 适配且预训练后冻结编码器与 fine 分支只微调 coarse 分支适配成本很低。SAM2Act 只能做关键帧位姿级别的操作吗是的当前局限正在于此它输出关键帧位姿 OMPL 运动规划不支持连续灵巧操控这也是作者列出的首要局限与未来方向。代码和项目开源了吗官方项目页 https://sam2act.github.io/ 提供论文、项目介绍与代码仓库链接arXiv 全文见 https://arxiv.org/abs/2501.18564。参考链接SAM2Act 论文arXivhttps://arxiv.org/abs/2501.18564SAM2Act 官方项目页https://sam2act.github.io/SAM 2: Segment Anything in Images and VideosICLR 2025https://arxiv.org/abs/2408.00714RVT-2: Learning Precise Manipulation from Few DemonstrationsCoRL 2024https://arxiv.org/abs/2406.08545Perceiver-Actor: A Multi-Task Transformer for Robotic ManipulationCoRL 2023https://arxiv.org/abs/2209.00151SAM-E: Leveraging Visual Foundation Model with Sequence Imitation for Embodied Manipulationhttps://arxiv.org/abs/2405.19586Segment AnythingICCV 2023https://arxiv.org/abs/2304.02643给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
返回列表