更新日期:2026-08-06 范围:Vision-Language-Action、长时程操作、部分可观测决策与机器人记忆
长时程机器人操作往往不满足马尔可假设。当前观测可能无法表示已离开视野的对象、早期交互结果、任务进度与隐含规则,因此策略必须建模历史。
本文将现有工作分为 episode 内策略记忆、跨 episode 与系统级记忆、训练与优化范式、数据集与评测四个层次。其中,episode 内记忆再按主要表示与更新机制细分。
本综述关注记忆如何支持机器人的闭环感知与动作决策。核心问题是:在可控的计算、延迟与存储成本下,从历史中保留哪些信息,以何种形式保留,以及何时写入和读取。
本文主要覆盖单 episode 内的感知、动作与任务状态记忆,同时纳入跨示范经验检索、高层规划记忆和终身记忆。纯静态多帧输入只在其构成有意义的历史基线时纳入。
本文以记忆的作用范围为一级分类,以核心表示与更新机制为二级分类。每篇论文按其主要贡献归入一类;梯度路径、记忆模态和读写策略作为横切属性讨论。
| 层次 | 分类 | 关键特征 |
|---|---|---|
| Episode 内 | 固定窗口与密集历史 | 直接编码近期或较长观测序列 |
| Episode 内 | 显式记忆库与压缩 | 维护可检索、可合并或固定容量的记忆 |
| Episode 内 | 事件与关键帧 | 仅保留预计对未来决策有用的稀疏历史 |
| Episode 内 | 递归状态与全历史模型 | 通过循环状态或线性时序模型传播历史 |
| Episode 内 | 结构化记忆 | 以对象、空间、场景、运动或概念为基本单元 |
| Episode 内 | 语言、动作与多模态记忆 | 使用视觉之外的可解释或控制相关信息 |
| 跨 Episode | 经验与系统级记忆 | 检索过去示范、技能、知识或长期环境状态 |
这类方法保留规则采样的历史观测或压缩后的逐帧表征。优点是信息路径直接、易于复用预训练模型;限制是成本通常随上下文长度增长,且冗余帧可能稀释关键证据。
显式记忆方法将历史作为可管理的外部或潜在容器。其研究重点是容量约束下的写入、合并、替换、检索与当前状态融合。
这类方法不均匀保留历史,而是根据语义、运动学、视觉差异或预计未来效用选择事件。稀疏记忆可降低计算量,但其性能受事件判定的召回率与时序信用分配影响。
| 论文 | 事件选择方式 | 读写特点 |
|---|---|---|
| EventVLA: Event-Driven Visual Evidence Memory for Long-Horizon VLA Policies | 预测历史帧的未来效用 | 结合初始、近期与动态事件关键帧 |
| KEMO: Event-Driven Keyframe Memory for Long-Horizon Robot Manipulation with VLA Policies | 运动学事件检测与视觉差异过滤 | 关键帧交叉注意力读取 |
| Non-Markovian Long-Horizon Robot Manipulation via Keyframe Chaining | 从全历史选择关键帧 | 历史与当前视觉 token 交错输入 |
| BPP: Long-Context Robot Imitation Learning by Focusing on Key History Frames | 利用现成 VLM 问答选择语义关键帧 | 外部模型驱动的稀疏记忆 |
| WeaveLA: Event Driven Cross-Subtask Latent Memory Weaving | 在子任务完成时写入 | 将压缩记忆传递给下一子任务 action expert |
| DiM-WAM: World-Action Modeling with Diverse Historical Event Memory | 不同历史事件分库存储 | 库内相似度合并与任务进度监督 |
| Chameleon: Control-Indexed Prospective Memory for Visuomotor Manipulation | 写入 geometry-grounded embodied event | 可微记忆栈形成面向控制的 prospective state |
| CycleManip: Enabling Cyclic Task Manipulation via Effective Historical Perception | cost-aware 历史采样 | 面向重复动作和正确终止时间 |
| Bi-HIL: Bilateral Control-Based Multimodal Hierarchical Imitation Learning | 以子任务进度率识别并写入关键帧 | 面向接触丰富操作的层次化记忆 |
递归方法将历史浓缩为跨控制时刻传播的状态,其推理成本可与 episode 长度解耦。全历史模型则通过 SSM 或 Mamba 顺序扫描轨迹,在保留长范围信息的同时控制复杂度。
结构化方法不将历史视为无差别 token 序列,而是显式维护对象、位姿、轨迹、关系、概念或场景 belief。这类表示更适合处理视野外对象、空间一致性与可解释推理。
视觉历史并非唯一记忆载体。动作历史可表示已执行的行为与任务进度,语言可将对象位置、子目标与规则外显化,运动表征则强调交互变化而非静态外观。
跨 episode 记忆将可用历史从当前轨迹扩展到过往示范、经验库、任务先验和持续更新的环境知识。这些方法通常在高层规划、技能调度或长期知识管理中使用记忆。
长期记忆的监督不必仅来自当前动作损失。部分方法通过重建过去、预测交互效果、估计任务进度或统一历史与未来运动来约束记忆表征。
| 论文 | 训练信号 | 目的 |
|---|---|---|
| Action-Effect Memory Pretraining for Robot Manipulation | 动作及其环境效果 | 学习 interaction consequence 而非仅压缩观测 |
| Recurrent-Depth VLA | 动作头迭代 refinement | 深度方向的递归推理,不等同于 episode 时间记忆 |
| AVA-VLA | 连续观测短窗口展开 | 学习跨真实控制时刻的递归状态 |
| Generalizable Task Planning through Representation Pretraining | 合成场景理解数据中的对象级表示预训练 | 以参数化语义与几何先验提升未见对象上的多步操作规划泛化 |
| CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation | 多轮交互、结构化执行反馈、视觉差分与技能合成 | 扩展 agentic test-time computation,并以可验证奖励强化 Code-as-Policy 控制器 |
| Foresight Residual RL for Long-Horizon Robot Manipulation with Vision-Language-Action Models | 当前子任务终态对应的下游 rollout 成功率 | 学习视觉 foresight predictor,并以未来子任务成功概率塑造残差策略的交接状态质量 |
| RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation | 子任务、技能、对象、接触点与运动轨迹等稠密中间表示 | 以结构化表示同时约束 VLA 动作执行与未来世界状态 rollout,并提供 23 万余条操作 episode 和时空 VQA 评测 |
| STeP: Signal Temporal Logic for Precise Specifications for Action Generation with Vision Language Models | 由语言生成的 Signal Temporal Logic 约束 | 以统一形式连接高层任务分解、低层控制、执行监控与重规划,使空间、时间和逻辑要求可检查 |
| Diffusion ReRoll: Revisable Denoising for Robotic Sequential Prediction | 对已稳定序列区域选择性重新加噪 | 让早期与未来片段在去噪过程中相互修正,统一改善长程规划、动作序列和视频—动作预测 |
| Koopman Dreamer: Spectrally Constrained Latent Dynamics for Stable World-Model Imagination | 带谱约束的 Koopman 潜在动力学 | 通过有界旋转—缩放模态、动作双线性项和多步目标控制长期想象的误差放大与信息保留 |
| PhysCoRe: Physics-Based World Modeling with Residual Correction for Robotic Manipulation | 可微 MPM、逐粒子材料参数估计与动力学残差修正 | 从少量交互中学习可校正的物理世界模型,并以不确定性引导探索和操作规划 |
| GS-Agent: A Multi-Agent System for Physically Plausible 4D World Generation | 资产、材质、布局、运动与渲染代理协作 | 将语言任务转化为受物理引擎约束的动态 4D 场景,为具身世界模型的数据生成与未来模拟提供工具链 |
| Action-Conditioned World Model for Goal Plane Probe Guidance in Robotic Ultrasound | 近期超声帧、探头动作与时间偏移 | 以潜在条件 diffusion 预测未来超声观测,再用冻结世界模型的奖励训练目标条件动作序列并执行真机闭环引导 |
| ViTacWorld: Scaling Visuo-Tactile World Models for Contact-Rich Robot Manipulation | 动作条件的视觉—触觉未来轨迹 | 联合预测时间对齐的图像和触觉反馈,以生成 rollout 扩充接触操作训练数据并评估策略结果 |
| Robot-Factored World Models via Robot Rendering | 控制器展开的名义轨迹与渲染机器人几何 | 将动作实现和机器人外观从生成模型中因式分解,避免未来状态泄漏,并以统一视觉接口泛化到未见机器人 embodiment |
| $N_0$-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation | 未来视觉、接触与动作;NeoForce 统一力觉表示 | 在 6 种 embodiment、450 个任务上进行视觉—触觉联合预训练,并以接触事件推进长程多阶段操作 |
| LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments | foundation latent 空间中的预测语义和物理动态 | 以 JEPA World-Anchor 和 ISAE 替代像素级未来生成;训练时用动力学专家指导动作 diffusion,部署时裁除专家实现零额外开销 |
| FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking | 动作真正执行时的视觉表征与本体状态 | 用状态校正和 motion-aware 特征传输弥补异步 VLA 的预测—执行错位,并以策略一致性损失平滑连续 action chunks |
| DeVA: Decoupled Video-Action Model with Physical Guidance for Robot Policy Learning | 视频未来表征、affordance 与深度 | 将视频和动作预测拆为专用专家,通过多层特征传递把时空动态知识注入动作策略,提高小数据学习和真机泛化 |
| FeelWorld: Visuo-Tactile World Model for Hierarchical Contact Prediction and Planning | 未来视觉 latent、接触状态、3D 力觉 latent 与滑动状态 | 以 contact-gated attention 在自由空间和接触阶段切换预测路径,并通过自回归 rollout 支持接触感知 CEM 规划 |
| τ: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision | 动作条件的时空触觉表示 | 用 JEPA 风格未来视觉 latent 监督触觉表征并融合 VLA;监督仅在训练期间使用,不增加部署计算 |
| VisualPatchWorld: Code World Models as Latent Structured Representations for Planning | 主动探测、状态—动作轨迹与可执行动力学代码 | 先选择定性动力学形式再拟合自由参数,得到可检查、可编辑且可 rollout 的代码世界模型供 MPC 使用 |
| Temporal-Distance JEPA: Plan-Aware Representation Learning for Latent World Model Predictive Control | 轨迹先后关系、跨轨迹负样本与 rollout consistency | 从无奖励日志学习有方向的时间距离,使 latent 同时表达目标进度并直接充当多步规划 cost |
| SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models | SAM3D 对象级 3D 教师表征 | 训练时将细粒度 3D 对象先验对齐到 π₀ 中间视觉特征,部署仍只用 RGB—语言输入,并改善跨子任务目标切换 |
| DC-WAM: Dynamic-Centric Visual Supervision and Reasoning for World-Action Models | temporal-difference flow、轨迹加权与动态相关 future tokens | 将未来监督从外观重建重定向到夹爪、对象和接触区的交互动态,并以 DynaRoute attention bias 聚焦控制相关变化 |
| INTACT: Isomorphic Intent-to-Action Learning for Search-Free World Models | 局部物理意图 |
用共享 JEPA 表示把未来 latent 差分直接映射为动作分布,免除传统世界模型的大规模候选序列搜索 |
| ContactFlow: Learning Actionable 3D Interaction Flow from Human and Robot Videos | 人与物体之间、跨 embodiment 的 3D 接触点轨迹 | 用人类与机器人视频训练世界模型,以 propose–imagine–verify–act 闭环预测并验证可执行的交互运动 |
| Enfold: Distilling Future into the Present for Efficient Visuomotor Policies | 未来生成器多层中间状态蒸馏得到的当前时刻预测表征 | 仅在训练期使用未来生成器,部署时以当前观测保留未来信息并降低 3.7–10.1 倍推理延迟 |
| ActSWM: Learning Action-Sensitive World Models for Embodied Agents | 对替代动作保持可区分性的未来 latent | 通过动作可恢复的局部转移约束缓解 context collapse,使世界模型保留决策所需的动作因果差异 |
| CheckVLA: Event-Driven World-Model Verification for Vision-Language-Action Policies | 动作条件世界模型与事件驱动关键帧库 | 以 conformal 阈值核验执行结果、重写动作后缀,并用关键事件记忆维持长程任务进度 |
| Temporally Centered SIGReg for Long-Horizon Vision-Language-Action Learning | 相对时间中心的 latent residual | 只正则化时间残差而非完整 latent 边缘分布,减少跨任务表示混叠并提升长程操作性能 |
| What Can Latent World Models Know? Physical Parameter Identifiability from Multimodal Prediction | 由视觉、触觉及预测目标共同决定的物理属性 latent | 证明输入决定可识别信息、预测目标决定保留信息;只有要求预测触觉时,表征才可靠编码刚度等隐含物理参数 |
| TacWAM: Anchor-Guided World Action Model with Mechanics-Aware Tactile Prediction | 未来视觉、触觉、稠密力场、形变流与动作 | 以 mechanics-aware tactile prediction 表达接触阶段视觉难以观测的力、形变、剪切与滑动,同时阻止未来触觉成为动作生成的特权信息 |
| World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models | VLM 动作提案与 pose-image 条件未来 rollout | 在世界模型想象结果上进行优化和搜索,迭代修正初始计划以提升新场景和组合任务中的决策泛化 |
| QuantWAMs: Calibrating at the Right Granularity for World Action Models | 面向闭环 rollout 分布的量化校准 | 按模型结构、部署轨迹和任务目标选择校准粒度,降低世界—动作联合预测的迭代去噪与闭环执行成本 |
| WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning | 过去 |
以 instruction-conditioned causal Transformer 形成可更新 predictive state,使 VLA 的 RL critic 在部分可观测任务中学习跨时刻动力学 |
| FBFM: A Training-Free Asynchronous Feedback Mechanism for Flow-Matching in World-Action Models Execution | 前一动作 chunk 与执行后的真实图像 | 在下一 chunk 的 flow-matching 生成过程中异步注入细粒度真实反馈,持续 re-ground 并抑制长时程预测漂移 |
| BWM: A Low-Cost High-Fidelity World Simulator for Robot Learning | 初始环境锚点、动态视觉历史与时间对齐动作 | 进行有状态自回归未来预测,并作为 imitation-learning 数据引擎和闭环策略评估、风险预判与排名工具 |
| ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies | rollout 时间上下文与阶段感知逐帧价值标签 | 同时输出平滑的优势估计和尖锐的错误检测信号,以因果 critic 表示任务进度并定位长程执行失败 |
| UniNav: A Unified World-Action Diffusion Model for Visual Navigation | 历史帧、目标图像、未来视觉与 waypoint 联合监督 | 在同一 diffusion Transformer 中联合生成未来观测和连续导航轨迹,并以 geometry-aware camera tokens 增强空间 grounding |
| LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation | 未来状态预测与动作生成共同塑造的紧凑 latent | 以 Visual Transition Token 表达无语言任务方向,可在单张 24 GB GPU 上端到端训练世界—动作模型 |
| EmbodiedVAE: Disentangled Video VAE for Efficient and Controllable Embodied Manipulation | 解耦机械臂运动与背景的紧凑视频 latent | 通过非对称时空压缩和最优传输一致性约束,为操作世界模型保留可控动作变化与跨帧运动连续性 |
| Unified Visuomotor Targets: Supervising VLAs Beyond Physical Actions | 联合编码动作控制与视觉场景转移的 latent target | 不改变架构或增加数据,通过预测统一视觉运动目标提升 VLA 的训练效率、策略性能和环境鲁棒性 |
| Track4Action: Distilling World-Centric 3D Tracker into Vision-Language-Action Policies | 未来 |
训练时将几何、运动、可见性和相机变化蒸馏进当前观测 VLA,部署时移除未来 clip 与 tracker |
| GORDON: Graph-based Object-centric Rewards for Decomposition of Long-Horizon Manipulation | 对象—空间关系图与任务进度 latent | 从无动作视频学习稠密进度奖励,并由奖励时间曲线自动发现对象状态转移和长任务子阶段 |
| Overcoming Statistical Bias in Action-Controllable World Models | 逆动作、零动作与镜像场景的反事实一致性 | CoCo 抑制视觉惯性和重复运动捷径,并以 ARC、Drift Energy 与 Mini-SSMB 检验未来是否真正受动作控制 |
| WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models | 可逆闭合动作循环的空间回归与时间一致性奖励 | 无需真实未来标注即可约束长程 rollout 的状态返回误差,并以 CycleBench 诊断组合动作下的累积漂移 |
| DreamWAM: Beyond RGB Future Prediction for World Action Models | 外观、运动、几何与语义的结构化未来监督 | 联合 RGB/运动 latent denoising 与几何/语义残差分支,将动作相关未来状态注入 ActionDiT,部署时仍只需 RGB |
| LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models | 多视角不变 action token、3D 几何对齐与非单射 RGB-D 重建 | 抑制未来帧外观泄漏,从无标注人类视频学习可迁移的 3D-aware latent actions |
| PhyLatent: Learning Dynamics-Relevant Representations for JEPA World Models | 物理状态 grounding、未来表征对齐与反事实分支分离 | 避免 JEPA latent 丢失物理状态、动作后果或替代动作动力学,提高 MPC 的预测状态可靠性 |
| Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models | 将未来真实帧的语义 foresight 对齐到动作流 query tokens | 保留 VAE 生成预训练,同时让动作依赖外观不变的未来动态以增强视觉 OOD 鲁棒性 |
| GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions | URDF 渲染 visual actions 与自回归视频预测 | 解耦 embodiment 运动学和环境动力学,支持闭环交互、策略评估与合成轨迹生成 |
| $\omega$-0: A Latent Predictive World Action Model for Concurrent Humanoid Loco-Manipulation | 紧凑未来观测 embedding 与 diffusion whole-body action latent | 不重建未来视频,以 latent visual foresight 支持人形机器人同步移动、平衡与操作 |
方法的前向历史范围与反向梯度范围并不相同。递归状态可在整个 episode 内传播,同时只对最近若干步保留计算图;也可完全停止跨步梯度,或在轻量时序模块上执行完整轨迹反传。
| 训练范式 | 代表方法 | 说明 |
|---|---|---|
| Temporal TBPTT | μVLA、AVA-VLA | 状态跨物理时刻传递,梯度只回传固定步数 |
| 极短 horizon/固定更新 | ReMem-VLA | 长期传播由固定 EMA 完成,不依赖跨步梯度 |
| Detached streaming state | VPWEM | 前向信息可覆盖完整 episode,递归 cache 写入时停止梯度 |
| Full-trajectory backpropagation | Chronos | 完整梯度保留在轻量 temporal-action stack |
| Trajectory-wise full scan | MTIL、DSSP | 对完整轨迹执行因果扫描 |
| Recurrent-depth truncation | Recurrent-Depth VLA | 截断动作预测内的迭代深度,不是长期时间记忆 |
| Training-free memory | TempoFit | 不学习跨时刻状态,直接复用中间层 KV |
记忆方法应在真正需要历史的部分可观测任务上评估,而非仅延长近似马尔可夫任务的操作时间。常见能力包括对象位置、任务进度、短暂证据、隐含规则、程序和周期计数。
| 基准/论文 | 规模与记忆类型 | 环境 | 评测特点 |
|---|---|---|---|
| RoboMME | 16 个任务;temporal、spatial、object、procedural | 仿真;1,600 条示范、约 77 万帧 | 在统一 π0.5 backbone 上比较 14 种表示—融合变体,并提供 no-memory、symbolic oracle 与 memory-budget 对照 |
| RMBench | 9 个任务;5 个 M(1) 与 4 个 M(n) |
仿真 benchmark,另有真机实验 | 区分固定少量历史与重复探索/试错记忆;主要指标为完整任务成功率 |
| MIKASA / MIKASA-Robo | 32 个桌面任务、12 个任务组;object、spatial、sequential、capacity | ManiSkill 仿真 | 提供显式 oracle information、可参数化难度及专家轨迹,覆盖 online/offline RL 与 VLA |
| MemoryBench / SAM2Act+ | 3 个任务;空间记忆与动作回忆 | RLBench/CoppeliaSim 仿真 | Reopen Drawer、Put Block Back、Rearrange Block;任务直观但范围较窄 |
| LIBERO-Mem | 10 个非马尔可任务;object、order/sequence、counting | LIBERO 仿真 | 对象级部分可观测,关键证据与后续决策可跨数百帧 |
| MemoryRTBench / MemoAct | 4 个主要仿真任务,另有 2 个真机任务;状态跟踪与长期保持 | RoboTwin 2.0 与真机 | 分别诊断无损短期记忆和压缩长期记忆 |
| RoboTwin-MeM / EventVLA | 17 个仿真任务与 4 个真实双臂任务 | RoboTwin 与真机 | 关注交互中短暂出现、随后消失的视觉证据 |
| RuleSafe / VQ-Memory | key、password 与 logic lock | articulated-object 仿真 | 用规则驱动的多阶段任务测试任务阶段、本体感觉与逻辑记忆 |
| RoboMemArena | 26 个任务,平均轨迹超过 1,000 environment steps | 仿真与 5 个配对真机任务 | 68.9% 子任务被标注为 memory-dependent;提供子任务指令和原生关键帧标注,并报告 TSR/CSR |
| ReMemBench / PRISM | 8 个家庭操作任务;spatial、prospective、associative、object-set | 仿真与真机适配 | 将短期记忆扩展到约 2 分钟,并研究 history length、注意力和计算成本 |
| KineBench | 20 个 ManiSkill3 操作任务;具身世界模型闭环评测 | 从生成视频提取 6D 末端位姿并在物理模拟器执行 | 避免 IDM 误差混淆,联合任务成功、轨迹平滑度和运动学可行性评估未来世界预测 |
| AXIS: A Scalable Data Engine for Generalist Robot Manipulation | 207 个任务、超过 5 万条轨迹;可扩展机器人数据基础设施 | 浏览器遥操作与自动化任务生成、验证、过滤、轨迹平滑和增强 | 持续预训练 π0.5 后平均提升 5.8%,相对 RoboCasa365 提升 37.3%,用于检验数据覆盖对通用操作能力的影响 |
| RoboMME-Interference: Benchmarking Robot Memory Under Interference | 跨 session 相关示范与可控数量的无关历史 | RoboMME 长上下文扩展 | 感知记忆随干扰 session 增加而持续衰减;新版表明先按视觉相似度检索相关示范可在各干扰级别恢复无干扰成功率 |
| ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine | 150 小时、1,700 万帧、75,000 个 episode;长程多模态交互 | 200 类任务、50 名参与者、2 个真实家庭环境;同步第一/第三视角、全身和手部运动、对象 6-DoF、音频与触觉 | 分层评测从感知信号、场景组件扩展至完整交互,暴露接触、遮挡、自运动和长时程条件下的能力缺口 |
| XEWorld: Can Action-Conditioned World Models Generalize to Unseen Robot Embodiments? | 物理场景保持一致、机器人 embodiment 留出的受控评测 | 跨机器人操作世界模型 | 区分物理动力学迁移与二维外观匹配,并检验零样本迁移、少样本适配及灾难性遗忘 |
| GAUGE: A Measurement-Grounded Benchmark for Physical Fidelity in Simulation Engines and Video World Models | 22 类真实轨迹驱动任务;刚体、绳缆、织物与体变形 | 物理引擎及视频世界模型 | 以校准物理参数和任务特定观测量检验碰撞、摩擦、动量、振荡、接触与形变保真度 |
这类基准直接评估记忆和行动的结合,但输出通常是导航动作、高层计划或问答,而非机械臂低层控制,因此不与操作基准等权比较。
| 基准 | 主要范围 | 行动与输出边界 |
|---|---|---|
| FindingDory | Habitat 中 60 类可扩展长程任务,历史约 400–3,500 帧 | 评测阶段执行离散导航动作;物体操作由历史采集阶段的 oracle 完成 |
| MEMENTO | 个性化 object rearrangement;对象语义、用户习惯与联合记忆 | 两阶段 acquisition/utilization,以含糊指令测试 episodic/personalized memory |
| LMEE-Bench | HM3D 中 1,982 个长期记忆导航与问答任务 | 输出导航动作、frontier 或答案,不含机械臂控制 |
| MemoryEQA / MT-HM3D | 1,587 个跨目标、跨区域 active EQA 任务 | agent 主动导航收集证据后回答问题 |
| RoboBench | 5 个维度、14 项能力、25 类任务与 6,092 个 QA;含时空推理和 memory-driven navigation | 评估 MLLM embodied brain 的理解、感知推理、规划、affordance 与失败分析,不直接评测低层闭环控制 |
| BEHAVIOR Robot Suite | 真实家庭环境中的双臂、移动和躯干全身操作平台 | 提供长距离导航及 articulated/deformable object 任务;可承载长程记忆评测,但不是专用记忆基准 |
| MultiON | 按指定顺序寻找多个目标 | 经典空间/语义地图记忆与闭环导航基准 |
| WorldLines | 跨日 household traces、状态覆盖与用户历史 | 评估 Memory QA 和 embodied task planning,不执行低层闭环动作 |
| Beyond Episodic Evaluation: Memory Architectural Bottlenecks in Sequential Embodied Question Answering | 同一场景连续提问并跨查询保留记忆;比较占据图与持久视觉—语义 3D 记忆 | 揭示仅保留二维可通行性不足以回答后续问题;将视觉证据绑定度量 3D 几何可同时改善问答准确率与导航效率 |
| VoLN: Vision-Only Long-Horizon Navigation | 7,210 个连续 3D 无人机长程导航 episode;大视点变化与上下文相关信标选择 | 仅用视觉、目标视图、观测历史、检索式视觉—语义 token 和本体状态进行导航,诊断长程视觉记忆与目标识别能力 |
| Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents (MissionBench) | 5 个模拟 3D 环境、4 类共 120 个长程空中任务 | 智能体仅依靠第一视角观测与动作历史自主规划、导航和报告;22 个 MLLM 中最强成功率仍低于 35% |
| Mag4D-SLAM Dataset: A Repeated-Traversal Multi-Modal 4D Geomagnetic Dataset for Localization and Mapping | 超过 18 km 的昼夜、正反向重复遍历;LiDAR、相机、IMU、磁力计与 GNSS | 面向跨 session 地点识别、磁航向约束、回环检测与视觉退化条件下的长期定位 |
| HumanCLAW: A Benchmark for Long-Horizon Egocentric Find–Navigate–Interact Tasks | 41 个真实场景中的 1,218 条长程第一视角任务轨迹 | 联合评测搜索、导航、交互和进度记忆;9 个 VLM 中最佳成功率仅 16.8%,主要瓶颈是身体、碰撞与任务进度的自我状态追踪 |
| Embodied Agents Take Control: General-Purpose Software Agents for Zero-Shot Visual Navigation | 持续 perceive–act–verify–correct 的零样本具身控制循环 | 通用软件智能体可直接闭环导航,但长任务中延迟和上下文持续增长会导致性能显著下降,揭示长程记忆与上下文管理瓶颈 |
| StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding | 243 个完整视频、平均 88.8 分钟;3,646 个开放式问答 | 评测实时感知、历史回溯、主动交互与工具使用;StreamMind 以异步前后端构建持久多模态记忆,但不执行机器人低层控制 |
| GST-Bench: Can VLMs Develop Global Spatial Awareness from Video? | 6,790 分钟连续视频中的全局空间推理 | 要求从长时第一视角观测形成一致场景表示并映射到俯视图;输出为 VQA 而非动作 |
| 基准/协议 | 用途 | 与机器人操作的距离 |
|---|---|---|
| Memory Maze | 随机 3D maze、online RL、offline dataset 与 memory probing | 有闭环动作,专门隔离长期定位记忆,但不是操作任务 |
| POPGym | 15 个 POMDP 与多种 recurrent/attention baseline | 通用抽象控制,可用于比较记忆架构 |
| Memory Gym | 2D POMDP、endless variants、长度泛化与噪声鲁棒性 | 诊断性强,但非具身机器人环境 |
| POBAX | 筛选 memory-improvable 环境并比较 observation-only/state gap | 适合作为部分可观测评测方法学参考 |
| MEMBOT Intermittent-POMDP Protocol | 向 MetaWorld 与 RoboMimic 的 10 个任务注入 observation dropout | 是基于已有环境的鲁棒性协议,不是独立 benchmark |
| RoboMME-Interference | 在相关 session 前加入 0/1/3/7 个无关 session | 显式测试跨 session 干扰、历史距离和记忆污染 |
| Reward Structure Shapes the Interaction Between Episodic Exploration and Neural Memory in Reinforcement Learning | 正交比较 episodic exploration bonus、神经记忆架构与三类奖励结构 | 用 observation-anchored reward machines 区分 structural/potential sparsity,揭示探索负责暴露证据、记忆负责把证据转化为回报 |
仅增加轨迹长度或输入帧数不能证明任务需要记忆。较严格的 benchmark 应至少满足以下判据:
- State-aliasing pair:存在当前观测近似相同、但因历史不同而要求不同最优动作的状态对。
- History intervention:固定当前状态,仅删除、替换或打乱关键历史时,正确动作或目标随之改变。
- Matched controls:同时报告 no-history、matched-compute recent window、random/shuffled/wrong memory 与 full-history 对照。
- Oracle decomposition:分别提供 privileged-state oracle、最小充分记忆 oracle,以及必要时的 oracle low-level controller,以区分检索、推理与控制失败。
- Scaling curves:按证据延迟、需保存事实数量、遮挡持续时间、memory budget 与 distractor 数量报告性能曲线,而非只报告平均轨迹长度。
建议统一报告完整任务成功率、子任务完成率/CSR、记忆关键决策点准确率、至少 3 个随机种子与置信区间,并披露训练/测试的场景、物体、布局、语言模板和生成器 seed 隔离方式。系统成本应包含 memory token/frame 数、最大与平均 context、显存、延迟和控制频率。可进一步报告:
[ \text{Memory Gap}=S_{\text{oracle-memory}}-S_{\text{no-memory}}, ]
[ \text{Normalized Memory Recovery}= \frac{S_{\text{method}}-S_{\text{no-memory}}} {S_{\text{oracle-memory}}-S_{\text{no-memory}}}. ]
常见评测陷阱包括当前画面残留答案、机械臂姿态或固定动作时长泄露阶段/计数信息、语言模板和 GT subtask/keyframe 标注泄露任务进度、不同上下文长度导致计算量不匹配,以及完整任务成功率将记忆错误与感知、规划和低层控制错误混合。
| 维度 | 关键问题 |
|---|---|
| 作用范围 | 记忆服务于当前 episode、跨示范检索,还是终身知识管理? |
| 表示单元 | 历史被表示为帧、token、关键事件、对象、动作、语言还是递归状态? |
| 容量与成本 | 计算、显存、存储与推理延迟如何随 episode 长度增长? |
| 写入与遗忘 | 系统如何判定重要性、冗余性、时效性和替换优先级? |
| 读取与融合 | 历史是通过全量注意力、相似度检索、交叉注意力、门控还是状态传播注入策略? |
| 训练梯度 | 前向历史范围与反向梯度范围是否一致? |
| 评测有效性 | 任务是否确实需要早期证据,并能区分记忆收益与模型规模收益? |
- 重要性与可压缩性的冲突:短暂出现的证据可能低频但决定任务成败,而重复背景虽高频却信息量低。
- 前向记忆与长程信用分配:保留完整前向历史并不意味优化信号能到达早期状态。
- 多模态一致性:视觉、动作、语言、本体感觉与空间地图可能具有不同采样频率和遗忘规则。
- 评测标准化:尚需统一报告记忆容量、计算开销、推理延迟、历史跨度与不同记忆类型的成功率。
- 从 episode 内记忆到终身学习:如何避免长期知识污染、错误累积和不相干经验干扰,仍缺少统一解法。
| 论文 | 覆盖范围 | 用途 |
|---|---|---|
| 大模型记忆系统分析框架 | 参数化/显式记忆、系统分层、原子操作、生命周期、分类与机器人映射 | 作为后续论文方法卡片和统一分析维度 |
| Large VLM-based VLA Models for Robotic Manipulation: A Survey | 大型 VLM-based VLA 的架构、训练、world model、memory 与效率 | 完善 VLA related-work taxonomy |
| A Survey on VLA Models for Embodied AI | VLA 方法、数据、基准与能力 | 持续追踪领域进展与查漏补缺 |