双向解码:通过引导测试时采样改善动作分块

Yuejiang Liu∗, Jubayer Ibn Hamid∗, Annie Xie, Yoonho Lee, Maximilian Du, Chelsea Finn
斯坦福大学计算机科学系

摘要
无需中间重新规划即可预测和执行动作序列的能力(称为动作分块)在从人类演示中进行机器人学习的领域中应用日益广泛。然而,其对学习策略的影响存在不一致性:部分研究发现它对取得强性能至关重要,而另一些研究则观察到性能下降。本文首先剖析了动作分块如何影响学习者与演示者之间的差异。我们发现,动作分块使学习者能够更好地捕捉演示中的时间依赖关系,但代价是对意外状态的反应性降低。为解决这一权衡问题,我们提出了双向解码(BID),这是一种测试时推理算法,将动作分块与闭环自适应相结合。在每个时间步,BID 对多个候选预测进行采样,并基于两个标准搜索最优解:(i)向后一致性,倾向于与先前决策一致的样本;(ii)向前对比,寻找对未来计划具有高似然性的样本。通过耦合动作块内和块间的决策,BID 同时促进了长期一致性和短期反应性。实验结果表明,我们的方法在七个仿真基准和两个真实世界任务中提升了两种最先进生成策略的性能。视频和代码可在https://bid-robot.github.io获取。

1 引言

人类演示数据的日益丰富激发了对行为克隆 **【Atkeson & Schaal, 1997 的 "Robot Learning From Demonstration";Argall et al., 2009 的 "A survey of robot learning from demonstration"】的新兴趣。特别是最近的研究强调了从大规模演示中学习以获得各种复杂技能的潜力【如 Zhao 等人 2023 年的 "Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware"、Chi 等人 2023 年的 "Diffusion Policy: Visuomotor Policy Learning via Action Diffusion"、Fu 等人 2024 年的 "Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation"、Lee 等人 2024 年的 "Behavior Generation with Latent Actions"、Khazatsky 等人 2024 年的 "DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset"】。然而,现有方法仍难以处理人类演示的两个常见特性:(i)多步之间的强时间依赖关系,如空闲停顿【Chi 等人 2023 年 "Diffusion Policy"】和潜在策略【Xie 等人 2021 年的 "Learning Latent Representations to Influence Multi-Agent Interaction"、Ma 等人 2024 年的 "Hierarchical Diffusion Policy for Kinematics-Aware Multi-Task Robotic Manipulation"】;(ii)不同演示之间的风格可变性,如熟练程度差异【Belkhale 等人 2024 年的 "Data quality in imitation learning"】和偏好【Kuefler & Kochenderfer, 2017 的 "Burn-in demonstrations for multi-modal imitation learning"】**。通常,这两种特性在收集的数据中普遍存在但未被标注,给传统的将输入状态映射到动作的行为克隆带来了重大挑战。

为应对这些挑战,近期工作采用了配备动作分块的生成式方法:(i)预测多个时间步的动作序列并执行全部或部分序列 **【Zhao 等人 2023 年的 "Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware"、Chi 等人 2023 年的 "Diffusion Policy: Visuomotor Policy Learning via Action Diffusion"】;(ii)对动作块的分布进行建模,并以独立【Chi 等人 2023 年 "Diffusion Policy"、Prasad 等人 2024 年的 "Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation"】或弱依赖【Janner 等人 2022 年的 "Planning with Diffusion for Flexible Behavior Synthesis"、Zhao 等人 2023 年的 "Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware"】的方式从学习模型中采样以进行顺序决策。一些研究发现该方法在实验室场景中对学习高性能策略至关重要【Zhao 等人 2023 年的 "Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware"、Chi 等人 2023 年的 "Diffusion Policy: Visuomotor Policy Learning via Action Diffusion"】,而其他近期工作则报告了在实际条件下的相反结果【Lee 等人 2024 年的 "Behavior Generation with Latent Actions"】**。这些矛盾观察背后的原因尚不清楚。

本文首先通过考察学习策略与人类演示之间的差异来剖析动作分块的影响。我们发现,当策略基于有限的上下文长度构建时(为了鲁棒性或效率,仅使用很少或没有历史作为输入 **【Mandlekar 等人 2020 年的 "IRIS: Implicit Reinforcement without Interaction at Scale for Learning Control from Offline Robot Manipulation Data"、Bharadhwaj 等人 2023 年的 "Roboagent: Generalization and efficiency in robot manipulation via semantic augmentations and action chunking"、Brohan 等人 2023 年的 "RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control" 和 "RT-1: Robotics Transformer for Real-World Control at Scale"、Shi 等人 2023 年的 "Waypoint-Based Imitation Learning for Robotic Manipulation"、Open X-Embodiment Collaboration 2023 年的 "Open X-Embodiment: Robotic Learning Datasets and RT-X Models"】**),增加动作块的长度允许对更多过去动作进行隐式条件处理,从而提高其捕捉演示中固有时间依赖关系的能力。然而,这一优势的代价是减少了对近期状态观察的访问,而这对于应对由建模误差或环境随机性引起的意外动态至关重要。这种权衡引发了一个关键问题:如何在保持动作分块长期一致性优势的同时,避免其在短期反应性方面的局限性

为此,我们引入了双向解码(BID),这是一种将动作分块与闭环自适应相结合的推理算法。我们的核心思想是在每个时间步对多个预测进行采样,并搜索最理想的样本。具体而言,BID 基于两个解码标准运行:(i)向后一致性,倾向于与前一步选择的序列接近的样本;(ii)向前对比,倾向于接近更强策略的输出且远离较弱策略输出的样本。如图 1 所示,BID 基于先前策略更新未来动作块,促进了长时间的时间一致性,同时保持对意外变化的反应性。

图 1:应用于具有动作分块的机器人策略的不同推理方法示意图。机器人的任务是捕捉移动的手推车。(a)普通动作分块 **【Zhao 等人 2023 年的 "Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware"】基于先前预测执行动作,导致对物体运动的反应延迟。(b)滚动时域【Chi 等人 2023 年的 "Diffusion Policy: Visuomotor Policy Learning via Action Diffusion"】** 实现了更快的反应,但在存在多模态演示(如左撇子和右撇子)时会导致轨迹抖动。(c)我们的双向解码明确地从每个时间步采样的多个预测中搜索最优动作,实现了长期一致性和短期反应性。

本文的主要贡献有两个方面:(i)对动作分块的深入分析(第 3 节);(ii)改进动作分块的解码算法(第 4 节)。在实证方面,我们通过一维诊断仿真验证了我们的理论分析,并在七个仿真和两个真实世界任务中对两种最先进的生成策略评估了我们的解码方法(第 5 节)。我们的实验结果表明,所提出的 BID 使近期策略的性能相对提升了 32% 以上。BID 具有模型无关性、计算高效且易于实现,可作为即插即用组件在测试时增强生成式行为克隆。

2 相关工作

2.1 行为克隆

由于机器人遥操作界面的最新进展 **【Sivakumar 等人 2022 年的 "Robotic telekinesis: Learning a robotic hand imitator by watching humans on youtube"、Zhao 等人 2023 年的 "Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware"、Wu 等人 2023 年的 "Gello: A general, low-cost, and intuitive teleoperation framework for robot manipulators"、Chi 等人 2024 年的 "Universal manipulation interface: In-the-wild robot teaching without in-the-wild robots"】,从人类演示中学习在机器人学习中变得越来越流行。

对演示分布进行建模的生成式行为克隆因其算法简单性和实证有效性而特别吸引人【Jang 等人 2022 年的 "BC-z: Zero-shot task generalization with robotic imitation learning"、Florence 等人 2022 年的 "Implicit behavioral cloning"、Brohan 等人 2022 年的 "Rt-1: Robotics transformer for real-world control at scale"、Shafiullah 等人 2022 年的 "Behavior transformers: Cloning k modes with one stone"、Zhao 等人 2023 年的 "Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware"、Chi 等人 2024 年的 "Universal manipulation interface: In-the-wild robot teaching without in-the-wild robots"、Brohan 等人 2023 年的 "RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control"】。然而,一个显著的局限性是误差累积,即偏离训练分布的误差会随时间累积【Ross 等人 2011 年的 "A reduction of imitation learning and structured prediction to no-regret online learning"、Ke 等人 2021 年的 "Grasping with chopsticks: Combating covariate shift in model-free imitation learning for fine manipulation"】。这些误差可以通过收集专家修正数据【Ross 等人 2011 年同前、Kelly 等人 2019 年的 "Hgdagger: Interactive imitation learning with human experts"、Menda 等人 2019 年的 "Ensembledagger: A bayesian approach to safe imitation learning"、Hoque 等人 2021 年的 "Thriftydagger: Budget-aware novelty and risk gating for interactive imitation learning"】或在数据收集中注入噪声【Laskey 等人 2017 年的 "Dart: Noise injection for robust imitation learning"、Brandfonbrener 等人 2023 年的 "Visual backtracking teleoperation: A data collection protocol for offline image-based reinforcement learning"】来缓解,但这些策略需要人类操作员付出额外的时间和精力。

为解决这一问题,近期工作提出预测未来的多个动作序列,即动作分块,这减少了有效的控制时域【Lai 等人 2022 年的 "Action chunking as policy compression"、Zhao 等人 2023 年的 "Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware"、George & Farimani 2023 年的 "One act play: Single demonstration behavior cloning with action chunking transformers"、Bharadhwaj 等人 2023 年的 "RoboAgent: Generalization and Efficiency in Robot Manipulation via Semantic Augmentations and Action Chunking"】

通过处理动作序列,动作分块也更擅长处理数据中的时间依赖关系,如空闲停顿【Swamy 等人 2022 年的 "Causal imitation learning under temporally correlated noise"、Chi 等人 2023 年的 "Diffusion Policy: Visuomotor Policy Learning via Action Diffusion"】或多种风格【Li 等人 2017 年的 "Infogail: Interpretable imitation learning from visual demonstrations"、Kuefler & Kochenderfer 2017 年的 "Burn-in demonstrations for multi-modal imitation learning"、Gandhi 等人 2023 年的 "Eliciting compatible demonstrations for multi-human imitation learning"、Belkhale 等人 2024 年的 "Data quality in imitation learning"】**。

然而,独立抽取的动作序列样本可能无法保留平滑和一致执行所需的时间依赖关系。我们的工作对动作分块进行了深入分析,并提出了一种解码算法来改进它。

序列解码

数十年来,生成式序列建模领域一直在研究解码算法,近期大语言模型(LLM)的进展更是推动了人们对该领域的重新关注。一类显著的方法侧重于利用似然分数等内部指标来提升生成序列的质量,典型例子包括波束搜索(Freitag & Al-Onaizan, 2017; Vijayakumar et al., 2018)、截断采样 truncated sampling(Fan et al., 2018; Hewitt et al., 2022)、最小贝叶斯风险解码(Kumar & Byrne, 2004; Müller & Sennrich, 2021)以及其他方法(Welleck et al., 2019; Meister et al., 2023; Fu et al., 2024a)。另一类研究则探索多个模型之间的差异,以联合优化生成序列的质量或效率等期望属性(Li et al., 2023; Leviathan et al., 2023)。最近,多项研究强调了通过分类器(Dhariwal & Nichol, 2021)或奖励模型(Khanov et al., 2023)等外部模型引导解码或采样过程的潜力。在机器人学习领域,近期工作已探索了用于长时域机器人规划(Huang et al., 2023)和机械臂几何设计(Xu et al., 2024)的引导解码方法。然而,针对机器人低层动作的有效解码策略仍较为缺乏。与我们的工作同期,Nakamoto 等人(2024)Steering Your Generalists:
Improving Robotic Foundation Models via Value Guidance 提出通过查询从带奖励标注的演示中学习到的值函数来选择动作样本(Hansen-Estruch et al., 2023)。我们的方法不依赖独立的值函数,而是提出一种通过样本对比解决动作分块中固有 “一致性 - 反应性” 权衡的解码策略

3 分析:动作分块中的权衡

3.1PRELIMINARIES

考虑一个演示数据集 \(D = \{\tau_{i}\}_{i=1}^{N}\),其中每个演示 \(\tau_{i}\) 由人类专家提供的状态-动作对序列 \(\tau_{i} = \{(s_{1}, a_{1}), (s_{2}, a_{2}), \cdots, (s_{T}, a_{T})\}\) 组成。在每个时间步 \(t\),演示动作 \(a_{t}\) 不仅受观察到的状态 \(s_{t}\) 影响,还受潜在变量 \(z_{t}\)(如规划策略、子目标)和个人偏好(如惯用手)的影响。这些潜在变量可能在多个时间步中持续存在,并且在不同演示之间存在显著差异。图2展示了人类专家的决策过程,突出了其内在的时间依赖性

为了对这些时间依赖关系进行建模,近期的一些研究(Zhao等人,2023b;Chi等人,2023;Lee等人,2024)利用了动作分块技术,即对基于过去状态的未来动作联合分布进行建模,简称。其中,\(c\)为上下文长度,即状态输入的过去步数;\(l\)为预测长度,即动作输出的未来步数。训练此类策略通常涉及最小化模型\(\pi\)与专家策略\(\pi^{*}\)之间的动作分布散度:

在部署过程中,策略以特定的动作时域  h \in[1, l]  运行,即执行预测动作序列的部分或全部内容,持续 \(h\) 个时间步且不进行重新规划。这种方法本质上是将 \(c\) 个状态作为上下文输入,并执行 \(h\) 个动作,我们将其称为 (c,h) -策略

上下文长度 \(c\) 和动作时域 \(h\) 的选择通常对所学策略的有效性起着关键作用。近期的策略往往采用较短的上下文长度 \(c\),因为在训练数据有限的情况下,扩展上下文可能导致性能下降(更多细节参见附录A.2)。相反,扩展动作时域 \(h\) 的效果则呈现出不一致性:部分研究表明其在实验室环境中具有优势(Zhao等人,2023b;Chi等人,2023),而另一些研究则发现其在真实场景中存在不利影响(Lee等人,2024)。这些矛盾结果背后的原因目前尚未得到充分理解

值得注意的是,Zhao等人(2023b)假设动作分块可缓解误差累积,但目前尚不清楚为何当分块内的偏差无法在重新规划前纠正时,这一假设仍然成立。另一方面,Chi等人(2023)将其与模型预测控制(MPC)(Borrelli等人,2017;Löfberg,2012)进行类比,强调其在改善一致性和规划方面的作用。然而,与通常使用短动作时域(如\(h=1\))的MPC不同,近期的模仿学习方法采用了更长的动作时域,例如预测序列的很大一部分(如Chi等人(2023)中\(h=8\)),甚至整个预测长度(如Zhao等人(2023b)和Black等人(2024)中\(h≥50\))。由于缺乏对动作分块的清晰理解,其有效应用受到了阻碍。接下来,我们将明确分析动作分块的优缺点,尤其关注动作时域 h 的选择。

3.2 分析

为了理解动作分块的影响,我们聚焦于已执行块的最后一个时间步,此时专家策略与学习策略之间的差异最为显著。在这个时间步 \( t \),一个 (k, 1) 专家策略(记为  通过基于 \( k \) 步过去状态及相应潜在变量  z_{t-k:t}  来预测动作  a_t 。相比之下,一个 (c, h) 学习策略(记为)被限制为仅观察 \( c \) 步过去状态和预测块内的 \( h-1 \) 步过去动作。

学习策略与专家策略之间的差异可归因于两个因素:(i)未观察到的状态在预测当前动作中的重要性,以及(ii)基于可用信息推断未观察状态的难度

图3:(k, 1)-专家策略、(c, h)-学习策略和(c, h+d)-学习策略的示意图。阴影区域表示观察到的历史信息;颜色越深表明对当前决策的影响越大

为了更清晰地观察动作时域对这些因素的影响,我们接下来比较两个具有相同上下文长度但不同动作时域的策略的性能:\pi_h :=  和,其中 \(d > 0\) 表示扩展的动作时域。如图3所示,每个策略可获取对方无法访问的独特信息: \pi_h  观察到一些近期状态,而 \pi_{h+d} 仅知晓已执行的动作;另一方面,\pi_{h+d} 可访问先于 \pi_h 所有可用信息的早期状态和动作。我们将观测的重要性定义如下(形式化定义见附录E.2):

定义(期望观察优势):

如果一个策略能够观察到状态 s_t,则称其相对于无法观察到该状态的另一策略具有观察优势  \alpha_t。更形式化地说,这是不基于状态 s_t 条件的策略  \pi(a_{t'} | s_{t'}) 所积累的期望散度,与基于状态 s_t 条件的策略  \pi(a_{t'} | s_{t'}, s_{t}) 所积累的期望散度之间的差异

定义(最大推理劣势)

如果一个策略无法基于状态 s_t 对其预测进行条件约束,那么其最大推理劣势 \(\epsilon_t\) 是由错误推断所导致的最大可能散度。这里的“最大”是对 s_t 所有可能的错误推断而言。因此,我们将 \pi_h 从观察到的近期状态中获得的观察优势记为 \alpha_f,并将其因早期未观察到的状态而产生的最大推理劣势记为  \epsilon_b ;反之,\pi_{h+d} 则获得 \alpha_b 但产生 \epsilon_f

表示真实转移概率,\hat{P}(s_{t+1} | s_{t}, a_{t}) 为策略学习到的隐式动态模型。推断未观察状态的难度既取决于相关观测信息,也取决于环境随机性,我们将其量化如下:

定义(正向推理)

,其中 \(g_t\) 和 \(g_{t-1}\) 分别为确定性环境中时刻 \(t\) 和 \(t-1\) 的真实状态。在确定性环境中,\(P_f(t) = 1\);而在随机环境中,\(P_f(t)\) 较小。预测误差由 刻画。

定义(逆向推理)

类似地,设,其中 \(g_{t}\) 和 \(g_{t+1}\) 分别为确定性环境中时刻 \(t\) 和 \(t+1\) 的真实状态。

由于 \(P_b(t)\) 不基于任何动作进行条件约束,其熵通常更高。在随机环境中,\(P_b(t)\) 较小。此外,设 \(\delta_b(t) = \hat{P}(S_t = g_t | S_{t+1} = g_{t+1}) - P(S_t = g_t | S_{t+1} = g_{t+1})\)。

我们将专家策略下分布 的方差称为截至时间 \(t'\) 的过去策略多样性。鉴于正向推理通常比逆向推理更容易,\(\pi_h\) 和 \(\pi_{h+d}\) 的性能差异如下(证明见附录E):

命题1(一致性-反应性不等式)。

设 \( L \) 为衡量预测误差与演示差异的非线性非负凸函数。令 \( C := \{a_{t-h:t-1}\} \cup S^+ \),其中 \( S^+ \) 为 \( \pi_h \) 和 \( \pi_{h+d} \) 共同观察到的状态集合。为简化符号,设 \( \tau_f = \{t - h - d + 1 : t - h\} \) 且 \( \tau_b = \{t - h - d - c : t - h - c - 1\} \)。则,\( (c, h+d) \) 策略与 \( (c, h) \) 策略的期望损失差 \( \Delta_d := \min_{\pi_{h+d}} \mathbb{E}[L(\pi_{h+d}, \pi^*)|C] - \min_{\pi_h} \mathbb{E}[L(\pi_h, \pi^*)|C] \) 满足以下界:

注1. 公式(2)对两种策略的性能进行了一般性比较。直观来看,每种策略的优势源于其可获取的额外信息(即\(\pi_h\)的\(\alpha_f\)和\(\pi_{h+d}\)的\(\alpha_b\)),而劣势则由错误推断缺失信息导致的最大散度所限制(即由错误推断的最大概率缩放后的\(\epsilon_b\)和\(\epsilon_f\))。

接下来,我们考察命题1的含义。

推论2(一致性)。

假设训练环境与测试环境相同且为确定性环境。假设动作 \(a_t\) 受时间步 \(\tau_b\) 中至少一个状态的影响,且对所有 \(t' \in \tau_f\) 有 \(\delta_f(t') \approx 0\)。若截至时间 t-h-c 的过去策略多样性不为零且 \(\epsilon_f\) 有限,则

注2. 在确定性环境中,尽管两种策略需要推断的未观察状态数量相同,但\(\pi_{h+d}\)受益于对额外动作的条件约束,这可能通过其动作分块显著辅助推断相应的状态。然而,这仅在策略学习的隐式动态模型近似准确且推断这些状态产生的最大误差\(\epsilon_f\)有界时才成立。请注意,随着数据集中策略多样性的增加(即专家在短时域策略上下文之前采取的动作分布方差更高时),\(\pi_{h+d}\)的表现会更好

推论3(反应性)。

假设对于所有 较小,或者 均较大。如果时间依赖性随时间减弱(使得 \(\epsilon_{b}\) 较小),且动作 \(a_{t}\) 受时间步 \(\tau_{f}\) 中至少一个状态的影响,则

注3. 近期状态通常对决策更为重要,因此当推断这些近期状态变得困难时,动作分块的劣势会变得显著。这种情况可能发生在测试环境为随机环境时,也可能发生在测试环境为确定性环境但隐式动态模型不准确的情况下——无论是由于分布偏移还是学习难度导致的模型不准确。

总之,根据实验条件的不同,动作分块可能对学习到的策略产生不同影响。一方面,由于能够获取过去时间步执行的动作信息,它有助于对演示中的时间依赖性进行建模;另一方面,由于对近期时间步状态观测的访问减少,它会阻碍对意外动态的反应。因此,不存在适用于所有条件的通用最优动作时域选择。当时间依赖性和预测误差均显著时,调整动作时域需要在这两个对立因素之间进行内在权衡

4 METHOD: BIDIRECTIONAL DECODING

如上分析,动作分块虽能提升长期一致性,但会牺牲短期反应性。在本节中,我们提出通过将动作分块与闭环自适应相结合来解决这一权衡问题。我们将首先在4.1节概述通用框架,然后在4.2节描述两个具体准则。

4.1 TEST-TIME SEARCH

回想一下,对于预测长度为 \( l \) 的策略,在时刻 \( t \) 采样的动作块 , 需在后续 \( l \) 个时间步遵循一致的策略。然而,以开环方式执行动作块会使策略易受意外状态变化的影响。另一种思路是通过重新采样动作块并仅在每个时间步执行第一个即时动作来最大化反应性,但这种简单的闭环方法会破坏每个块内的策略一致性,可能导致不同策略间的振荡。我们如何将两种方法的优势结合起来?

我们的核心思想是利用测试时的额外计算来衔接动作分块与闭环重采样。具体而言,我们试图通过扩大候选样本数量来恢复闭环操作中的时间一致性。直观地说,虽然任意单个样本对共享相同潜在策略的概率较低,但随着样本数量的增加,找到一致样本对的可能性会提高。因此,我们将闭环动作分块问题构建为在每个时间步抽取的一批样本中搜索最优动作:

其中 \(\mathcal{A}\) 为采样动作块的集合,\(\mathcal{L}_{B}\) 和 \(\mathcal{L}_{F}\) 是分别逼近逆向决策和前向规划最优性的两个准则,我们将在下文详述。

4.2 BIDIRECTIONAL CRITERIA

逆向一致性。

为了在闭环操作中保留时间依赖性,动作序列应:

(i)在时间维度上遵循一致的潜在策略;

(ii)对意外变化做出平滑反应。

基于这些期望特性,我们将前一时刻选择的动作块作为先验,并在\(l-1\)个重叠时间步上最小化新动作块与该先验之间的加权欧氏距离

此处,\(\rho\)是衰减超参数,用于刻画随时间增长的不确定性。默认情况下,我们使用L2范数作为预测动作之间的距离度量,而L1范数或余弦距离等其他度量方式同样有效(见附录A.6)。这一逆向目标在鼓励连续时间步之间潜在策略相似性的同时,允许对不可预见的转移动态进行渐进式适应

然而,仅依赖逆向准则存在一个潜在问题:由于前一时间步缺乏信息(例如意外的物体运动),先验动作块可能并非最优。在这种情况下,仅基于先验选择下一个动作块可能会使次优性持续存在。理想情况下,序列决策过程应能根据最新观测有效纠正次优计划。接下来,我们通过另一个正向准则来解决这一需求。

正向对比

我们设计正向准则的动机是需要从一组候选方案中识别最优计划。在同一潜在策略下,次优样本可能源于:

(i)在学习模型下的似然较低

(ii)学习模型与专家策略之间的差异。

为此,我们从大型语言模型(LLM)解码技术(Wang等人,2022;Li等人,2023)中汲取灵感,引入正向对比准则。具体而言,我们将每个候选样本与两组参考样本进行比较:一组是来自更强策略的正样本集,另一组是来自较弱策略的负样本集。更强策略取自训练良好的检查点,而较弱策略取自早期欠拟合的检查点,预期其与专家策略的差距更大。因此,我们的正向目标被设定为最小化候选计划与正样本之间的平均距离,同时最大化其与负样本之间的平均距离:

其中, 是由强策略 \(\pi\) 预测的正样本集,\(\mathcal{A}^{-}\) 是由较弱策略 \(\pi'\) 预测的负样本集,\(N\) 为样本量。

图4展示了逆向一致性准则与正向对比准则对样本选择的综合影响。由于正样本集\(\mathcal{A}^{+}\)和负样本集\(\mathcal{A}^{-}\)中的样本并非全部遵循同一策略,我们通过剔除与先前决策显著偏离的样本对每个集合进行修剪。这一操作通过对公式(7)中正样本集和负样本集中最小的K个距离值求和来实现。我们的解码方法完整流程如算法1所示。由于BID(闭环动作分块解码)中的所有步骤均可并行计算,在现代GPU设备上,整体计算开销仍保持在较低水平。有关我们解码方法的更多讨论,请参见附录B。

图5:一维仿真中动作时域\(h\)对空闲动作的影响。所有策略共享相同的预测长度\(l\)。在低噪声环境,长动作时域会使空闲分布更接近长时间空闲的专家策略;而在高噪声环境中,较短的动作时域更贴近短时间空闲的专家策略。当空闲和噪声均不可忽视时,中等长度的动作时域表现最佳。

5 EXPERIMENTS

在本节中,我们将通过一系列实验来回答以下问题:

1. 我们关于动作分块的理论分析在不同条件下如何体现?

2. 我们的解码方法能否改善基于动作分块构建的策略的闭环操作?

3. 我们的解码方法是否在不同策略、任务和环境中均表现良好?

4. 我们的解码方法是否可扩展至更大样本量并与现有方法兼容?

为此,我们将首先通过一维诊断仿真验证理论分析。随后,我们将在三个仿真基准的七个任务上评估BID(闭环动作分块解码方法),包括:

Push-T(Chi等人,2023)、RoboMimic(Mandlekar等人,2022)和Franka Kitchen(Gupta等人,2020)。随后,我们将在各种基础策略、样本规模和随机噪声下检验我们方法的通用性和可扩展性。最后,我们将在两个需要与动态物体交互的挑战性真实世界任务中评估BID的有效性。

5.1 一维诊断实验

实验设置。我们首先在一维状态空间中进行诊断实验,其中\(s_0\)为起始状态,\(s_{10}\)为目标状态。演示者计划在每个状态中向前移动一步,但在状态\(s_5\)中会暂停,除非最近访问的五个状态均为\(s_5\)。每次前移动作的概率为\(1-\delta\),其中\(\delta\)表示环境中的随机噪声水平(如3.2节所述)。基于这些演示数据,我们训练了一组具有不同动作时域\(h \in \{1,2,3,5,7,10\}\)的策略。我们旨在探究在何种动作时域下,学习器能够更好地模仿专家在多次滚动out中采取的空闲动作分布。

结果。如图5所示,当环境为确定性(\(\delta=0.0\))时,更大的动作时域能更好地捕捉专家策略的分布,这与推论2一致。当动作时域为10时,学习器与专家策略的分布总变异距离为零。相反,当环境具有高度随机性(\(\delta=0.4\))时,动作时域为1的学习器表现优于所有其他学习器,这与推论3相符。在中等噪声(\(\delta=0.2\))情况下,结果不呈现单调模式,最优策略对应的动作时域为5。更多详细结果见附录A.1。这一控制实验验证了命题1中提出的权衡关系,我们将在5.2.3节中进一步展示其在受随机噪声影响的机器人操作任务中的表现。

5.2 SIMULATION EXPERIMENTS WITH STOCHASTIC NOISE

接下来,我们在七个机器人操作的仿真任务上评估我们的解码算法。我们首先会将BID与闭环操作中的现有推理方法进行比较,然后评估我们的方法在不同条件下的有效性,包括策略类别、样本规模和随机噪声水平。

5.2.1 COMPARISON WITH EXISTING INFERENCE METHODS

实验设置。在每个操作任务中,我们使用在人类演示数据上训练的扩散策略(Diffusion Policy,Chi等人,2023)作为基础策略。我们采用批量大小\(N=16\)和模式大小\(K=3\)对BID进行评估。我们将三种现有推理方法作为基线:

• Vanilla(Chi等人,2023):以闭环方式执行采样动作块的第一个动作。

• Warmstart(Janner等人,2022):与Vanilla方法类似,但从先前决策中为扩散过程的初始噪声提供热启动。

• 指数移动平均(Exponential Moving Average,EMA)(Zhao等人,2023b):通过在每个重叠步骤将新预测动作\(a\)与前一个动作\(\hat{a}\)进行平均来平滑动作分块,即\(a_{t}=\lambda a_{t}+(1-\lambda) \hat{a}_{t}\)。该方法也称为时间集成。默认情况下,我们将\(\lambda\)设置为0.5。

我们对每种方法进行100个 episodes 的评估,并对三个随机种子的结果取平均值。实现细节请参见附录C。

结果。我们的主要观察是,尽管现有推理方法为闭环操作提供了一些好处,但它们缺乏鲁棒性。如图6所示,Warmstart平均带来温和的性能提升,但在7个任务中的3个任务上性能下降。类似地,EMA在多个任务上产生有竞争力的结果,但在2个任务中表现下降。我们推测这种鲁棒性问题源于跨块的独立采样当连续的块遵循不同的潜在策略时,对它们进行平均可能无法产生合理的策略,如附录A.4中进一步讨论的那样。相比之下,BID在所有任务上都提供了显著的提升。值得注意的是,BID相对于vanilla基线提供了32%的相对改进,在Pust-T、Lift、Square和Tool Hang任务上显著优于EMA,同时在其他任务上实现了有竞争力的性能。

图6:扩散策略闭环操作中不同推理方法的比较。每种方法在仿真基准的七个操作任务上进行了100个回合的评估,结果取三个种子的平均值。在大多数任务中,BID显著优于现有推理方法。

5.2.2 BID的可扩展性与兼容性

实验设置。接下来,我们将实验扩展至VQ-BET(Lee等人,2024)——另一种基于自回归Transformer构建的先进机器人策略。我们使用LeRobot(Cadene等人,2024)提供的Push-T任务公共检查点作为基础策略,并将训练至100轮后终止的检查点作为正向对比中的弱策略。为模拟随机条件,我们在每一步执行的动作中添加与时间相关的高斯噪声(噪声幅度由动作大小缩放)。计算时间通过配备NVIDIA A5000 GPU的台式机进行测量。

表1:VQ - BeT在Push - T任务中不同噪声条件下的成功率。在随机环境中,闭环BID显著优于其他方法。详细消融实验见表格4。

结果。表1总结了基线方法与我们方法的实验结果。在闭环和开环操作中,原始随机采样方法的表现均显著劣于BID。值得注意的是,随着环境随机性增强,原始开环方法的性能呈现快速下降趋势。即使在闭环操作中,原始基线方法的性能仍出现明显下滑。相比之下,闭环BID对随机噪声表现出更强的鲁棒性。表2详细列出了不同批量大小下BID的计算开销。结果表明,我们方法的性能提升伴随两倍的计算开销。我们预计,随着更高端GPU的应用,这一开销限制将逐渐减弱。 

5.3 REAL-WORLD EXPERIMENTS WITH DYNAMIC OBJECTS

我们最后通过两个需要对动态移动物体做出快速反应的真实世界实验来评估BID。

实验设置。我们考虑两个拾取放置任务,其中目标物体在评估过程中会发生意外移动。在动态放置任务中,Franka Panda机器人需要将物体递送到人类受试者手持的移动杯子中。在动态拾取任务中,UR5机器人需要抓取由绳子拉动的移动杯子,并将其放置到附近的静态碟子上。在这两个任务中,我们评估了应用于预训练扩散策略的BID的性能。更多实验细节请参见附录C.2。、

结果。图8和图9比较了不同推理方法在两项真实世界任务中的结果。原始随机采样方法难以处理多样化的演示数据和动态运动,导致成功率显著较低。相比之下,BID在静态和动态条件下均实现了高成功率。值得注意的是,在动态拾取任务中,BID的成功率比所有其他基线方法高出一倍,凸显了其在动态物体交互中的潜力。

图8:物体递送任务的成功率。每种方法设置均通过20个回合进行评估。BID的成功率显著高于原始基线方法,有效处理了多样化的演示数据和动态目标。

图9:动态环境下杯子更换任务的成功率。每种方法均通过20个回合进行评估。现有方法在杯子缓慢移动时性能显著下降,而BID则保持了强劲的表现。

6 CONCLUSION

总结。我们分析了机器人从人类演示中学习时动作分块的优势与局限性。基于该分析,我们提出了双向解码算法(BID),该推理算法在样本选择中同时考虑过去决策和未来计划。实验结果表明,BID能够持续改进闭环操作,与计算资源良好适配,并可补充现有方法。我们希望这些发现为解决生成式行为克隆在测试阶段的挑战提供新视角。

局限性。BID的一个主要局限性在于其计算复杂性。尽管解码计算可以在现代GPU上完全并行化,但对于低成本机器人的高频操作而言,计算成本可能仍然较高。设计能够在批量大小约束下生成高质量且多样化动作块的算法,可能是未来研究的一个有趣方向。此外,我们的分析和方法目前仅限于短上下文长度的策略,这是由于在有限的人类演示数据下其经验有效性所致。开发能够学习鲁棒长上下文策略的技术,可能是未来研究的另一个引人注目的方向。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐