桥接语言、视觉与行动:多模态变分自编码器在机器人操作任务中的应用

摘要:本文聚焦于机器人操作领域中的无监督视觉-语言-行动映射问题。近期,众多研究提出了利用预训练大型语言和视觉模型来解决这一任务的方法。然而,这些方法计算成本高昂,且需要对输出进行精细调整。一种更轻量级的替代方案是实现多模态变分自编码器(VAEs),它能够提取数据的潜在特征,并将它们整合到一个联合表示中,这已在图像-图像或图像-文本数据的最新模型中得到证明。在此,我们探讨多模态VAEs是否以及如何能够在模拟环境中用于无监督的机器人操作任务。基于所获得的结果,我们提出了一种模型不变的训练替代方法,该方法在模拟器中将模型性能提升了高达55%。此外,我们系统地评估了各个任务带来的挑战,例如物体或机器人位置的变化、干扰物的数量或任务长度。因此,我们的工作还揭示了使用当前多模态VAEs在基于视觉和语言的无监督学习中机器人运动轨迹的潜在优势和局限性。

关键词:传感器融合、视觉学习、语义场景理解

一、引言

通过演示/运动觉引导教授机器人新操作任务是机器人学中的一个关键研究领域。在此,我们关注的是机器人接收场景的视觉观察和自然语言 natural language(NL)任务描述,并需要将这些信息与运动觉教学相结合以成功完成目标的场景。尽管传统基于规则的方法通常将自然语言输入解析为形式语言以消除任务歧义[1],[2](“Specifying dual-arm robot planning problems through natural language and demonstration,”,“Robots that use language,” Annual Review of Control, Robotics, and Autonomous Systems, vol. 3, pp. 25–55, 2020),但最新方法利用在互联网规模数据上预训练的大型语言(LLM)[3]“Lm-nav: Robotic navigation with large pre-trained models of language, vision, and action,” in Conference on Robot Learning. PMLR, 2023,[4]“Code as policies: Language model programs for embodied control,” in 2023 IEEE International Conference on Robotics and Automation (ICRA). IEEE, 2023,[5]“Tidybot: Personalized robot assistance with large language models,” arXiv preprint arXiv:2305.05658, 2023 和大型视觉模型(LVM)[6]“Rt-2: Vision-language-action models transfer web knowledge to robotic control,” in 7th Annual Conference on Robot Learning, 2023,[7]“Palm-e: An embodied multimodal language model,” arXiv preprint arXiv:2303.03378, 2023.,这些模型通过提示方法等进行额外的微调。然而,这些模型在重复性方面往往存在困难,且在可控性方面难以产生可预测的输出[8]。一种可能有前景的方法是使用概率生成模型,如多模态变分自编码器(VAEs)。这些模型作为单模态变分自编码器的强大扩展,适用于将多种模态映射到一个统一的联合空间,从而允许从一种模态生成另一种模态[9]。然而,大多数关于多模态VAEs的研究主要集中在图像-图像或图像-文本映射任务上,在机器人动作方面的应用存在显著空白[10]“Multimodal generative models for scalable weakly-supervised learning,” Advances in Neural Information Processing Systems, vol. 31, 2018,[11]“Variational mixture-of-experts autoencoders for multi-modal deep generative models,” Advances in Neural Information Processing Systems, vol. 32, 2019,[12]“Private-shared disentangled multimodal vae for learning of latent representations,” in Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2021,,[13]“Generalized multimodal ELBO,” in International Conference on Learning Representations, 2021。在本文中,我们探讨最新多模态VAEs在机器人场景中的潜力,其中动作是从动作演示、图像和自然语言指令的组合中学习的(见图1)。我们的主要目标是理解在这样一个多模态环境中利用VAEs的挑战和要求,其中每种模态具有不同的抽象和复杂性水平(例如,高级语言指令与低级末端执行器轨迹),并且没有额外的监督,如物体位置的真实数据。我们的贡献如下:

  • 我们采用了三种选定的最新多模态VAEs,并调整了编码器-解码器架构,用于在机器人操作任务中映射自然语言输入、图像和整个运动轨迹(见图1)。

  • 我们提出了一种与模型无关的训练目标调整,使其更适合此类机器人任务,并与标准训练目标相比,将所实现模型的性能提升了高达55%。

  • 我们在34个合成机器人数据集上训练模型,这些数据集在任务数量、干扰物、位置变化和任务长度方面具有不同的复杂性。然后我们评估了任务的哪些方面对多模态VAEs最具挑战性。我们的项目仓库可在GitHub上找到。

图1 提出的训练程序架构方案(上)
和推理(下图)。在训练期间,语言命令、image 和运动轨迹被馈送到各个模型的编码器中。多模态混合方法(MVAE、MMVAE 或 MoPoE)学习关节后分配。每种模态的重建损失使用
这 s-VAE 损失,用于 ELBO 或 IWAE(用于 MMVAE)对象。在推理过程中,模型根据提供的映像和命令。

二、相关工作

A. 机器人视觉-语言-行动映射

在过去几年中,基于自然语言命令的多模态机器人动作学习的最流行方法是使用预训练的大型语言模型(LLMs)[5],[3],[4]或大型预训练视觉-语言模型(VLMs)[6],[7]。这些模型可以将复杂的自然语言输入解析为符号任务表示,并实现语义推理。此外,它们通常能够从少量训练样本中泛化到新的、未见过的数据。然而,它们需要手动(通常是迭代的)微调以使模型适应特定任务,从而使产生的结果在期望范围内。由于高计算资源需求,它们通常无法在本地机器上使用。在我们的工作中,我们考虑从头开始学习的机器人操作指令,并将注意力集中在不同抽象水平的模态之间的多模态映射(即符号指令、场景的原始图像和低级运动轨迹)。我们利用最新多模态VAEs的生成能力来无监督地学习此类映射。这种方法计算成本低,不需要对输入数据进行手动微调,并且产生更可预测的结果。此外,多模态VAEs还可以从输入图像和轨迹生成自然语言标题,因此也可以同时作为动作识别模块。

B. 多模态VAEs

多模态VAEs能够联合整合和重建两种或更多模态。已经提出了几种学习多模态VAEs中联合表示的方法[14],[10],[11],[15],[13],[16]。JMVAE模型[14]通过联合推理网络学习多模态联合概率,并为每种模态子集需要一个额外的推理网络。一种更具可扩展性的解决方案是MVAE模型[10],其中使用专家产品的PoE来近似联合后验分布。MMVAE方法[11]使用专家混合的MoE来基于单模态后验估计联合变分后验。MoPoE架构[13]通过为所有模态子集计算联合后验,结合了PoE和MoE方法的优点。尽管上述模型已在各种图像-图像或图像-文本基准数据集上进行了评估,但它们尚未在机器人实验中进行测试,其中它们会生成整个机器人轨迹。Zambelli等人[17]提出了一种多模态VAE,其中通过共享编码器和解码器网络层来学习联合潜在空间。他们的模型在一个iCub机器人弹钢琴的感观运动学习场景中进行了评估。然而,该模型一次只能预测一个未来时间步,因此不允许基于整个轨迹学习和区分多个动作类别。同样,Meo等人[18]采用了MVAE模型[10]用于自适应扭矩控制器,该控制器从多个感官输入估计Panda机器人的本体状态。这种适应仅允许模态之间的一对一映射(例如,关节位置到机器人图像),并不关注整个复杂轨迹及其与语言的映射。在我们的研究中,我们探索并对最新多模态VAEs进行修改,使其能够从未监督的方式中从原始图像输入和自然语言指令推断出整个运动轨迹。由于每种模态在各种抽象水平上提供不同的信息,因此这一任务具有挑战性。例如,图像传达了关于场景物体及其位置的隐含细节,指令以符号方式指定目标物体和动作,而动作模态则告知低级任务执行情况。

三、预备知识

A. 任务描述

我们关注的是一个机器人操作任务,其中机器人手臂应根据场景的单个俯视图RGB图像和自然语言命令来操纵随机位置的物体,该命令指定动作类型和/或目标物体名称。机器人通过末端执行器的x、y和z位置以及一个额外的二进制值g(用于夹持器的开合)进行控制。该任务需要将动作、图像和语言命令映射到一个联合表示中,以便在推理期间,模型能够:

1)根据提供的NL命令和图像生成动作,以及

2)根据提供的轨迹和图像生成NL描述。通过在合成数据集上训练模型来实现这种映射。

B. VAEs

在本节中,我们简要介绍我们为机器人实验调整的最新多模态VAEs的理论背景。更多详细方程,请参见原始论文。多模态VAEs建立在Kingma等人[19]提出的标准(单模态)VAE之上,这是一种概率编码器-解码器网络,学习近似变分后验并优化证据下界(ELBO):

其中第一项是重构损失,即第i个数据点的预期负对数似然,第二项是编码器分布qθ(z|x)与先验p(z)之间的Kullback-Leibler散度,通常为高斯分布。

除了每种输入模态的个体后验外,多模态VAEs还学习它们的联合表示,以便在测试时可以在输入的任何子集上提供。这样的模型应该能够执行跨生成,即从一种模态重建另一种模态。在MVAE[10]中,N种模态的联合变分后验使用专家产品 Product of Experts 近似为:

假设各个专家是高斯分布的,并且给定公共潜在变量z的N种模态是条件独立的。

相比之下,MMVAE[11]使用专家混合来将联合变分后验分解为单模态后验的组合:

假设所有输入的复杂性相当,并且在整个训练过程中都存在。虽然MMVAE模型可以使用传统的ELBO目标进行训练,但作者建议使用重要性加权自编码器(IWAE)目标以及重新参数化梯度估计器DReG[11]。因此,我们在实验中对MMVAE模型使用IWAE与DReG。

Mixture of Products of Experts(MoPoE)模型[13]是MVAE和MMVAE模型的泛化:

其中是N种模态的幂集。更多详细信息,请参见原始论文[9]。

四、机器人场景中的多模态VAE

首先,我们调整了基于多模态VAE的架构,使其能够整合视觉-语言-行动场景中的三种输入模态,并在推理期间从图像和命令中生成运动轨迹。这种调整独立于所使用的多模态混合方法(在第III部分中描述,见图1)。其次,我们在多模态场景中使用σ-VAE重构损失项[20],并将其与经典的均方误差损失进行比较。

A. 架构

在本节中,我们描述了用于各个输入模态的编码器和解码器网络。您可以在图1中看到整体架构。

  1. 图像:我们将场景的单个俯视图RGB图像输入到VAE编码器。为了提取底层图像特征,我们使用了在ImageNet[21]上预训练的ResNet-50网络作为编码器,以及3个全连接层后跟3个卷积层作为解码器。

  2. 机器人动作:我们调整了从ACTOR模型设计的运动轨迹的编码器和解码器网络,该模型用于根据动作标签和序列长度生成人类运动[22]。ACTOR是一个具有变换器编码器和解码器网络的VAE,具有位置编码,允许生成可变长度的序列。为了允许条件生成,作者使用了一个可学习的偏置btoken a来将潜在表示转移到动作依赖空间我们不使用此功能,因为潜在表示在与语言指令和图像混合后已经发生了变化。我们使用了一个8层(每层包括自注意力和前馈网络)变换器网络,具有2个头和1024个隐藏维度作为编码器,以及一个8层(每层具有自注意力、多头注意力和前馈网络)变换器网络,具有2个头和1024个隐藏维度作为解码器。尽管我们实验中的所有轨迹长度相同,但由于位置编码,该模型还可以处理可变长度轨迹的生成。

  3. 语言指令:对于语言编码器和解码器,我们使用了与动作(见第IV-A.2部分)相似的变换器网络。主要区别在于我们在输入处添加了一个可训练的嵌入层,将文本的独热编码压缩为2维特征。这些特征随后被输入到位置编码器,然后是变换器。解码器架构与动作相同。与动作编码器和解码器网络相比,我们使用了不同的参数——编码器和解码器均为1层,2个头和128个隐藏维度。

B. 提出的训练调整

ELBO目标中使用的重构损失项可以影响最终的重构质量和模型性能的稳定性[23]。与标准使用的均方误差(MSE)或负对数似然(NLL)相比,我们发现当使用Rybkin等人[20]提出的最优σ-VAE时,产生的重构质量有所提高,该方法使用解码器方差的分析估计

其中。这里,给定已知均值µ,方差σ的最大似然估计是到均值的平均平方距离。在第V部分的实验中,我们在34个机器人数据集上比较了MSE损失与σ-VAE目标。我们没有比较NLL损失,因为使用该重构损失进行训练产生的结果明显比MSE或σ-VAE差。

五、实验设置

A. 模拟机器人环境

我们使用了LANRO(语言机器人)模拟器的修改版本进行实验[24]。该环境包括一个带有2指夹持器的Franka Emika机器人,指向下方,通过末端执行器位置和二进制值来控制夹持器的关闭或打开。机器人位于一个桌子上方,实验中在桌子上生成物体。俯视图相机位于桌子中心上方。为了收集数据集,我们使用了3个带有纹理的物体——肥皂、苹果和柠檬(见图3)。在每次试验中,生成一个或多个物体(见第V-B和V-C小节),环境提供自然语言指令以消除任务歧义(即,在多任务场景中提供有关所需动作的信息(到达、提起、向左移动、向右移动),并在多物体数据集中指定物体(例如,将肥皂向左移动)。在另外一组实验中,我们还包括了机器人需要将物体放入抽屉并关闭的任务。设置和特定任务的例子如图2所示。

B. 场景复杂性和任务类型

为了探索多模态VAEs的能力,我们创建了基于提供的场景图像和语言指令(在必要时用于任务消歧)的机器人执行的任务演示数据。使用第V-A部分中描述的虚拟设置,我们首先生成了六个数据集,每个数据集都需要表示不同数量和类型的动作(任务),每个数据集都有四种不同的场景复杂性。这总共产生了24个(6x4)数据集(见图2A)。它们根据场景复杂性有所不同:

  • 一个固定位置的物体:在每次试验中,从3个物体中随机选择一个物体,始终放置在同一位置。然后机器人对该物体执行其中一个动作(例如,向左移动)。

  • 一个随机位置的物体:从3个物体中随机选择一个物体,并放置在随机位置。

  • 一个随机位置的物体+1个干扰物:一个随机选择的物体放置在场景中的随机位置。此外,另一个(不同的)物体放置在场景中的某个位置。指令然后指定应移动哪个物体。

  • 一个随机位置的物体+2个干扰物:与前一种情况类似,但场景中有两个干扰物。

对于上述每个数据集场景,我们生成了6个不同的训练集,包括各种数量和类型的任务(机器人动作)在选定物体上执行。变化如下:

  • 到达:机器人需要接近选定物体,距离小于6厘米(从物体中心计算)。

  • 向左移动:机器人需要提起物体并向左移动至少10厘米。

  • 向右移动:机器人需要提起物体并向右移动至少10厘米。

  • 提起:机器人需要将物体向上提起至少10厘米。

  • 2个动作(向右移动或提起):机器人需要根据提供的指令执行提起或向右移动动作。

  • 2个动作(向右移动或向左移动或提起):机器人需要根据提供的指令执行提起、向右移动或向左移动动作。

所有上述训练集在单任务场景中包含1万个样本,在2个动作和3个动作数据集中分别包含2万个和3万个样本。

C. 位置变化和任务长度

接下来,为了测试多模态VAEs对位置变化和任务长度的鲁棒性,我们生成了具有四种不同任务长度(动作序列)的数据集,每个数据集具有三个位置变化级别。这总共产生了12个数据集(见图2B)。这里使用的任务如下:

  • 到达:机器人需要接近选定物体,距离小于6厘米(对应于第V-B小节中的到达)。

  • 到达+提起:机器人需要提起物体并向左移动至少10厘米(对应于第V-B小节中的提起)。

  • 到达+提起+放入:机器人需要提起物体并将其放入打开的抽屉中。

  • 到达+提起+放入+关闭:机器人需要提起物体,将其放入抽屉中并关闭抽屉(见图4中的示例)。

对于上述每个任务,我们生成了3个训练集,它们在位置变化的数量上有所不同:

  • 变化1:物体(和抽屉)的位置仅沿x轴变化(例如,离机器人更近或更远),范围为10厘米。

  • 变化2:物体(和抽屉)的位置沿x轴和y轴变化10厘米(对于到达和到达+提起,位置变化与第V-B小节中使用的数据集相同)。

  • 变化3:与变化2相同,但机器人底座的位置也沿y轴(例如,沿桌边)变化40厘米。在每次试验中,我们从3个模态收集数据:初始场景的图像(大小为64x64x3的RGB图像)、自然语言指令(表示为每个词的独热编码)和机器人动作轨迹(每个时间步的4个值:末端执行器的x、y和z坐标以及夹持器的二进制值)。时间步的数量在任务和单次试验中有所不同,总体变化为13个时间步(到达)到68个时间步(到达+提起+放入+关闭)。

D. 训练设置

我们比较了MVAE、MMVAE和MoPoE模型,使用了第IV部分中提出的相同架构,并在图1中进行了可视化。因此,所比较的模型具有相同的编码器和解码器网络,允许直接比较多模态VAE方法,主要差异来自混合方法。我们每个模型训练了400个周期,并基于超参数网格搜索确定了最佳潜在空间大小(最终训练参数可在我们的GitHub上找到)。训练后,我们使用测试数据在LANRO模拟器中创建以前未见过的场景,并使用模型预测机器人的运动轨迹。

六、结果与讨论

训练后,我们在包含500次试验的测试集上测试了多模态VAEs。我们仅提供了场景图像和自然语言命令(在需要时用于消歧),模型必须生成正确的动作。只有当生成的样本在用于生成训练数据的阈值内到达或移动物体时(即,夹持器接近物体中心的距离小于6厘米,用于到达任务),才认为该样本是正确的。

A. 比较重构损失项

在表I中,我们将作为重构损失项使用的均方误差损失(MSE)与我们提出的调整σ-VAE损失[20](见第IV-B部分)进行了比较。对于所有模型和所有数据集(见图2A),σ-VAE的性能相同或优于MSE。所有模型和场景的平均准确率提高了6.4%(最小0%,最大55%)。这些结果表明,无论使用哪种多模态混合方法,批量分析方差估计对多模态VAE模型也是有益的。

Fig. 2. Examples from the 34 datasets generated for our experiments. In each dataset, we use the top view of the scene with the robot as the visual input
and the instruction as the text input (where necessary for task disambiguation). We also provide the task motion trajectories as another modality. A: the
scene complexity (rows) and number of actions (tasks) concurrently represented by the model (columns), e.g., one action, move right, is represented by
the model, or the model has to represent concurrently more actions (i.e., for 2 actions, the model learns together move right and lift). B: the task length
(rows) and position variability (columns), i.e., Var. 1 varies object positions along the x axis, Var. 2. varies positions along axes x, y and Var. 3. additionally
varies the robot position. For more details, see Section V.

B. 场景复杂性和任务数量的影响

我们发现,所有多模态VAEs都能在一个非变量设置中学习单个动作,该设置中一个物体位于固定位置(见表I,第一行,列1-8)。尽管同时训练两个或三个动作会导致MVAE和MoPoE模型的准确率持续下降,但MMVAE不受任务数量的影响(见表I,行1,列9-12)。

到达任务的准确率提供了模型仅基于视觉定位正确物体的能力的见解。鉴于到达任务与诸如向左移动等单个动作之间的准确率差异通常不大,我们可以假设最具挑战性的方面确实在于像素空间到笛卡尔位置的映射。至于场景复杂性,所有模型都受到物体位置变化和干扰物存在显著影响。

在图5中,我们展示了基于从目标物体的距离阈值的到达任务准确率。当使用一个随机放置的物体时,MVAE和MoPoE的所有推断轨迹都在距离目标到达位置的最大10厘米范围内(对于MMVAE,最大失真是19厘米)。然而,当引入一个干扰物时,严重失真轨迹(超过15厘米)的比例增加。这些结果表明,像素到笛卡尔空间的映射对于最新的多模态VAEs来说仍然是一个具有挑战性的任务。引入额外的视觉预处理模块可能会有益。

C. 位置变化和任务长度的影响

在表II中,我们展示了任务准确率如何受到任务长度和位置变化的影响。尽管由于物体和机器人位置的变化导致准确率略有下降,但这种影响不如任务长度的影响显著。特别是,MVAE和MMVAE在执行最长任务时面临挑战,该任务涉及将物体放入抽屉并关闭它。一种可能的解决方案是为每个子任务训练单独的VAE专家,考虑可变的物体和机器人位置,然后将这些专家串联在一起以无缝执行整个任务。

D. 比较多模态VAE模型

表I和表II表明,MVAE模型在大多数任务中始终优于MMVAE和MoPoE。MVAE在所有单任务数据集中实现了50%的准确率,这些数据集包含一个随机放置的物体。另一方面,MMVAE在多任务数据集上表现出更高的准确率(同时学习2个或3个动作),但仅在有一个固定物体的场景中,表明其对场景复杂性的鲁棒性有限。作为MVAE和MMVAE方法的组合,MoPoE的结果介于两者之间。

七、结论

我们采用了三种最新的多模态VAE模型,用于机器人运动觉教学中的视觉-语言-行动映射,并在34个模拟数据集上对其进行了系统评估。我们提出了一种适应性架构(见图1),并针对每种模态调整了编码器和解码器网络,并采用了σ-VAE目标,将模型性能提升了高达55%。我们表明,MVAE模型最为合适,其在任务长度和场景复杂性或位置变化方面表现最为稳健。在未来的工作中,我们希望进一步探索模型在多物体场景中识别正确物体的能力,因为这一任务对于最新的多模态VAEs来说超出了其能力范围,尤其是在与动作学习结合时。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐