ParticleFormer: A 3D Point Cloud World Model for Multi-Object, Multi-Material Robotic Manipulation
摘要:3D世界模型(即基于学习的3D动力学模型)通过捕捉由机器人动作决定的环境演化底层物理规律,为具有泛化能力的机器人操作提供了一种极具前景的方法。然而,现有的3D世界模型主要局限于使用基于粒子的图神经网络模型来处理单一材料的动力学问题,并且通常需要耗时的3D场景重建来获取用于训练的3D粒子轨迹。在本研究中,我们提出了ParticleFormer——一种基于Transformer的点云世界模型,它通过混合点云重建损失进行训练,能够在多材料、多物体的机器人交互中对全局和局部动力学特征进行监督。ParticleFormer可捕捉刚性、可变形和柔性材料之间细粒度的多物体交互,其训练直接基于真实世界的机器人感知数据,无需复杂的场景重建。我们在3D场景预测任务以及使用模型预测控制(MPC)策略的下游操作任务中,均验证了该模型的有效性。此外,我们扩展了现有的动力学学习基准,将多样的多材料、多物体交互场景纳入其中。我们在6个仿真实验和3个真实世界实验中对所提方法进行了验证,结果表明,该方法在所有场景下均持续优于主流基线方法,不仅动力学预测精度更高,而且在下游视觉运动任务中的滚动误差更小。实验视频可访问https://particleformer.github.io/查看。
关键词:机器人操作、基于学习的动力学建模、基于模型的规划与控制
1 引言
强化学习(RL)[1,2,3,4,5] 和模仿学习(IL)[6,7,8,9,10] 的最新进展使机器人能够在各种任务中获得复杂的操作技能。然而,大多数现有方法直接将观测映射到动作,本质上把环境动力学与特定任务目标耦合在一起。这种紧密耦合阻碍了泛化能力,因为智能体必须为每个任务 - 环境组合学习解决方案 [11,12,13]。相比之下,人类通过形成灵活的物理交互心智模型,并通过视觉感知直观地将任务目标与环境动力学解耦,从而实现有效的泛化 [14,15,16]。受此启发,开发能够捕捉潜在物理交互动力学的世界模型 [17],对于提高机器人操作的泛化能力至关重要。
这些世界模型在机器人技术和控制领域有着悠久的历史 [18,19]。这类模型有 2D(像素空间)或 3D(度量空间)表示形式。对于 3D 世界模型,研究人员表明,通过将物体参数化为 3D 空间中的基本粒子组合,并应用基于图的神经动力学(GBND)框架来学习这些粒子之间的交互规律,该模型可以有效地表示场景动力学,用于下游规划和控制 [20,21,22,23,24]。然而,我们观察到这些方法将粒子交互学习限制在图定义的拓扑结构中,使得模型对超参数敏感,例如建立粒子邻接关系的最大距离和最大邻居数量。这种敏感性在涉及多材料、多物体交互的环境中尤为突出,这些环境具有异质且复杂的接触动力学。这些模型也难以用真实世界数据进行训练,通常需要耗时的动态高斯泼溅(GSplat)[25,21] 重建来获取 3D 粒子轨迹,然后通过 MSE 损失来监督粒子动力学模型的训练。2D 世界模型通过直接从图像中学习与任务无关的表示来规避这些问题,直接从像素空间中在统一的紧凑潜在嵌入中捕捉动力学 [11,26,27,1,28]。然而,这些方法通常将场景的 2D 外观编码为单个潜在向量,这可能无法捕捉潜在的 3D 环境结构,限制了它们在组合任务场景和细粒度动力学建模中的适用性。
为了解决这些局限性,我们提出了 ParticleFormer,一种基于 Transformer [29] 的 3D 点云世界模型,用于多材料机器人操作,在动力学预测和下游视觉运动控制任务中实现了最先进的性能。具体而言,ParticleFormer:(1)引入了基于 Transformer 的神经动力学主干,使模型能够自动推断环境粒子之间详细的 3D 粒子交互,无需手动超参数调整;(2)利用混合点云损失,联合优化 Chamfer 距离和 Hausdorff 距离的可微近似 [30],以捕捉局部精度和全局结构一致性。关键的是,该损失直接应用于点云传感器流,从而避免了昂贵的动态 GSplat 场景重建,同时为准确和稳健的动力学建模提供细粒度监督,即使在多材料、多物体场景中也是如此。我们简单而有效的框架在合成和真实世界基准测试中始终优于现有基线。由于 ParticleFormer 产生的高质量动力学预测,我们可以直接应用模型预测控制(MPC)[31,32] 来在评估期间实现目标导向行为。
我们的主要贡献有三个方面。(i)首先,我们引入了基于 Transformer 的神经动力学主干,以预测表示场景几何的点云运动。这提高了动力学预测过程的准确性和稳健性。(ii)其次,我们使用直接应用于 RGB 传感器流的 Chamfer 距离和 Hausdorff 距离损失项来监督 Transformer 世界模型。这种损失联合捕捉局部几何精度和全局结构一致性,无需密集对应或显式 3D 重建。(iii)最后,我们将当前的 3D 动力学建模基准扩展到包括多材料、多物体机器人交互,拓宽了其在更多样化和实际场景中的适用性。ParticleFormer 在六个仿真任务和三个真实世界实验中进行了实验评估,动力学预测准确性和下游视觉运动控制的结果表明,我们的方法在所有设置中始终优于有竞争力的基线。
2 相关工作
用于机器人操作的世界模型。动力学模型在机器人技术中越来越重要,用于从当前状态和动作预测环境演化 [17,33,34,35,36]。广义而言,主要有两条工作线:
以对象为中心的建模:这种方法将对象表示为粒子或网格,并使用 GNN 来建模相邻单元之间的局部交互 [22,21,37,38,24,39]。虽然在捕捉空间关系方面有效,但其性能在很大程度上取决于超参数,如邻接大小和连接阈值,限制了对复杂场景的可扩展性。
以场景为中心的建模:这种范式通过直接从基于像素的观测中学习潜在动力学来避免显式拓扑构造。编码器将输入帧映射到统一的潜在空间,动力学模型在该空间中预测未来的潜在状态 [26,11,40,1,41]。然而,将整个场景压缩到单个向量中往往会忽略结构细节,损害在组合或细粒度设置中的泛化能力。
与先前的方法不同,ParticleFormer 以对象为中心的方式学习环境动力学,保留结构细节,同时解决基于图的方法的局限性。它实现了更准确的预测,并消除了对大量手动超参数调整的需求,从而实现了更稳健和可泛化的动力学建模。
多材料机器人 - 对象交互。先前的工作已经探索了将学习到的世界模型应用于各种材料类型,包括刚体 [42,43,44]、可变形织物 [35,45,46,47,48,49]、橡皮泥 [50,39]、流体 [51] 和颗粒材料 [52,21]。然而,这些方法大多集中在单一材料的机器人 - 对象场景,而忽略了多材料交互,限制了它们在真实世界设置中的适用性。相比之下,我们的工作通过将基准扩展到多材料机器人 - 对象交互来明确解决这一差距,要求世界模型在统一框架中处理异质物理特性。我们的实验表明,ParticleFormer 在这种设置中有效地泛化,在各种材料组合中优于现有基线。
3 方法
3.1 问题表述
我们考虑机器人操作场景,其中在每个时间步 t,环境被部分观测为与任务相关的点云:用于对象状态的
和用于末端执行器状态的
,两者均从完整场景观测中提取。这里,N 是下采样对象粒子的数量,M 是表示其位置和形状的末端执行器点的数量。我们的目标是学习一个神经世界模型 f,以预测环境对机器人动作的演化,目的是最小化随时间累积的预测误差。该模型将当前环境状态
、外部施加的运动
和材料编码
作为输入。具体而言,对于对象粒子,
,对于末端执行器,
,通过正向运动学计算。材料编码 M 包含独热向量,其中每个表示第 i 个粒子的材料类型(例如,刚性、颗粒状、绳索或布料),如果第 i 个粒子属于末端执行器,则
。然后,世界模型预测下一个状态为:

对材料类型 M 的条件设定使模型能够捕捉与材料相关的物理特性和行为,这对于准确建模多材料交互至关重要。
3.2 基于 Transformer 的神经动力学学习
我们提出的动力学建模框架(如图 2 所示)旨在使用基于 Transformer 的架构 [29] 学习物理系统中的粒子级交互,该架构结合了多头自注意力。在每个时间步 t,该架构包括三个主要组件:(i)观测嵌入,(ii)动力学转换,以及(iii)运动预测。
观测嵌入。该组件提取与任务相关的对象状态,并将基于像素的感知转换为用于下游动力学学习的特征嵌入。给定来自任务场景的一对立体图像,我们首先应用 FoundationStereo [53] 来重建密集点云。然后,我们使用 GroundingDINO [54] 和 Segment Anything [55] 来分割正在操作的特定感兴趣对象,产生干净的点云
,排除不相关的对象。对于每个粒子,在时间 t,我们将其位置\(\)、材料编码\(m(i)\)和运动\(
\)连接起来,并使用投影器\(
\)对组合特征进行编码,以获得其潜在表示
:

动力学转换。在每个时间步 t,我们获得粒子级嵌入
,其中 d 是嵌入维度,\(N+M\)表示对象和末端执行器粒子的总数。由于环境被参数化为一组粒子,学习动力学简化为建模它们的成对交互。为了捕捉这些交互,我们应用一堆\(L=3\)多头自注意力层,实现为动力学转换模块\(f_{dyn }\)。通过将 应用于整个潜在嵌入集来更新粒子嵌入:
其中
表示下一个时间步的预测潜在表示。模块由多头 Transformer 编码器层组成,允许每个粒子关注所有其他粒子并推断感知交互的动力学。请注意,
已经包含空间和运动信息,因此不需要额外的位置编码。注意力机制直接对这些嵌入进行操作,以建模粒子之间的物理交互。与依赖预定义交互图或基于距离的邻接阈值的先前方法相比,我们的方法通过注意力隐式学习交互结构,降低了对这类超参数的敏感性,并能够在复杂的多材料环境中进行更灵活的建模。
运动预测。在动力学转换之后,我们获得更新的潜在嵌入 ,其编码下一个时间步的预测感知交互状态。为了恢复粒子级运动,我们将共享解码器
应用于每个潜在嵌入,以预测每个粒子的位移:
其中
表示 3D 空间中第 i 个粒子的预测位置变化。
然后计算预测的下一步粒子位置为:

这种解码方案确保预测的动力学在粒子级运动中保持物理基础,同时保持交互建模和空间状态恢复之间的模块性。
3.3 混合监督
为了监督动力学学习,我们提出了一种混合几何损失,结合了 Chamfer 距离(CD)和 Hausdorff 距离(HD)的可微近似 [30]:
其中\(\)平衡细粒度局部对齐和全局结构覆盖。
Chamfer 距离通过最小化预测粒子和地面真实粒子之间的平均最近邻距离来提供局部监督。然而,在具有稀疏或不均匀运动的多材料场景中,CD 倾向于将学习偏向于具有显著运动的区域,常常忽略通过接触或变形间接影响的粒子。
Hausdorff 距离通过惩罚大的最坏情况偏差来补充这一点,帮助模型解释细微但语义上有意义的运动。这种混合公式鼓励在主导区域和被动区域都进行准确预测,无需点级对应,在精度和可扩展性之间提供实用的平衡。
训练。我们使用第 3.3 节中描述的混合损失训练世界模型,在 k 个未来步骤的滚动范围内应用。在每个训练迭代中,我们从数据集中随机采样一个时间步 t 作为滚动起始帧,并使用模型自身的预测作为输入,将模型自回归展开 6 步。在所有实验中,我们设置\(k=5\)以平衡长期监督和计算效率。
3.4 基于模型的规划和控制
学习到的世界模型 f 通过基于模型的控制部署用于下游机器人操作。给定状态空间 、动作空间 U 和成本函数
,我们的目标是优化一系列动作,以最小化相对于当前对象状态\(\)和目标状态\(
\)的总成本。在每个控制步骤,我们在预定义的范围 H 上采样动作序列
,使用世界模型 f 展开预测轨迹,并应用模型预测路径积分(MPPI)算法 [32] 找到具有最低预期成本的序列。成本函数包括测量到目标距离的特定任务项,以及不可行动作和碰撞的惩罚项。
4 实验
我们对 ParticleFormer 进行了实证评估,以解决以下问题:
(1)它能否生成视觉上合理且物理上连贯的动力学,特别是在复杂的多材料交互中?
(2)其预测准确性与现有动力学建模基线相比如何?
(3)它在多大程度上提高了下游操作任务中的视觉运动控制性能?
4.1 实验设置和任务设计
我们扩展了现有的动力学学习基准,并在六个仿真任务(使用 Nvidia FleX [56])和三个真实世界任务上评估我们的方法,广泛涵盖多材料、多物体交互。下面,我们介绍真实世界任务设计。每个任务涉及一个或两个优傲科技 xArm-6 机械臂和一个 ZED-2i 立体相机。我们通过在随机机器人 - 对象交互期间以 10 FPS 捕获立体 RGB 图像并记录末端执行器姿态来收集训练数据。实验设置和基准的详细信息在附录 A 中提供。
推箱子。在这个任务中,机器人末端执行器沿着桌面水平移动,其尖端装有一个圆柱形推杆。目标是将一个刚性箱子连续推向期望的姿态。成功完成此任务需要 ParticleFormer 捕捉准确的刚体动力学,包括平移和旋转运动,以使推送方向与箱子的惯性响应对齐。
布料收集。机器人的任务是收集散落在布料上的颗粒。它采样抓取点,并使用两指夹具垂直提起布料,导致颗粒由于织物的诱导运动而掉落和滑动。这项任务要求 ParticleFormer 同时建模布料的可变形动力学和颗粒介质的被动流动,能够准确预测局部织物操作下的颗粒运动模式。
绳索清扫。该任务涉及使用两个机械臂,用两端握住的尼龙绳将散落的颗粒扫入指定区域。机器人必须协调操作绳索的形状和轨迹,以包围和清扫颗粒材料。这项任务的成功需要 ParticleFormer 捕捉细粒度的绳索动力学和基于间接接触的交互,因为绳索会变形并通过摩擦和清扫运动将力传递给颗粒。
基线。为了证明 ParticleFormer 的有效性,我们在主要实验中与三个基线进行了比较:(1)GBND,一种基于粒子的 GNN 世界模型,遵循 Zhang 等人 [21],使用混合损失重新训练;(2)Ours w/o Hybrid,ParticleFormer 的消融版本,仅使用 Chamfer 距离监督进行训练;(3)DINO-WM [11],一种以场景为中心的世界模型,使用预训练的视觉编码器直接从 2D 像素观测构建世界模型。
4.2 动力学预测的定性评估
我们首先评估 ParticleFormer 是否能生成视觉上准确且物理上合理的动力学预测。图 3 对比了 ParticleFormer 与基线方法在三个真实世界任务中的单步预测结果。
图3:动力学预测的定性结果。我们对ParticleFormer与基线方法的单步动力学预测结果进行了对比。ParticleFormer在捕捉物体动力学以及多材料交互方面展现出更优异的能力。最右侧一列展示了我们方法的块级注意力热图(粒子i(行)到粒子j(列)的注意力权重),揭示了已学习到的材料内粒子和材料间粒子的交互结构。
在 “推箱子” 任务中,ParticleFormer 捕捉到了刚体的平移和旋转动力学,而 GBND 由于感受野有限,产生了不真实的局部畸变,“Ours w/o Hybrid”(无混合损失的我们的模型)则难以对齐方向。在 “布料收集” 任务中,ParticleFormer 准确建模了从布料抬升到颗粒流动的完整交互链,而 GBND 无法在布料上传递力,“Ours w/o Hybrid” 则低估了颗粒的运动幅度。在 “绳索清扫” 任务中,ParticleFormer 正确预测了绳索形变和由此引发的颗粒位移,GBND 因无法通过绳索传递运动,导致绳索图像分裂和预测失真;“Ours w/o Hybrid” 再次低估了间接受影响的颗粒运动,这凸显了混合监督的价值。
最后一列展示了 ParticleFormer 的注意力热图。例如,在 “绳索清扫” 任务中,出现了清晰的交互结构:绳索颗粒之间的交互在对角线上形成狭窄的线性条带,与绳索的连续连接特性一致;颗粒之间的交互呈现为两个较宽的块,反映了空间上分离的颗粒簇;颗粒对绳索的强注意力体现了力从绳索到颗粒的传递;绳索颗粒对两端机械臂末端执行器的注意力呈现不对称性。这些模式表明,我们的方法无需预定义拓扑结构,就能直接从数据中捕捉细粒度的材料交互。
4.3 动力学预测的定量评估
表 1 中的定量结果显示,ParticleFormer 在所有指标上均持续表现最佳,尤其在 MSE(均方误差)和 CD+HD(Chamfer 距离 + Hausdorff 距离)上优势显著,表明其在局部细节和全局结构上均有更高的准确性。为了与 DINO-WM 公平对比(其仅输出 2D 场景预测而非 3D 粒子状态),我们额外使用 Depth Anything V2 [57] 从其预测图像中重建粒子点云,再计算 3D 指标。
表1:动力学预测的定量结果。我们报告了三个多材料仿真任务的预测误差(详细任务描述请参见附录A),这些任务中可获取目标真实状态信息用于计算评估指标。由于DINO-WM不提供粒子间的点对点对应关系,我们仅使用基于点云的指标对其进行评估。其他任务的结果详见附录B。
此外,GBND 对超参数设置高度敏感。具体而言,我们评估了其在关键变量(即最大允许邻接节点数,即 TopK)不同取值下的动力学预测性能,结果如图 4 所示。
图4:TopK(最大邻点数)对GBND动力学精度的影响。增加允许的邻点数量可提高GBND的预测精度,但仍不及ParticleFormer——后者无需超参数调优即可实现更低的误差。
当该参数从 5 增加到 15 时,预测误差显著降低。但计算成本也随之急剧上升(附录 B),因为需要存储和处理更大的邻接矩阵 —— 这使得无限增大该值在实际中不可行。相比之下,ParticleFormer 通过基于 Transformer 架构的软注意力机制,无需手动调整这类与图相关的超参数,就能以更低成本实现更低的预测误差,在性能和可扩展性上均具优势。
4.4 基于模型的规划与控制
最后,我们评估学习到的世界模型是否能通过基于模型的控制实现有效的下游机器人操作。我们将 ParticleFormer 与 MPPI 算法 [32] 结合,针对训练中未见过的新目标构型实现目标导向行为,并使用归一化的 CD+HD 作为规划的成本函数。图 5 展示了三个真实世界任务的定性和定量结果。与基线相比,ParticleFormer 凭借准确的动力学预测,实现了更精确的规划与控制,在三次滚动试验中均达到最低的最终状态偏差。更多结果见附录 C。
图5:模型预测控制(MPC)滚动推演实验结果。机器人的任务是利用学到的世界模型执行闭环反馈控制,以达到训练期间未见过的全新目标状态。初始状态由蓝色虚线框标示,目标状态由绿色虚线框标示。与基线方法相比,ParticleFormer实现了更精准的规划和控制,在三次滚动推演试验中均展现出最小的最终状态偏差。
5 结论
在本文中,我们提出了 ParticleFormer—— 一种最先进的以对象为中心的世界模型,在复杂机器人操作任务中表现优异。ParticleFormer 通过两项关键设计提升了动力学建模的准确性和稳健性:
一是基于 Transformer 的粒子参数化框架,能灵活建模环境粒子间的软交互依赖;
二是混合点云监督损失,可同时捕捉全局结构和局部运动细节。
此外,我们将评估基准从单一材料场景扩展到多材料场景,并在合成与真实世界环境中验证了 ParticleFormer 的有效性。我们相信,ParticleFormer 提供了一个高效易用的动力学建模框架,有望推动世界模型在机器人操作任务中的应用边界。
局限性:尽管 ParticleFormer 已展现出有效性,但目前需按场景分别训练,尚未证明能在多种环境和机器人之间泛化。此外,该流程依赖外部生成的对象掩码(基于现成基础模型);分割失败可能会影响动力学预测。未来工作将探索在更广泛的 3D 机器人数据集上训练单一的场景无关模型,并将语义编码直接嵌入世界模型,减少对显式分割的依赖。
附录
A 实验实现细节
A.1 实验设置
我们的实验聚焦于机器人操作任务,ParticleFormer 需在这些任务中建模多种对象的动力学,包括复杂的多材料交互。任务涵盖单一材料和多材料的机器人 - 对象交互,用于评估动力学建模准确性及下游视觉运动控制性能。所有动力学学习实验在 NVIDIA A100 GPU 上运行,真实世界基于模型的视觉运动控制在 NVIDIA RTX 3090 GPU 上执行。
仿真环境:如图 6 所示,我们在 NVIDIA FleX 模拟器 [56] 基础上,扩展了 Zhang 等人 [22] 创建的现有动力学建模基准。原始任务仅涉及单一材料的机器人 - 对象交互(绳索、颗粒、布料),仅用于评估动力学建模性能。我们额外设计了三个多材料机器人 - 对象交互任务,用于同时评估动力学建模和下游视觉运动控制。所有任务均使用优傲科技 xArm-6 机械臂,末端执行器包括圆柱形推杆、平面推杆和平行夹爪。每个任务收集 1000 个 episode 的数据作为训练集。
Figure 6: Simulation Experiment Setup.
真实世界环境:在真实世界实验中(如图 7 所示),“推箱子” 和 “布料收集” 任务使用 1 台 6 自由度的优傲科技 xArm-6 机械臂,“绳索清扫” 任务使用 2 台。“推箱子” 任务配备 3D 打印的圆柱形推杆,“布料收集” 任务使用平行夹爪,“绳索清扫” 任务使用两个夹爪。工作区前方放置 ZED-2i 相机,以 10Hz 频率捕捉 1280×720 分辨率的立体 RGB 图像。机器人操作工作区尺寸约为 70cm×55cm。每个任务录制 500 秒的随机机器人 - 对象交互片段,构建训练数据集。
Figure 7: Real-World Experiment Setup.
A.2 任务设计
我们介绍用于对比 ParticleFormer 与基线方法性能的任务,涵盖单一材料和多材料交互场景。
绳索任务:机械臂用圆柱形推杆随机推动平面工作区上的绳索。该任务评估世界模型能否准确捕捉绳索的可变形动力学及其与机械臂的交互。
颗粒任务:机械臂用平面推杆随机推动工作区上散落的颗粒堆。该任务测试模型预测颗粒在直接物理接触下的动力学的能力。
布料任务:机械臂用平行夹爪随机抓取布料角落并沿不同轨迹移动。目标是评估模型捕捉布料在操作中的可变形动力学的能力。
推箱子任务:机械臂末端执行器沿桌面水平移动,尖端装有圆柱形推杆。目标是将刚性箱子持续推向目标姿态。成功完成该任务需 ParticleFormer 准确捕捉刚体动力学,包括平移和旋转运动,使推送方向与箱子的惯性响应对齐。
布料收集任务:机械臂需收集散落在布料上的颗粒。它随机选择抓取点,用两指夹爪垂直提起布料,导致颗粒因布料运动而滑落。该任务要求 ParticleFormer 同时建模布料的可变形动力学和颗粒的被动流动,准确预测局部布料操作下的颗粒运动模式。
绳索操纵任务:两台机械臂抓取绳索两端,通过间接推动地面上的刚性箱子使其移动。目标是将箱子移动到目标姿态而不使其倾倒。该场景包含丰富的多对象、多材料交互,要求 ParticleFormer 推理可变形体与刚体之间的间接力传递。
绳索清扫任务:两台机械臂用两端握住的尼龙绳将散落的颗粒扫入指定区域。机械臂需协调控制绳索的形状和轨迹,以包围并清扫颗粒。成功完成该任务需 ParticleFormer 捕捉细粒度的绳索动力学和基于间接接触的交互 —— 绳索通过摩擦和清扫运动变形并将力传递给颗粒。
本文在 6 个仿真任务(绳索、颗粒、布料、仿真布料收集、绳索操纵、仿真绳索清扫)和 3 个真实世界任务(推箱子、真实布料收集、真实绳索清扫)中评估 ParticleFormer,全面对比其与主流基线在复杂场景下的动力学建模性能。
B 动力学预测的补充结果
本节提供仿真环境中动力学建模对比的补充结果。
B.1 动力学预测对比
表 2 展示了三个单一材料任务的动力学预测性能对比。结果表明,ParticleFormer 在 MSE 和 CD+HD 指标上均表现更优,凸显其在全局结构和细粒度局部运动建模上的准确性。多材料任务的结果见表 1。
表2:动力学预测的补充定量结果。我们报告了三个单材料仿真任务的预测误差,这些任务中可获取目标真实状态信息用于计算评估指标。由于DINO-WM不提供粒子间的点对点对应关系,我们仅使用基于点云的指标对其进行评估。
B.2 超参数分析
作为图 4 的补充结果,我们分析了 GBND [21] 中 TopK 超参数对训练时 GPU 内存使用的影响(所有模型均使用 200 个场景粒子的输入簇评估)。图 8 显示,增大 TopK 会导致每轮训练的内存消耗显著增加,这反映了基于图的动力学模型的可扩展性挑战。
此外,我们观察到 GBND 对另一关键超参数(用于构建粒子间边的最大距离阈值,记为 MaxDist)也高度敏感。该参数直接影响图中单次消息传递的信息传播范围。我们在布料任务中进行消融实验分析其影响,结果如图 9 所示。
图9:最大距离(MaxDist)对GBND动力学精度的影响。由于GBND中的信息传播依赖于图的拓扑结构,其性能对构建边的最大距离阈值高度敏感。相比之下,ParticleFormer通过基于注意力的交互方式规避了这种敏感性。
具体而言,我们对比了三种条件下的动力学预测误差(MSE):
(1)末端执行器粒子与所有布料粒子连接;
(2)仅允许短距离连接(MaxDist=0.3);
(3)允许长距离连接(MaxDist=0.7)。
结果显示,GBND 的动力学准确性随该设置显著变化,凸显其对边构建规则的依赖性。相比之下,ParticleFormer 通过基于注意力的 Transformer 编码器规避了这些限制,实现更稳定、准确的性能。
C 基于模型的规划与控制补充结果
本节提供在三个多对象、多材料仿真任务中,使用 ParticleFormer 和基线方法训练的世界模型进行基于模型的视觉运动控制的补充结果。图 10 的定性结果表明,与先前方法相比,ParticleFormer 在下游操作任务中实现了更细粒度、更高质量的控制行为。

更多推荐










所有评论(0)