Manual2Skill——让VLM从装配手册中提取装配步骤,随后做姿态估计,最终完成IKEA家具的自动组装(含IKEA-Manuals的详解)
前言
目前我和多个合伙人共管4个办公室:北京、长沙、武汉、南京,而我和阳则共管长沙
- 具体而言,我是三年前到的长沙,一开始起步艰难,但到底在一个半月(25年6.4-7.19)便把长沙的具身团队给迅速培养起来了——换言之,现在 给我任何一支5-10人的大模型团队,我或技术合伙人都可以在一个月之内把其迅速转型到具身,并具备复现顶级具身模型的能力
- 而三年前 我很难想到,会在具身闯出一条路 开辟一片新天地,23年还经历过大模型开发,不过 如今也算完美结合了
————————
昨天下午,一客户朋友称看了我CSDN上的文章 受益匪浅(每周都好几个朋友如此对我说,感谢大伙的支持)
并问我:“ 我是某某汽车这边 刚开始做机器人方向 后面想在工厂用起来 你们有做有关工厂相关应用吗 ”
我回复说,“ 我们做的目前涉及
- 工厂相关
机械臂层面偏智能装配、各种场景的插拔(比如电源插拔、耳机插孔)
人形层面,偏搬运 - 工厂之外
则围绕『展厅讲解、实验室检化验(精细操作)、电力巡检(导航 + 操作)』等较多 ”
说到智能装配,其重要性不言而喻,且其对工厂的提效深深的吸引我,毕竟不只是纯粹的做桌面demo或秀花活,而是实实在在的促进生成制造效率
- 比如现在绝大部分生产线只是实现了自动装配,但一旦型号一变、大小一变——比如装配微波炉,产线便得暂停以切换程序
而最理想的情况是,不论什么型号、大小,只要变化不大,最好是不用暂停产线 也不用切换程序,而是同一套程序、同一套机械臂继续装配,如此便可达到效率的最大化 - 虽然现在切换程序也很快,而且此种智能方案短时间内 也没法代替传统方案,但趋势是挡不住的,且随着智能装配技术的日渐成熟,最终各个工厂都会实现该种智能装配
而提到智能装配,本文要介绍的Manual2Skill是很值得一读的论文,我其实几个月前 便关注到了,但此前一直没来得及解读
有两点特别值得一提的是
- 论文中提到:“ 装配插入属于高度接触型任务,需要多模态传感(如力传感器和闭环控制)以确保精确对齐和牢固连接,将在后续研究中深入探讨,在Manual2Skill当前的方法中,插入操作由人类专家手动完成 ”
这点,和我之前的判断是一致的——我之前也认为插拔这个场景 最好还是带有力反馈或触觉,也类似我此前解读的这个工作《VITAL——结合ResNet视觉与MLP触觉且带语义增强的适用于精密插拔的可泛化BC:先VLM定位、后执行在线残差RL微调的策略(MLP作为动作头)》- 我的解读 并没有严格按照原论文的顺序来
比如原论文是先阐述Manual2Skill的三步骤「VLM生成分层装配图、位姿估计、装配执行」的理论方法,然后再介绍各自对应的实验评估
先阐述三步骤的方法论 再说实验也没问题,但我考虑到 这三个步骤,每个步骤中的理论细节都很多,而理论方法是指导实验的:是紧密联系的
如果分开介绍,可能会因为理论细节太多 容易遗忘,导致读者在看实验评估时往往需要回顾理论细节,从而不得不老是需要大幅度 往上翻理论部分,回顾完之后再往下接着看实验部分
如此,大幅度拖上拖下,很影响阅读体验
故此,我把同一个步骤中的理论方法与实验评估放在了一块解读
PS,我司准备在八月下旬复现一下这个工作,顺带提前建了一个「七月:插拔与装配(含HIL-SERL)」,有兴趣加群者,可私我一两句简介(比如在哪个高校/公司即可),然后邀你加入
第一部分 Manual2Skill的方法论与对应的实验评估
1.0 引言、相关工作、问题表述/方法论
1.0.1 引言
如原论文所说,人类可以通过图像或文本中的说明学习操作技能;例如,人们可以通过遵循说明手册来组装宜家家具或乐高模型。这一能力使人类能够高效地从手绘说明中习得具有长时间跨度的操作技能
- 相比之下,机器人通常通过
模仿学习[59-A survey of imitation learning: Algorithms, recent developments, and challenges]
或强化学习[43-Deep reinforcement learning for robotics: A survey of realworld successes]
来学习此类技能,这两种方法都需要显著更多的数据和计算资源
故让机器人能够像人类一样将抽象的操作手册转化为现实世界的动作,仍然是一个重大挑战。毕竟手册通常是为人类理解而设计,采用简单的示意图和符号来传达操作过程
总之,这种抽象性使得机器人难以理解这些说明,并从中推导出可执行的操作策略
32-Ikea manuals at work: 4d grounding of assembly instructions on internet videos,2024
49-Ikea-manual: Seeing shape assembly step by step,2022
48-Translating a visual lego manual to a machine-executable plan - 因此,开发一种方法,使机器人能够有效利用人类设计的手册,将极大地提升其应对复杂、长时序任务的能力,同时减少大量示范数据的采集需求
手册本质上编码了复杂任务的结构信息
- 它们将高层目标分解为中层子目标,并捕捉任务流程及其依赖关系,例如顺序步骤或可并行的子任务。例如,家具组装手册指导组件的准备与组合,并确保所有步骤按照正确顺序进行[32-Ikea manuals at work]
提取这种结构对于机器人复制类似人类的理解并有效管理复杂任务至关重要
19-Roboexp: Action-conditioned scene graph via interactive exploration for robotic manipulation
33-Structurenet: Hierarchical graph networks for 3d shape generation - 在完成任务分解后,机器人需要推断每一步的具体信息,如涉及的组件及其空间关系。例如,在烹饪任务中,说明图片和文本可能涉及选择食材、工具和器皿,并按特定顺序进行排列[38-Robocook: Long-horizon elasto-plastic object manipulation with diverse tools]
- 最后,机器人需要生成一系列动作来完成任务,如抓取、放置和连接组件
以往的研究尝试
利用草图图片[42-Rt-sketch: Goal-conditioned imitation learning from hand-drawn sketches]
或轨迹[15-Rt-trajectory: Robotic task generalization via hindsight trajectory sketches]
来学习操作技能,但这些方法总是局限于相对简单的台面任务
25年2月,来自1 新加坡国立大学、2 多伦多大学、3 北京大学、4 四川大学、5 浙江大学的研究者提出了Manual2Skill
- 其对应的paper为《Manual2Skill: Learning to Read Manuals and Acquire Robotic Skills for Furniture Assembly Using Vision-Language Models》
其作者包括:Chenrui Tie1*, Shengxiang Sun2*, Jinxuan Zhu1, Yiwei Liu4, Jingxiang Guo1, Yue Hu5, Haonan Chen1, Junting Chen1, Ruihai Wu3, Lin Shao1 - 其项目地址为:owensun2004.github.io/Furniture-Assembly-Web
其GitHub地址为:github.com/owensun2004/Manual2Skill
截止到26年7月中旬,此仓库包含 Manual2Skill 中两个关键部分的代码:
分层组装图生成
逐步装配姿态估计
其能够从视觉说明手册中学习操作技能。该框架可用于自动组装IKEA家具,这是一项具有挑战性且实用的任务,需要复杂的操作技能

- 具体而言,给定一组手册图片和实际家具部件,作者首先利用视觉语言模型理解手册内容,并提取装配结构,将其表示为分层图
- 随后,训练模型以估算每个步骤中所有相关组件的装配姿态
- 最后,运动规划模块生成动作序列,将选定组件移动到目标姿态,并在机器人上执行这些动作以完成家具组装
1.0.2 相关工作
第一,对于家具组装
零件装配一直是一个长期存在的难题,已有大量研究致力于探索如何将单独的组件或零件组装成完整的形状
- 6-Neural shape mating: Self-supervised object assembly with adversarial shape priors
- 13-Learning how to match fresco fragments
- 20-Automate: A dataset and learning approach for automatic mating of cad assemblies
- 27-Ikea furniture assembly environment for long-horizon complex manipulation tasks
- 29-Learning 3d part assembly from a single image
- 36-Diffassemble: A unified graph-diffusion model for 2d and 3d reassembly
- 53-Leveraging se (3) equivariance for learning 3d geometric shape assembly
- 46-Asap: Automated sequence planning for complex robotic assembly with physical feasibility
- 45-Assemble them all: Physics-based planning for generalizable assembly by disassembly
总体而言,可以将零件装配分为几何装配和语义装配两类
- 几何装配仅依赖于几何线索,例如表面形状或边缘特征,来判断部件如何装配在一起
6-Neural shape mating: Self-supervised object assembly with adversarial shape priors
53-Leveraging se (3) equivariance for learning 3d geometric shape assembly
37-Breaking bad: A dataset for geometric fracture and reassembly
10-Generative 3d part assembly via part-whole-hierarchy message passing - 相比之下,语义装配主要利用关于部件的高级语义信息来引导装配过程
13-Learning how to match fresco fragments
20-Automate: A dataset and learning approach for automatic mating of cad assemblies
27-Ikea furniture assembly environment for long-horizon complex manipulation tasks
29-Learning 3d part assembly from a single image
45-Assemble them all: Physics-based planning for generalizable assembly by disassembly
家具组装是一项具有代表性的语义组装任务,其中每个部件都有预定义的语义角色(例如,椅子腿或桌面),组装过程遵循直观且符合常识的关系(例如,椅子腿必须连接到椅子座位)
以往关于家具组装的研究主要针对该问题的不同方面,包括运动规划
41-Can robots assemble an ikea chair?
多机器人协作
25-Ikeabot: An autonomous multi-robot coordinated furniture assembly system
以及组装姿态估计
29-Learning 3d part assembly from a single image
58-Roboassembly: Learning generalizable furniture assembly policy in a novel multi-robot contact-rich simulation environment
30-Category-level multi-part multijoint 3d shape assembly
研究人员还开发了若干数据集和仿真环境以促进该领域的研究。例如
Wang等人[49-Ikea-manual: Seeing shape assembly step by step]
和Liu等人[32-Ikea manuals at work:4d grounding of assembly instructions on internet videos]
引入了包含家具三维模型和基于说明书结构化组装步骤的IKEA家具组装数据集
此外,Lee等人[27-Ikea furniture assembly environment for long-horizon complex manipulation tasks]
和Yu等人[58-Roboassembly: Learning generalizable furniture assembly policy in a novel multi-robot contact-rich simulation environment]开发了用于IKEA家具组装的仿真环境
而Heo等人[16-Furniturebench: Reproducible real-world benchmark for long-horizon complex manipulation]则提供了可复现的真实家具组装基准
然而,现有工作通常侧重于特定子问题,而未能涵盖整个组装流程。在本研究中,作者旨在开发一个全面的框架,从说明书中学习家具组装的顺序过程,并将其应用于真实世界的实验中
第二,对于VLM引导的机器人学习
视觉语言模型VLMs [57-A survey on multimodal large language models]已被广泛应用于机器人领域,用于
- 理解环境[17-Copa: General robotic manipulation through spatial constraints of parts with foundation models]
- 和与人类交互[39-Yell at your robot: Improving on-the-fly from language corrections]
近期的进展突显了VLM通过融合视觉与语言信息提升机器人学习能力的潜力,使机器人能够以更强的适应性和效率完成复杂任务[18-李飞飞团队推出的Rekep]
- 一个有前景的方向是开发视觉语言动作模型(VLA Model),该模型可基于视觉和语言输入生成动作
2-π0
23-Openvla
3-Rt-2
44-Octo
然而,训练此类模型需要大量数据,并且在处理长时序或复杂操作任务时仍存在挑战 - 另一个方向是利用VLM为机器人学习提供高层次指令和感知理解
VLM可辅助
任务描述[17-Copa, 18-rekep]
环境理解[19-Roboexp: Action-conditioned scene graph via interactive exploration for robotic manipulation]
任务规划
47-Chatgpt for robotics: Design principles and model abilities
56-React: Synergizing reasoning and acting in language models
62-large language models as commonsense knowledge for largescale task planning
甚至直接进行机器人控制[28-Manipllm: Embodied multimodal large language model for object-centric robotic manipulation]
此外,Goldberg等人[14-Blox-net: Generative design-for-robot-assembly using vlm supervision, physics simulation, and a robot with reset]展示了VLM如何协助机器人装配任务的设计
在这些见解基础上,作者进一步探索VLM如何解读抽象手册并提取结构化信息,以指导机器人技能学习,特别是针对长时序操作任务
第三,对于从演示中学习
从演示中学习(LfD)在获取机器人操作技能方面取得了令人瞩目的成果 [12-mobile aloha, 64-Viola: Imitation learning for vision-based manipulation with object proposal priors, 7-Diffusion policy]
- 关于机器人装配中LfD的更全面综述,可参考Zhu和Hu的工作 [65-Robot learning from
demonstration in robotic assembly: A survey]
其核心思想是学习一种能够模仿专家的行为的策略
然而,先前的学习方法通常需要细粒度的示范,例如
机器人轨迹[7-Diffusion policy]
或视频
22-Egomimic: Scaling imitation learning via egocentric video
40-Roboclip: One demonstration is enough to learn robot policies
21-View: Visual imitation learning with waypoints
收集这些示范往往非常耗费人力,并且并不总是可行 - 有些研究提出从粗粒度的示范中学习,比如手绘的期望场景草图[42-Rt-sketch: Goal-conditioned imitation learning from hand-drawn sketches, 2024]
或粗略的轨迹草图[15-Rt-trajectory: Robotic task generalization via hindsight trajectory sketches]
这些方法减少了对专家示范的依赖,提高了模仿学习(LfD)的实用性
然而,它们大多仅限于桌面操作任务,并且难以很好地推广到更复杂、长周期的装配问题
在本研究中,作者旨在突破这些限制,通过利用抽象的说明手册,解决更具挑战性的装配任务,从而扩展LfD的应用范围
1.0.3 Manual2Skill的完整方法论:VLM生成分层装配图、位姿估计、装配执行(含坐标对齐)
给定一套完整的三维装配零件及其装配手册,作者的目标是为自主家具装配生成一组物理可行的机器人装配动作序列。手册通常采用示意图和符号,以抽象的方式逐步展示装配步骤,使其具有普遍可理解性
- 可将手册页面定义为一组 N张图像,
,其中每张图像
展示了装配过程中的特定步骤,例如某些零件或子组件的组合
- 家具由 M 个独立部件 P 组成,
。零件是
中的单个元素,在装配前与其他部分保持分离
子装配是指由部分或全部已装配的结构,且构成P的一个真子集(例如,)。术语“组件”包括零件和子装配
- 根据手册和3D零件,系统生成装配方案。每一步都对应一张手册图片,并明确涉及的零部件和子组件、它们的空间6D位姿,以及执行所需的装配动作或运动轨迹
Manual2Skill通过利用VLM解读宜家风格的手册,实现家具装配的自动化
- 给定一份可视化手册和预装配场景中的物理部件,VLM会生成一个分层装配图,明确每一步涉及的部件和子组件
- 随后,针对每一步,位姿估计算法会结合手册图像与相关部件的点云,预测每个组件的 6D位姿
- 最后,在装配执行阶段,预测的位姿会被转换到机器人的世界坐标系,并由运动规划器生成无碰撞的装配轨迹,实现部件的对接
1.1 步骤一:VLM生成的分层装配图的方法与实验
1.1.1 VLM引导的分层装配图生成(含附录E)
本节展示了VLM如何解读IKEA风格的说明书,以生成高级装配计划。给定一份说明书和一张包含家具零部件的实景图片(装配前场景图),VLM能够预测出分层装配图
- 作者在下图图2中展示了一个示例「(1) 使用 GPT-4o [1] 查询操作手册,生成一个顺序装配计划,该计划以分层装配图的形式表示。(2) 家具部件的点云和对应的手册图片由位姿估计模块处理,以预测每个部件的目标位姿。(3) 系统根据分层装配图和估算的位姿,依次规划并执行机器人装配动作」
在该图中,叶节点表示基本零件,非叶节点则表示子组件。可将该图划分为多层,每一层包含在单一步骤中需要装配的零件或子组件节点(对应于一张说明书图片)。从子节点指向父节点的有向边表明系统将父节点由所有子节点组装而成
- 此外,还在等价零件之间添加边,表示这些零件是相同的(例如椅子的四条腿)。将装配过程表示为分层图,可以将装配流程分解为顺序步骤,同时明确所需的零件和子组件。分层图的正式定义见附录J
作者通过两个阶段实现这一目标:将说明书与实际零件关联,以及识别每张图片中所需的零件
- 当然,能实现该目标,本质上得益于VLM能力与通用提示结构:毕竟该任务本质上具有高度复杂性,因为输入图像类型多样。手册中的图像通常为抽象草图,而预装配场景图像则为高分辨率的真实世界照片
- 这种多样性要求具备跨不同图像领域的高级视觉识别与空间推理能力,而VLM由于在大规模互联网数据集上的训练,正好具备这些优势
每个VLM提示由两个部分组成:
- 图像集:包括所有手册页面和真实世界的预装配场景图像。与传统机器人领域的VLM应用[23-Openvla, 18-Rekep]仅处理单张图像不同,需要对多张图像进行推理
- 文本指令:这些指令为任务提供特定上下文,引导模型解释图像集。指令内容从简单指令到链式思维(Chain-of-Thought,CoT)推理 [51-Chain-of-thought prompting elicits reasoning in large language models] 不等
所有指令均包含上下文学习示例,明确规定所需的输出格式——无论是 JSON、Python 代码还是自然语言。这一结构对于该任务下的的多阶段流程至关重要,确保输出结构良好、易于解释,并能无缝集成到后续阶段
第一阶段:将真实部件与说明书关联
给定说明书封面上已组装家具的草图以及装配前场景图像,VLM旨在将物理部件与说明书进行关联
- VLM 通过对说明书插图进行语义解释,预测每个物理部件的角色,从而实现这一目标
该过程涉及分析说明书插图中的空间、上下文和功能线索,以全面理解每个物理部件作者的方法采用 CoT [51]和 Least-to-Most [63- Least-to-most prompting enables complex reasoning in large language models] 提示策略,以提高准确性
为了提升部件识别能力,作者采用
Set of Marks [55- Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v]
和
GroundingDINO [31-Grounding dino: Marrying dino with grounded pre-training for open-set object detection] 自动标注部件——在预装配场景图像上以数字索引标注
带有标签的场景图像和手工草图共同构成图像集 - 文本说明包括对关联任务的简要背景解释,即预测每个物理部件的角色,并附有输出结构的上下文示例:{name, label, role}
例如,在图2的阶段I输出中
作者将椅子的座位描述为:名称:座架,标签:[2],角色:供人坐在椅子上,座位提供了基本的支撑和舒适感,并位于椅子框架的中央
we describe the chair’s seat as name: seat frame, label: [2], role: for people sitting on a chair, the seat offers essential support and comfortand is positioned centrally with in the chair’s frame.
这里的“[2]”表示该三元组对应于预装配场景图像中用索引2标记的物理部件。该三元组格式通过将所有输出结构化为统一的数据格式,提高了可解释性并确保了一致性
最终,将图像集和文本说明作为VLM『具体为GPT-4o [1]』的输入提示,并一次性查询以生成所有物理部件的实际分配 - 随后,作者将这些标签作为分层装配图中的叶节点——可以通过这些三元组获得等价部件
当两个物理部件具有相同的几何形状时,它们的三元组仅在标签上有所不同
例如,在图2阶段I的输出中
{name: side frame, label: [0], role:...}
和
{name: sideframe, label: [1], role:...}——这两个部件被认为是等价的
理解等价部件之间的关系对于下游模块至关重要,这一点会在下文的消融实验中得到了验证(对应于原论文附录C)
第二阶段:识别每一步骤中涉及的部件
本阶段主要关注于识别每个手册页面中所涉及的具体部件和子组件。VLM 通过推理插图装配步骤,结合上一阶段获得的三元组和标注的预装配场景作为辅助线索,来实现这一目标
在实际操作中,会发现手册中的无关元素(如钉子、人形图案)会干扰VLM。作者采用了来自文献[49]的裁剪版手册图片,仅保留家具部件和子组件,以便集中VLM的注意力(见图2阶段II图像集),从而显著提升了性能(详见附录E)

- 操作手册页面与上一阶段标注过的预装配场景共同构成了图像集。文本说明则采用链式思维提示,引导视觉语言模型(VLM)逐步识别零部件及子组件,并包含用于澄清结构化输出格式的上下文示例:即由(步骤N,涉及的标注部件)组成的配对
图2左下角的输出展示了该格式的一个示例。图像集与文本说明共同组成了GPT-4o的输入提示,GPT-4o通过一次查询即可为所有装配步骤生成配对结果
如图2所示,系统输出嵌套列表 - 作者随后将这些列表及其等价部分转化为层次化图结构。基于该装配图,作者遍历所有非叶节点,并探索多种装配顺序
形式上,可行的装配顺序是一个有序的非叶节点集合,保证父节点仅在其所有子节点之后出现
层次化图表示的一个关键优势在于其灵活性——由于装配序列不是唯一的,因此可以实现并行装配或有策略的装配顺序
如原论文附录E所示,对于装配图生成消融研究
由于操作手册页面提供了关键的视觉细节,例如每个步骤的零部件和子组件,这些细节会直接影响GPT-4o 的输出,因此作者在基于 VLM 的方案生成流程中评估了两个关键的设计选择:
- 是否包含手册页面以引导 VLM 对装配图的推理
- 以及(2)将分段手册页面(与完整手册相比)作为输入
如果完全排除手册页面
- 为了探究在不依赖手册图片、仅依靠VLM现有先验知识的情况下,修改后的框架是否能够完成任务,作者对流程进行了消融实验,移除了手册图片,仅提供预装配场景和简化的文本提示
在对全部102件家具进行测试时,该变体的表现较差,如表X(Ours(w/o Manual))所示
- VLM似乎能够利用一定的结构先验,对于零件数量不超过四个的简单家具,能够生成一些合理的装配方案
- 然而,对于更复杂的家具,其泛化能力明显不足。对每个装配方案进行人工检查后发现,存在一些常见的失败模式:VLM经常错误识别零件(例如,将长凳座面标记为“桌面”),生成物理上不合理的装配顺序(如在没有连接座面或支撑杆的情况下直接连接两条椅腿),并且在复杂家具装配时,每步通常只包含一到两个零件,尽管实际应同时组装多个零件
上述零件识别幻觉和装配步骤逻辑不一致的问题,凸显了仅依赖VLM学习到的先验知识的局限性,并强调了人工指导在生成复杂场景下准确且连贯装配方案中的重要性使用未分段的手册页
- 没有提供每个装配步骤对应的N个分段手册页,而是输入了包含M≥N页的完整手册,这引入了除零件和子组件之外的其他元素,例如钉子、连接件、紧固件和思维气泡,VLM必须理解这些内容。如表X(Ours(w/o Segmentation))所示
这种方法显著削弱了VLM在生成装配图时的表现,成功率准确率下降超过一倍
- 这种性能下降在GPT-4o、o1、Claude3.7 Sonnet和Qwen 2.5 Max中均有一致体现,表明当前VLM存在共同的局限性
作者推测,这些额外信息虽然与底层装配动作相关,但对高层次规划可能无益。它们可能为高层次规划引入噪声,使VLM在每一步骤所需的核心零件识别上分心
1.1.2 对「分层装配图生成」的实验评估(含附录D):涉及实验设置/评估指标/基线方法/结果
在本节中,作者评估基于VLM引导的分层装配图生成方法的性能
具体而言,作者使用IKEA-Manuals数据集[49]对第二阶段:识别每张图片中的部件进行评估。关于不对第一阶段进行评估的原因,我们在附录H中进行了说明
第一,在实验设置上
IKEA-Manuals数据集[49]包含102个家具项目,每个项目都配有IKEA说明书和3D零件,以及以嵌套列表树状结构表示的装配方案
对于每个物品,作者将其3D零件加载到Blender中,并渲染两张图像:
- 一张展示原始预装配场景,零件整齐排列;
- 另一张则展示场景变体,其中零件在地面平面上被随意扰动(如旋转和打乱)(见图4)

这种随机化引入了多样性,更好地模拟了现实世界中零件可能混乱无序的预装配场景
每一幅预装配场景的渲染图像及其说明书,都会按照上文「1.1.1 VLM引导的分层装配图生成——对应于原文第四节A部分」所述的流程,通过VLM进行处理,从而生成一个层次化的装配图
由于作者将装配图表示为嵌套列表,因此在符号表示上与IKEA说明书[49]中使用的装配树记法保持一致。在本小节中,作者将他们生成的装配图称为预测树
第二,在评估指标上
作者采用成功率(Success Rate)标准,该标准衡量预测树与真实树完全匹配的比例。只有当预测树中所有节点的子节点集合与其对应的真实树节点完全一致时,才认为预测树完全匹配。在计算树的匹配度时,所有等价部分都被视为相同
第三,在基线方法上
作者将基于VLM的方法与IKEA-Manuals [49]中提出的两种启发式方法进行了对比

- SingleStep 预测一个扁平的单层树结构,包含一个父节点和 n 个叶子节点
- GeoCluster采用预训练的DGCNN [50-Dynamic graph cnn for learning on point clouds],通过迭代方式将具有相似几何特征的家具部件归并为单一的装配步骤
与SingleStep方法相比,GeoCluster生成了更深的树结构,拥有更多的父节点和多个分层级别
第四,在结果上
- 如表X所示,理解和解析说明书是一项具有挑战性的任务。作者基于VLM的引导方法能够有效处理最多包含6个部件的家具说明书,这是一个重大突破,而基线方法即使在更简单的场景下也难以应对
- 这个≤6个部件的阈值反映了当前VLM在复杂视觉-空间推理任务中的能力。作者的框架具有良好的可扩展性,并能够从VLM的快速进步中持续受益
作者预计,随着更强大的VLM出现,性能还将进一步提升
表X还突出显示了VLM的泛化能力
且如图4所示
预装配场景的变化对装配图生成性能影响极小,在所有102件家具中,平均成功率下降不超过1%
此外,图3展示了两件家具的定性结果,更详细地说明了Manual2Skill方法的优势
关于使用和分割手册必要性的消融实验,详见附录E——上文「1.1.1 VLM引导的分层装配图生成」的最后有介绍附录E所述的内容
失败案例在附录F中有进一步说明。更多结果和提示模板分别见附录D和K
如原论文附录D所示,除了使用上文1.1.2节(对应于原论文第V-A节)中定义的成功率指标来评估VLM装配图生成外,作者还使用 IKEA-Manuals 数据集 [50] 中的评估指标提供了额外的分析
- 这些指标包括准确率(Precision)、召回率(Recall)、F1 分数、简单匹配(Simple Matching)和严格匹配(Hard Matching),如表 VIII 所示
有关这些指标的详细说明,请参见文献[49]
- 此外,作者对全部 102 件家具物品进行了更为细致的分类,并对每个部件数量从 2 到 16 的单独情况进行了严格匹配结果的统计,详见表 IX
为了获得所需的分数,作者使用相同的输入和温度为0的设置,重复运行了该实验7次。即使将温度设为0,仍然重复采样,以考虑GPT-4o [1] 输出中可能出现的细微差异,并捕捉可能结果的范围。这种方法能够更好地估算模型的真实性能。在所有与装配方案生成相关的表格中,作者选择报告最佳分数,因为所有测试中平均分数与最佳分数相似,且差异在5%以内
为了比较GPT-4o [1] 生成的树与数据集中真实标签树之间的差异
- 作者考虑了部件之间的等价关系,这会导致存在多种有效的真实标签树。例如,如果部件1和2是等价的,而[[1, 3], 2] 是一个有效的树结构,那么 [[2, 3], 1] 也是有效的。由于数据集未考虑树的同构性,作者为每个102件家具手动定义了所有等价部件
- 随后,作者利用这些等价部件对预测树进行排列,对每种排列与真实标签进行比较,并选取最高得分。对于包含13个及以上部件的家具(共6件),由于排列计算成本较高,作者采用了人工验证的方法
总体而言,通过这种排列方法评估预测树,作者的总体指标得分提升了约5%。为确保公平,作者也对两个基线方法应用了该排列,但未见显著效果如文献[49]所述,SingleStep 始终输出根节点,并将所有其他节点选为其子节点,因此在所有情况下的简单匹配中实现了完美的精确度。除此之外,基于 GPT-4o 的方法在表 VIII 所有类别中均优于两种基线方法
这突显了视觉语言模型(VLMs)在理解手册和设计可靠分层装配图方面的有效性
同样地,在表IX中
- 作者的方法在所有零件数量下均显著优于两个基线方法。所展示的性能分数是通过取Precision、Recall和F1 Score三者中的最大值计算得出
- Mask Seg是我们评估的另一种方法,它将IKEA-Manuals数据集[49]中的分割掩码叠加在手册页面上(见附录K,提示3.a),从而提升了零件识别、图像清晰度以及装配步骤的理解
尽管MaskSeg在有掩码分割时的表现略优于原始无掩码版本,但作者在所有报告的表格中均采用了后者。原因在于,在实际场景中获取这些掩码的成本较高
总体来看,趋势表明:对于零件较少的家具,分数和准确率更高;而随着零件数量的增加,分数会降低
1.2 步骤二:姿态估计的方法与实验
1.2.1 每步装配姿态估计(含附录A和B):涉及模型架构和损失函数
在给定装配顺序的情况下,训练一个模型,用于在装配过程的每一步估算组件(零件或子组件)的姿态
- 在每一步,模型输入装配手册图像以及相关组件的点云,预测它们的目标姿态,以确保正确对齐
为支持该任务,作者构建了一个用于序列化姿态估计的数据集。详细描述见附录A
对于每个组件的点云(无论是通过真实世界扫描还是来自作者的数据集获得),首先通过将其质心平移到原点来进行居中处理 - 接下来,应用主成分分析(PCA)以识别主要的物体轴线,这些轴线定义了规范的坐标系。最主要的轴线作为参考系,从而确保了基于形状的、一致的朝向,并且该朝向不依赖于任意的坐标系统
作者创建的数据集为每个组件在相应说明书图像的相机坐标系下,提供了说明书图像、点云以及目标位姿「参见[29- Learning 3d part assembly from a single image]」
对于说明书图像Ii所描述的一个装配步骤,模型的输入包括:
- 说明书图像
- 所有相关组件的点云
输出则是每个组件在相机坐标系下的目标位姿
如原论文附录A所示,对于每步装配姿态估计算法数据集
作者为所提出的人工引导逐步装配姿态估计任务构建了一个数据集。每条数据为一个元组 (
),其中
表示人工操作图像
表示该装配步骤中所有组件的点云
表示每个组件的目标姿态
表示组件之间的空间和几何关系
现实世界中的说明手册种类繁多。为了覆盖在实际场景中可能遇到的各种情况,在构建数据集时,作者考虑了三种可能的说明手册变体,如图9所示
作者的数据集包含了多种家具形状。对于每一件家具,随机选择一些相连的部件组成不同的子组件。同时,每个子组件都有多种可能的相机拍摄视角。这一定义使数据集能够覆盖现实场景中可能遇到的各类手册
- 形式上,对于由 M 个部件组成的家具,作者随机选择 m 个相连的部件来形成一个子装配体
记为
其中每个都是一个原子部件
- 然后,将这 m个原子部件随机分为 n 个组件,同时保证同一组内的所有部件都是相连的,记为
其中每个表示第
个组件中的原子部分数量,因此
作者对点进行采样每个组件的点云由该数据片段的点云组成
作者还可以从不同角度拍摄子组件的照片,更为辅助信息中的对应部分提供了注释总之,在本文中,作者提出了新的技术方法,以利用每个装配步骤的辅助信息,从而显著提升了我们位姿估计算法的精度和鲁棒性
首先,对于模型架构
需要注意的是,每一步的组件数量并不固定,这取决于家具的子装配划分。作者的位姿估计模型(pose estimation model )包含四个部分——如下图第2部分所示:

- 图像编码器
- 点云编码器
- 跨模态融合模块(cross-modality fusion module)
- 以及位姿回归器(pose regressor)
具体而言
- 首先将说明书图像
输入图像编码器,以获得图像特征图
- 然后,将点云输入点云编码器,以获得每个部件的点云特征
为了融合来自手工图像和点云特征的多模态信息,作者利用GNN [54]对每个部件的信息进行更新。且将手工图像特征和按部件划分的点云特征视为完全图中的节点,并采用GNN对每个节点的信息进行更新
其中是更新后的图像和点云特征
- 最后,将更新后的点云特征输入位姿回归器,以获得每个组件的目标位姿
其次,对于损失函数
综合考虑了姿态预测的准确性和点云对齐,方法参照 [60, 30]
- 第一项对预测的 SE(3) 变换中的误差进行惩罚
- 第二项则衡量预测点云与真实点云之间的距离
为处理可互换组件,作者对所有等价部件的可能排列计算损失,并选择最小损失作为最终训练目标。关于损失函数的具体形式和训练策略,详见附录B
如原论文附录B所示,姿态估计的损失函数具体怎么设计呢
旋转测地线损失:在三维姿态预测任务中,通常使用旋转测地线损失来衡量两个旋转之间的距离[53]
- 具体而言,给定真实旋转矩阵
和预测旋转矩阵
,旋转测地线损失定义为:
其中表示矩阵的迹,
表示 R 的转置
- 平移均方误差损失:参照 [29],作者采用均方误差(MSE)损失来衡量真实平移
与预测平移
之间的距离
- Chamfer 距离损失:该损失函数最小化预测点云与真实点云之间的整体距离。设真实点云为
,预测点云为
,其定义如下
其中,是应用真实 6D 姿态变换后的点云,
是应用预测 6D 姿态变换后的点云
- 点云MSE损失:作者通过将预测的旋转应用于组件的点,并使用MSE损失来衡量旋转后点与真实点之间的距离,从而对预测的旋转进行监督
- 等价零件:给定一组组件,作者可能会遇到需要在不同位置组装的几何等价零件。受[60]的启发,将这些几何等价的组件进行分组,并添加一个额外的损失项,以确保将它们组装在不同的位置
对于每一组等价组件,将预测的变换应用于每个组件的点云,然后计算变换后点云之间的Chamfer距离(CD)
对于同一组内的所有成对,作者计算变换后点云
和
之间的Chamfer距离,并鼓励该距离较大
最后,作者将整体损失函数定义为上述各损失项的加权和:
其中,λ1 = 1, λ2 = 1, λ3 = 1, λ4 = 20, λ5 = 0.1
1.2.2 对「每步装配姿态估计」的实验评估(含附录B和C):涉及数据准备/训练细节/基线方法/评估指标/结果/消融实验
本节包含附录B中对于均值-最大池化的阐述
第一,对于数据准备
作者从 PartNet [34- Partnet: A large-scale benchmark for fine-grained and hierarchical part-level 3d object understanding] 中选择了三类家具物品:椅子、桌子和灯具。对于每个类别,作者各选取了 100 件家具,并为每件家具生成 10 组部件选择和子装配划分
为了生成装配手册图片,作者使用Blender的Freestyle功能,在20个随机相机姿态下渲染零件的示意图。关于此部分的更多细节,在附录A中进行了说明
总体而言,作者为每个类别生成了12,000条训练数据和5,200条测试数据
第二,对于训练细节

- 对于图像编码器
,作者选择了DeepLabV3+的编码器组件,该组件以MobileNetV2为主干,并包含空洞空间金字塔池化(ASPP)模块
之所以做出这一选择,是因为DeepLabV3+在自动编码器的基础上引入了空洞卷积,使模型能够有效捕捉多尺度结构和空间信息
4-Deeplab: Semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected crfs
5- Encoder-decoder with atrous separable convolution for semantic image segmentation
它能够从图像I生成多通道特征图,且采用mean-max pool [61-Learning universal sentence representations with mean-max attention autoencoder]方法来提取全局向量从特征图中提取特征
- 对于点云编码器EP,作者采用了PointNet++ [35-Pointnet++: Deep hierarchical feature learning on point sets in a metric space]的编码器部分
对于每个零件和子组件,提取一个基于零件的特征
对于GNNEG,使用了三层图转换器 [8-Distillation of msa embeddings to folded protein structures with graph transformers] - 位姿回归器R是一个三层MLP
关于图像特征的mean-max池化以及我们的训练超参数设置,详见附录B
如原论文附录B所示,对于均值-最大池化
均值-最大池化的核心机制是在一组具有相同维度的向量或矩阵的某一维度
上,分别计算其均值和最大值,并将结果拼接成一个
维的一维向量,从而获得全局特征
- 对于一维向量,作者在序列长度维度上取均值和最大值。对于二维矩阵,作者在高度×宽度维度上取均值和最大值
其中,作者将F设为128- 作者在本研究中两次使用了这一技巧。其中一次是在从多通道特征图获得带有通道维度的一维向量时,从而为图像获得了一维特征向量
在这种情况下,作者可以将均值-最大池化表达如下
其中,X是图像的多通道特征图,维度为通道数(C)×高度(H)×宽度(W),avg和max分别表示长度为通道数的一维向量
因此,多通道特征图的是一个C维向量
- 另一种情况是作者对比基线时。为了按部件聚合点云特征,并获得形状的全局一维特征,将均值-最大池化表达为如下形式:
这里,作者令M表示一个形状中的部件数量。在该基线方法中,对于每个部件,将一维图像特征、全局点云特征
(均通过均值-最大池化获得)以及部件级点云特征
进行拼接,从而形成一维的跨模态特征
随后,将该特征作为姿态回归器MLP的输入
对于姿态估计训练中的超参数
- 作者在单张NVIDIA A100 40GB GPU上训练姿态估计模型,批量大小为32。每个实验运行800个周期(约46小时)。学习率设为1e−5,并采用10个周期的线性预热阶段
- 之后,使用余弦退火策略衰减学习率
且还将权重衰减设为1e−7。模型各组件的优化器配置如表V所示
第三,对于基线方法
作者在所提出的逐步装配位姿估计数据集上评估了他们方法的性能。作者将他们的方法与两种基线方法进行了比较
- Li 等人 [29-Learning 3d part assembly from a single image] 提出了一种基于单幅图像引导的三维物体姿态估计算法
- Mean-Max Pool 是Manual2Skill方法的一种变体,用均值-最大池化技巧替代了 GNN,这与作者从多通道特征图中获得一维向量的方法类似,具体细节见附录 B
第四,对于评估指标
作者采用了全面的评估指标来衡量我们方法及基线方法的性能
- 测地距离(GD),用于衡量预测旋转与真实旋转在单位球面上的最短路径距离
- 均方根误差(RMSE),用于衡量预测姿态与真实姿态之间的欧几里得距离
- Chamfer距离(CD),用于计算预测点云与真实点云之间的整体距离
- 部件准确率(PA),用于计算预测点云与真实点云之间的Chamfer距离;如果该距离小于0.01米,则认为该部件“放置正确”
第五,对于结果
如表II所示

作者的方法在所有评估指标以及三类家具上均优于Li等人[29]和mean-max池化变体。作者将这一优势归因于他们多模态特征融合以及GNN在捕捉部件空间关系方面的有效性
作者还在图5中为每类家具提供了定性结果

第六,对于消融实验
为了评估等效零部件、引导图像以及关于子组件的逐步数据的影响,我们对这些组件进行了消融实验。相关细节和结果详见附录C
如原文附录C所示,姿态估计消融研究
为了评估流程中各个组件的有效性,作者在椅子类别上进行了消融实验,作者在表VI中展示了定量结果
在图10中展示了定性结果
- 首先,移除了图像输入,仅使用点云输入来预测姿态,结果性能显著下降,这表明图像输入对于姿态估计至关重要
- 其次,移除了等价部件的置换机制(公式(12))
如可视化结果所示,模型无法区分等价部件,导致两条腿被放置在相似的位置以往的研究通常只对完全组装好的形状进行训练和预测。相比之下,作者的姿态估计算法数据集包含了每一步的数据(即子装配体)
作者进行了消融实验,对比了以下两种设置
- 不含每步数据:在仅包含完全组装形状的数据集上进行训练和测试
- 逐步:在包含逐步数据的数据集上进行训练,并在完整组装形状上进行测试
如表 VII 所示
加入逐步数据能够提升组装预测的准确率,这表明逐步推理能够增强机器人组装的性能
1.3 步骤三:机器人装配动作生成与整体性能的评估
1.3.1 机器人装配动作生成:先位姿与坐标系对齐、后装配执行(含零件抓取/装配轨迹/装配插入)
首先,将预测的位姿与世界坐标系对齐
在每个装配步骤中,前一阶段会预测每个组件在手动图像的相机坐标系下的位姿。然而,实际的机器人系统是在其世界坐标系下运行的,因此需要在这些坐标之间进行6D变换
- 以两个组件A和B为例,预测的目标位姿在相机坐标系下分别记为
和
同时,他们的系统能够采集到零件在世界坐标系下的当前6D位姿,表示为
- 为了将
与
对齐,作者计算6D变换矩阵
,将相机坐标系映射到世界坐标系
使用相同的变换,作者计算出组装目标姿态在世界坐标系下的
部件(以及所有剩余组件)的组装目标姿态
该变换能够将预测的姿态从手动图像坐标系准确映射到机器人世界坐标系,从而确保装配过程的精确执行
其次,装配执行
一旦我们的系统确定了当前装配步骤中每个组件在世界坐标系下的目标位姿,就会抓取每个组件,并生成所需的装配动作序列
相当于具体分为以下三大步骤
- 零件抓取
在扫描每个实际零件后,便可获得了每个零件对应的3D网格
然后采用FoundationPose——统一的 6D 姿态估计和新物体跟踪 [52-Foundationpose: Unified 6d pose estimation and tracking
of novel objects]
和
Segment Anything Model(SAM)[24]
来获取场景中所有零件的初始位姿
根据每个零件的位姿和形状,作者设计了针对各个几何体的启发式抓取方法
虽然通用抓取算法(如 Grasp-Net [11-Anygrasp: Robust and efficient grasp perception in spatial and temporal domains])是可行的,但抓取问题超出了本研究的范围。因此,作者采用了专为装配任务中结构化组件设计的启发式抓取策略对于棒状组件,在识别其最长轴以保证稳定性后,抓取物体的质心
对于扁平且薄型的组件,使用夹具或定位平台将物体固定,从而使机器人能够沿薄边进行抓取,以提升稳定性。关于这些抓取方法的更多细节,请参见附录 G
- 部件装配轨迹
一旦机械臂抓取到组件,它会寻找一条可行的、无碰撞的路径,移动到预先定义的机器人姿态(锚点姿态)
在这些姿态下,利用FoundationPose [52] 和 Segment Anything Model(SAM)[24],重新计算被抓取组件在世界坐标系下的6D姿态
随后,系统规划一条到组件目标姿态的无碰撞轨迹
作者采用RRT-Connect [26- Rrt-connect: An efficient approach to single-query path planning] 作为运动规划算法。场景中的所有碰撞物体均以点云形式表示,并输入到规划器中。一旦规划器找到无碰撞路径,机器人便沿规划轨迹移动 - 装配插入策略
一旦机械臂将组件移动到其目标位姿附近,装配插入过程便开始。装配插入属于高度接触型任务,需要多模态传感(如力传感器和闭环控制)以确保精确对齐和牢固连接
然而,开发闭环装配插入技能超出了本研究的范畴,将在后续研究中深入探讨,在Manual2Skill当前的方法中,插入操作由人类专家手动完成
1.3.2 对整体性能的评估(仿真环境中)
第一,作者通过在仿真环境中组装家具模型来评估他们方法的整体性能
他们在 PyBullet [9] 仿真环境中实现了评估流程,并对整个流程进行了测试
- 所有测试用的家具模型均来自 IKEA-Manuals 数据集[49]。在获取这些手册及其 3D 零件后,我们按照IV-C 中描述的方法生成预组装场景图像,并由我们的流程生成层次化图结构
- 随后,遍历该层次化图,以确定装配顺序。根据该顺序以及每个组件预测的 6D 姿态,他们在仿真中实现了 RRT-Connect [26],为 3D 零件和子组件规划可行的运动路径,确保它们能够移动到目标姿态
需要注意的是,在本实验中,作者专注于以物体为中心的运动规划,并未在我们的框架中涉及机器人执行环节
第二,对于基线方法
由于作者首次提出了一个完整的家具组装流程,因此没有直接可比的基线方法。因此,他们设计了一种基线方法:利用以往的研究成果 [29],在完整家具图片的指导下,估算所有零部件的姿态,并采用启发式顺序对所有部件进行组装
具体而言,给定所有部件的预测姿态后,作者可以计算每对部件之间的距离。启发式顺序的定义如下:从一个随机选定的部件开始,找到距离其最近的部件并将其组装,然后依次寻找距离已组装部件最近的部件,直至所有部件组装完成
第三,对于评估指标
作者采用装配成功率作为评估指标,并将以下情况定义为失败:
- 零件被放置在距离真实姿态过远的位置
- 零件在移动到估计姿态时与其他零件发生碰撞
换句话说,当将其与其他零件配合时,RRT-Connect算法[26]未能找到可行路径 - 放置的零件未靠近任何其他组件,导致其在每一步装配后悬浮在空中
第四,对于结果
- 作者在IKEA-Manual数据集[49]中的50件家具上评估了整体性能,每件家具的部件数量均少于七个。这些家具分为四个类别(长凳、椅子、桌子、其他),各类别的成功率见表 III

- Manual2Skill成功组装了50件家具中的29件,而基线方法仅组装了15件
且Manual2Skill实现了58%的成功率,充分展示了所提出框架的有效性。最常见的失败情况发生在视觉语言模型(VLM)未能生成完全准确的装配图时,导致点云与用于姿态估计的说明书图像之间出现错位
第二部分 真实装配实验、装配任务泛化
2.1 真实装配实验及其细节
2.1.1 针对4款家具的实验:对应于原论文V-D(xArm 6 + D435)
为了评估流水线的可行性和性能,作者在真实环境中对四款宜家家具进行了实验:
- Flisat(木凳)
- Variera(铁架)
- Sundvik (椅子)
- Knagglig(收纳箱)
图7展示了作者的真实世界实验设置——机械臂用的两条UFactory xArm 6、相机则用的RealSense D435

- 在图6中展示了说明书图片、逐步位姿估计结果以及真实装配过程
且还在补充材料中附上了真实装配过程的视频。有关真实世界实验的详细实现,请参见附录G
- 作者对所有装配任务进行了评估,目标位姿由三种不同方法提供:
1) 真实位姿(Ground truth Pose)
2) 均值-最大池化——Mean-Max Pool,见上文的1.2.2 对「每步装配姿态估计」的实验评估,对应于原论文第V-B节
3) 以及作者提出的方法
真实位姿方法为每个部件提供真实的位姿以进行装配。且采用平均完成率(ACR)作为评估标准,计算方式如下
其中表示实验总次数,
为第
次实验完成的步骤数,
表示该任务的总步骤数
对每项任务进行了10次试验,每次试验的初始三维零件姿态各不相同。作者在表IV中展示了结果,表明Manual2Skill的方法优于基线方法,并在实际装配任务中实现了较高的成功率
- 这些发现强调了Manual2Skill在实际应用中的实用性和有效性
而主要故障模式源于规划的局限性,尤其是在处理复杂障碍物时。当RRT-Connect算法无法找到可行的轨迹,或者规划路径导致与机械臂或周围物体发生碰撞,或由于抓取姿态不理想时,就会出现失败- 为了提升在实际场景中的鲁棒性,作者计划开发一种用于自适应运动微调的低层策略——这一课题将留待未来研究
2.1.2 真实世界实验细节:对应于原论文附录G
本节将提供真实世界实验的详细信息
首先,对于现实世界中的姿态估计
作者采用FoundationPose [52] 对现实场景中的组件进行6D 姿态和点云评估
- 首先,使用移动应用ARCode 扫描家具所有原子部件的网格。在装配过程的每一步,将该网格连同 RGB 和深度图像及物体掩码一同输入 FoundationPose 模型
- 模型随后生成该组件在场景中的精确 6D 姿态和点云
这些信息对于后续任务至关重要,包括相机姿态对齐、抓取以及无碰撞规划
其次,对于相机帧对齐:在获得估算的目标位姿后,作者首先使用前文提到的PCA方法对其进行标准化。为了将这些目标位姿准确映射到真实世界,需要将手册页面图像中的相机坐标系,记作Pmi,与现实世界中的相机坐标系,记作 Pwi,在每一步 i 上进行对齐
本节将介绍如何计算这两个坐标系之间的 6D 变换矩阵 Tmw
- 为此,作者利用 VLM 在世界坐标系中指定场景的一个稳定部分作为基准,并使用 FoundationPose提取该部分的点云
- 然后,采用相同的 PCA算法对点云进行规范化,确保同一组件的相对 6D位姿保持一致
根据模型的预测,还可以确定在手册中作为基准使用的同一部分的位姿,记为
将现实世界中规范化的基准位姿记为,在此步骤中保持静止
作者将这两个坐标系之间的变换矩阵记为
通过该变换矩阵,可以将手册坐标系中的目标位姿映射到现实世界坐标系中的对应目标位姿
,以便后续的运动规划
具体的变换计算如下 - 然后使用以下方法在真实世界坐标系中计算目标位姿:
如图13所示,凳子案例清晰地展示了手动坐标系与真实世界坐标系之间姿态对齐的过程,从而为运动规划提供了一致且可靠的基础
最后,对于启发式抓取策略
对于一般的抓取任务,通常采用如 GraspNet[11] 等预训练模型来生成抓取姿态。然而,在家具组装场景中,由于组件通常较大且平坦,需要抓取物体中适合后续装配的特定部位
这一需求对 GraspNet 构成了挑战,因为它并不总是能够估算出最适合后续操作的抓取姿态。为了解决这一问题,除了使用 GraspNet 外,作者还利用FoundationPose 生成的姿态,并在特殊情况下考虑家具组件的形状
这些形状分为两类,如图 14 所示:

- 棒状部件:对于如凳腿等棒状家具部件,选择点云的中心作为抓取位置。将抓取姿态定义为自上而下的方式
- 扁平薄型部件:首先利用包围盒估算扁平、板状家具部件的姿态。基于该估算结果,通过与包围盒的朝向对齐来确定抓取姿态。抓取位置设定在距顶面约3厘米处
2.2 对其他装配任务「玩具车/飞机模型/机械臂组装」的泛化能力
作者将Manual2Skill设计为一个具有通用性的框架,能够处理多样化的装配任务并支持手工说明
为了评估其多样性,作者在三种不同的装配任务中测试了VLM引导的分层图生成方法,这些任务在复杂性和应用领域上各不相同
具体包括:
- 玩具车车轴的组装(一个低复杂度、标准化组件的任务,代表消费类产品装配)
- 飞机模型的组装(中等复杂度任务,代表消费品组装)
- 机械臂组装(高复杂度任务,涉及非标准化组件,代表科研与原型组装)
对于玩具车轴和飞机模型,作者从文献[46]获取了3D零件,并使用Blender重建了预装配场景图像。且手动按照其标志性风格制作了说明书,每一页通过抽象插图展示单个装配步骤
对于机械臂装配,作者采用了Zortrax机械臂[66],其包含现成的3D零件和结构化说明书。随后,这些输入被送入VLM引导的分层图生成流程,生成的装配图如图8所示

该零样本泛化方法在每个任务的五次试验中实现了100%的成功率。生成的装配图与真实装配序列一致,验证了作者的VLM引导分层图生成方法在多样化基于说明书的装配任务中的泛化能力,并突显了其在更广泛应用中的潜力
本文探讨了从操作手册中学习复杂操作技能的方法,并提出了一种自动化宜家家具组装的方法。尽管取得了一定进展,但仍存在若干局限性
- 首先,该方法主要识别需要组装的物体,却忽略了手册中的其他细节,例如,抓取位置标记和精确连接器位置(如螺丝)
集成视觉-语言模型(VLM)模块以提取这些信息,有望显著提升机器人插接能力- 其次,该方法尚未涵盖自动执行紧固机制,如拧紧或插入等动作,这些操作高度依赖于力觉和触觉传感信号。作者将这些挑战留作未来的研究方向
第三部分(选读) IKEA-Manual:逐步观察形状组装过程
人工设计的可视化手册是形状组装活动中的关键组成部分。它们为人类提供了逐步指导,说明如何以便捷且可实现的方式移动和连接不同的部件。尽管在构建能够执行组装任务的智能体方面已有持续努力,但人类设计手册中的信息在很大程度上被忽视
IKEA-Manual的作者认为,这主要有两个原因:
- 缺乏与手册配对的真实3D组装对象
- 仅基于图像的手册难以提取结构化信息
基于这一观察,来自斯坦福大学、Google Research等单位的研究者提出了IKEA-Manual
- 这是一个用于从3D模型和人工设计的视觉手册中逐步理解形状组装过程的数据集,且他们对IKEA对象和组装手册进行了细粒度注释,包括分解的组装部件、组装方案、手册分割,以及3D部件与可视化手册之间的2D-3D对应关系
- 其对应的paper为:IKEA-Manual: Seeing Shape Assembly Step by Step
其项目地址为(包含数据下载地址):cs.stanford.edu/~rcwang/projects/ikea_manual
具体而言,如下图所示

- IKEA-Manual包含102个3D宜家物体,每个物体都与人工设计的视觉手册配对,每个物体被分解为与手册中不同颜色部分对应的基本组装零件
- 原始宜家手册通过展示零件如何连接的图片,逐步引导组装过程
- 从视觉手册中提取了高层次的树状结构组装计划,明确了组装过程中零件的连接方式
- 针对每个步骤,提供了密集的视觉标注,如2D零件分割以及2D手册图片与3D零件之间的2D-3D对应关系
然后依次完成以下4个步骤
- 首先,提出了一项新颖的装配方案生成任务,即在给定一个形状及其部件分解的情况下,要求模型生成装配方案树。该任务不仅有助于机器人在高层次上规划装配任务,还能简化装配手册设计这一繁琐过程
- 其次,将他们的数据集用于部件分割,目标是识别与输入3D部件对应的图像分割区域。这是构建能够理解并将视觉手册转化为机器可解释指令的智能体的前提
- 随后,展示了IKEA-Manual还可用于评测部件条件姿态估计算法,即在手册图像中预测3D形状的姿态
- 最后,利用数据集中的形状对部件装配任务进行评估[4]:给定一组部件,模型需要预测它们的最终姿态,使所有部件能够组装成一个完整的3D形状
3.1 IKEA-Manual中不同类型的标注
3.1.1 基于手册的IKEA零件组装指导
首先为本节提供一些关于由视觉手册指导的IKEA形状装配的背景知识
- IKEA手册将装配任务分解为多个步骤
最初,会得到一组基础装配零件。在每一步中,需要移动并连接部分零件,以形成新的组合部件,并依次完成每一个步骤,直到最终目标形状被组装完成
将使用“装配部件”来指代在装配开始前的基础装配零件以及装配过程中形成的组合部件 - 在宜家手册的每一页中,存在多种类型的视觉元素以指导组装过程,这些元素以矢量图形的形式呈现,如图2所示「IKEA手册的样例(彩色)页面,包含两个连续步骤的组装信息。相关零件及其相对位置通过在手册图片上的投影展示,这是作者标注的主要关注点。其他视觉元素,包括连接件,在IKEA-Manual中被视为背景」
其中最重要的信息是涉及部件的投影视图,它描述了被连接部件的配对关系及其期望的相对姿态。像螺钉和铰链这样的连接件,也会在手册中展示,用于固定各部件
- 与先前的研究[6]类似,作者在三维形状和可视化手册中将忽略这些连接件,主要关注部件之间的连接关系,因为连接件难以建模,并且通常在收集到的三维模型中缺失。还将详细说明等其他元素视为背景部分,重点关注组装部件的信息
3.1.2 数据收集
作者首先从宜家官方网站爬取了一系列宜家手册cial 网站 [29]。对于每份说明书,作者从多个来源搜索其对应的 3D 模型:
- 包含IKEA 物体的先前 3D 形状数据集,如 IKEA [10]、Pix3D [11] 和 IKEA Object StateDataset [13]
- 在线资源库,如 3D Warehouse [30] 和 Polantis [31]。除 IKEAObject State Dataset 外,其他来源的模型均不带有装配零件
且未使用 IKEA 家具装配环境 [6] 中的模型,因为其中许多模型没有对应的说明书。最终,作者剔除了无法找到准确对应模型的说明书,最终得到 102 对模型与说明书
3.1.3 标注类型
针对收集到的带有3D模型和对应说明书的IKEA物体,作者在3D模型、2D说明书及其2D-3D对应关系上提供了多种类型的标注
首先,如图4所示,作者为3D模型提供了标注——部件之间的连接关系和几何等价关系注释

- 装配部件分解
对IKEA物体形状进行真实的装配部件分解,对于将部件与视觉手册中的指导对齐至关重要。这一过程使得研究装配形状与视觉手册之间关系的多项任务成为可能,例如部件分割和姿态估计
同时,装配部件也可用于评估以此类分解为输入的装配任务性能[3,4]。因此,作者根据手册将3D模型手动拆分为基本装配部件 - 部件连接关系
了解哪些原始装配部件最终被连接,对于研究形状装配过程非常有用。作者记录了在最终组装物体中哪些部件是直接连接的 - 部件几何等价关系
由于家具物体普遍存在对称性,IKEA-Manual中的不同原始装配部件可能具有相同的标准几何形状,这会导致输入/输出的歧义,进而影响涉及3D部件任务的训练和评估
因此,作者还包含了关系注释,用于指示任意两个部件在不考虑其姿态的情况下是否几何等价
除了3D模型外,作者还为可视化手册提供了丰富的注释。手册相关信息的注释流程如图3所示『首先在手册中识别装配步骤,然后记录每个步骤中涉及的零件及其连接关系。最后,作者为每个零件标注分割信息和关键点信息。Kps 为关键点(keypoints)的缩写』

作者检测手册图像中与装配流程每一步对应的区域,排除仅涉及连接件的步骤,并提供如下细粒度注释
- 高级装配方案
作者首先记录每一步中连接的零件对。将这些信息跨步骤整合后,可以得到如图1c所示的装配方案树结构
每个非叶节点表示某一步中的目标零件,其子节点定义了从前序步骤中装配该目标零件所需的部件。这可以被视为由人类设计师指定的高级规划信息,用于描述分解的装配过程。该表示方式结构化且适合机器处理,可用于机器人装配 [7]
另一方面,它也可以作为评估装配方案生成任务的基准,这对于计算机辅助设计 [32,33,2] 和机器人规划 [23,24,23] 领域具有重要价值 - 可视化手动分割
定位在手册图像中识别装配零件的位置是理解手册的重要第一步
因此,作者在每一步中都包含了两种类型的零件实例分割
原始IKEA 手册采用矢量图形格式,由线条和多边形等矢量图形基本元素组成,作者将每个基本元素直接分配给相应的三维部件或背景
这种针对线段的标注,使得 IKEA-Manual适用于与草图分割相关的任务评估 [34]。为了为基于像素的分割任务建立更优质的基准,作者还对每个部件的内部区域进行了像素级分割标注,将其也包含在掩码中 - 零件与说明书之间的2D-3D对齐
在3D零件与其在说明书图像中的2D投影之间建立对齐关系,使阅读者能够推断连接零件之间的相对姿态。作者通过在每一步中为每个零件在3D模型和2D说明书上标注对应的关键点来实现这种对齐
一旦获得这些关键点,作者采用高效的Perspective-n-Point算法[35]来计算它们在说明书图像上的姿态。结合装配零件的标注,这些标注可以应用于姿态估计[36,37]和单视图3D重建[38,39]等任务
3.1.4 数据集分析
IKEA-Manual 共包含393个步骤,涉及102个IKEA物体,并为每一步的基础部件和组合部件提供了1056个部件掩码和3D姿态
- 数据集中包含57把椅子、19张桌子、8条长凳、4张书桌、3个书架,以及8个来自其他类别(如花架和推车)的物体
椅子在数据集中占据较大比例,因为其3D模型在在线资源库中最为丰富 [16,11] - 图5展示了IKEA-Manual中基础部件和步骤的分布——数据集涵盖了多样化的装配部件分解和装配方案

且还在图6中展示了一些形状示例,不同的基础组装部件被涂上了不同的颜色。这些部件涵盖了多种几何结构
值得注意的是,这种部件分解方式不同于以往的数据集,因为一个组装部件可能并不只对应一个语义类别
例如,在图6最左侧的形状中,红色的组装部件同时属于椅背和椅腿。第二个形状中的紫色部件同时属于长椅扶手和长椅腿类别
这使得IKEA-Manual成为形状组装任务中独特的资源,更加贴合实际应用场景
3.2 应用
3.2.1 装配方案生成
在组装目标形状时,需要规划装配动作的顺序。这一直是计算机辅助设计[32,33,2]和任务规划[23,24,23]领域的一个长期存在的问题
在这里,作者关注的是能否构建能够自动生成装配方案的算法。评估装配方案时有多个因素,例如清晰性和有效性[33],这些因素很难通过客观指标来定义。以往的研究通常通过案例研究或用户实验来评估生成方案的质量[33],而IKEA-Manual提出了一种基于IKEA手册中专业设计装配方案的自动化、量化评估协议
首先,对于装配树表示
图1a中展示了将装配方案表示为树的思想
形式上,给定一个由零件组成的目标装配形状,如果有向无环图
满足以下属性,则称
为
的装配树
- 每个节点 N 对应于部分的一个非空子集:
- 根节点对应于最终组装的形状:
- 任一节点的子节点构成其的一个划分,即
在语义上,每个叶节点对应一个单一的基础装配零件,而每个非叶节点对应于在某一步中通过连接多个零件(这些零件可以是基础零件,也可以是已装配好的组件)所得到的装配结果。整个树结构表示一个装配方案。需要注意的是,这样的树还可以编码装配步骤的顺序:通过后序遍历访问每一个非叶节点,并将访问顺序视为装配顺序
不过,注意到,树状表示法并不等同于视觉手册中所传达的装配信息——零件的连接移动方式被忽略了,作者也没有记录连接动作如何投影到手册图像上。然而,根据作者的实验,预测这种简化的信息本身已经具有挑战性。因此,作者认为,装配方案生成任务可以被视为装配手册生成任务的前置条件
其次,对于问题表述
给定一个由一组基础装配零件表示的目标装配形状,作者的目标是预测一个有效的装配树
,该装配树满足前文提到的属性。在作者的实验中,每个装配零件由一个点云
表示,其中
再其次,对于评估指标
受自然语言处理中的依存树评估方法 [40] 启发,作者提出采用基于精确率/召回率的评估指标,通过比较预测与真实装配树中的节点来进行评估
具体而言,他们首先采用两种不同的标准来寻找匹配的节点对
- 简单匹配:只要两个非叶子节点对应于相同的原始部件集合,就将其匹配。该度量衡量与真实组装树相比,正确的组合组装部件数量,但不考虑它们的具体组装方式
- 严格匹配:当两个非叶子节点对应于相同的原始部件集合,并且它们的子节点也满足简单匹配标准时,则认为它们是匹配的
该标准可以衡量与真实装配树相比,中间装配操作的正确数量,而不考虑其顺序
然后,为每个评判标准计算以下指标
,
最后,对于基线方法
作者为手动方案生成任务考虑了两种启发式基线:
- 第一种基线,SingleStep,简单地将所有原始部件在一步中连接起来,这对应于一个父节点下有 n 个叶子节点,每个叶子节点对应一个原始部件
- 受几何相似部件往往在同一步组装(例如椅子的腿)的观察启发,作者实现了基于聚类的基线方法 GeoCluster。该方法首先利用预训练的 DGCNN [41] 提取每个原始部件的几何特征,然后递归地将几何相似的部件分组到同一步中。更多细节见补充材料
至于最终的结果而言
定量结果如表2所示

两个基线方法在该任务上的表现都不佳,这表明任务具有较高的难度。SingleStep 由于只输出根节点(根节点始终存在),因此实现了完美的精度
且作者在图7中给出了成功和失败的案例

从中可以看出,GeoCluster 能够处理以几何相似性为主要因素的简单装配规划情况,但在考虑零件之间连接约束时表现不佳
3.2.2 基于零件条件的手册分割
为了理解可视化手册中的装配信息,智能体首先需要定位手册中所示的装配零件,然后通过建立二维到三维的对应关系来推断它们的三维位置
- 在此,作者关注于基于零件条件的手册分割任务,这是理解可视化手册的前提条件:给定一组处于标准空间的零件列表,以及包含这些零件二维投影的手册图像,作者希望为每个零件预测其分割掩码,如图8a所示

- 具体而言,针对每一步操作,分别在手册图像上裁剪出各个零部件的投影。随后,将所得图像与相关零部件的点云数据一同作为输入。由于此前尚无分割模型在真实世界的手册图像上进行过训练,因此需要进行一定的微调
- 为此,作者将IKEA-Manual数据集划分为353个训练样本和40个测试样本,以便对预训练的分割模型进行微调
作者采用了文献[3,即为上文第一部分提到的参考文献29,Learning 3D part assembly froma single image]中的分割模型,该模型基于U-Net[42]架构
并结合了来自PointNet[43,即上文第一部分提到的35-Pointnet++: Deep hierarchical feature learning on point sets in a metric space]的几何特征
作者以PartNet[9-PartNet:A large-scale benchmark for fine-grained and hierarchical part-level 3D object understanding]椅子数据集的预训练模型为基础,对所有层进行微调,学习率为,最终获得了25.31的IoU,这表明Li等人[3]的方法在该任务上表现不佳
相关可视化结果见图8b
总之,Li等人[3]的方法在预测更复杂部件的掩码时存在困难
3.2.3 基于部件的姿态估计:涉及设置、方法、结果
在本节中,作者展示了他们的数据集同样可以用于基于部件的姿态估计算法的基准测试:给定一个三维部件以及包含其二维投影的人工图像,模型需要预测该三维部件的旋转角度
首先,对于设置
类似于基于部件条件的手动分割任务,作者同样裁剪出各部件在手册图像上的投影
他们遵循Xiao等人[44-Pose from shape:Deep pose estimation for arbitrary 3d object]的设置,即每个样本仅涉及一个部件。总共有1056个样本,这些样本被随机分为844个用于训练,105个用于验证,107个用于测试
作者为该任务评估了三个基线方法
- 第一个基线无论输入如何,直接输出一个随机旋转,可以视为所有指标的下界
- 第二个基线是Xiao等人[44]提出的方法,这是一种利用ResNet[45]和PointNet[46-Pointnet: Deep learning on point sets for 3d classification and segmentation]的学习模型
对于该基线,为了防止同一手册图像中其他部件的干扰,作者将输入部件的掩码与图像相乘 - 第三个基线是SoftRas[47],这是一种可微分渲染器,可以用于优化姿态以分析-合成的方式对掩码进行处理
为避免陷入局部最小值,作者从多个初始状态进行优化,并选择均方误差最小的解
其次,对于指标
- 作者首先采用Xiao等人[44]提出的旋转误差和旋转准确率指标。旋转误差直接计算每个样本的真实旋转与预测旋转之间的相对旋转(以度为单位),并对测试集取中位数。旋转准确率指标则计算旋转误差小于30°的样本所占比例
- 由于IKEA-Manual中存在大量对称部件,作者还报告由预测旋转和真实旋转变换后的输入形状点云之间的Chamfer距离(CD)
- 最后,作者还报告了Huang等人[4]提出的Chamfer准确率(CA),该指标衡量Chamfer距离小于阈值(设为0.05)的样本比例
最后,对于结果
定量结果如表3所示

- Xiao 等人[44]和 SoftRas 的表现均大幅高于随机水平,但仍有很大的提升空间。SoftRas 仅使用掩码,在所有指标上都取得了略优的表现
- 在计算效率方面,由于推理过程中进行了多次优化,SoftRas 的速度也比Xiao 等人[44] 慢了若干数量级
// 待更
第四部分(选读) IKEA Manuals at Work
- 其GitHub地址为:IKEA Manuals at Work
// 待更
更多推荐












所有评论(0)