行为基础模型:面向下一代人形机器人的全身控制系统 (下)
25年6月来自香港理工、逐际动力、宁波数字孪生研究院、香港大学和瑞士 EPFL 的论文“Behavior Foundation Model: Towards Next-Generation Whole-Body Control System of Humanoid Robots”。
人形机器人作为用于复杂运动控制、人机交互和通用物理智能的多功能平台,正备受关注。然而,由于复杂的动力学、欠驱动和多样化的任务要求,实现人形机器人高效的全身控制 (WBC) 仍然是一项根本性挑战。虽然基于学习的控制器已显示出处理复杂任务的潜力,但它们依赖于针对新场景的劳动密集型且昂贵的再训练,限制了其在现实世界中的适用性。为了解决这些限制,行为基础模型 (BFM) 作为一种新范式应运而生,它利用大规模预训练来学习可重用的原始技能和行为先验,从而实现零样本或快速适应各种下游任务。本文全面概述用于人形 WBC 的 BFM,并追踪了它们在各种预训练流程中的开发。此外,讨论现实世界的应用、当前的局限性、紧迫的挑战和未来的机遇,将 BFM 定位为实现可扩展和通用人形机器人智能的关键方法。
。。。。。。继续。。。。。。
适配
基于上述预训练框架构建的 BFM,BFM 的适配技术技术大致可分为两类:微调和分层控制。
微调
BFM 的微调旨在弥合通用运动先验与特定任务需求之间的差距。虽然预训练的 BFM 能够捕捉广泛的运动分布,但它们通常缺乏针对特定任务或新环境的精度。例如,[42] 引入快速自适应技术,例如残差潜自适应 (ReLA) 和前瞻潜自适应 (LoLA),这些技术使 BFM 能够在预训练后使用最少的在线交互实现零样本自适应。这些方法可将任务性能提升高达 40%,证明了快速适配策略的有效性,该策略无需大量的再训练即可实现高效的任务切换。相比之下,[43] 引入了“任务 tokens”,通过任务编码器生成特定于任务的token,从而增强了目标条件的 BFM,使 BFM 能够以较高的成功率执行运动跟踪和目标达成等复杂任务。他们的方法在跳远等任务中成功率高达 99.75%。此外,[44] 通过引入信念反馈模型 (belief-FB) 解决了信念反馈模型 (belief-FB) 表示的局限性,它使用 Transformer 编码器推断环境动态,从而提高了对未知变化的适应性。他们的方法在动态变化下实现了高达 2 倍的性能提升,展现了增强的零样本能力。未来的工作可以研究其他后训练技术,例如测试-时间规模化定律 [89] 或基于人类反馈的强化学习 [90],以进一步提高 BFM 的适应性和效率,并确保其在实际应用中与人类偏好保持一致。
迈向分层控制
虽然微调技术能够在测试期间通过最小化修改来提升 BFM 在特定任务上的性能,但一些先驱性研究已尝试建立基于 BFM 的分层控制架构,将高级规划与低级动作执行解耦,从而实现更具可扩展性和灵活性的控制 [91, 92]。例如,UniHSI [93] 通过使用语言命令来引导接触链(表示人与物体接触对的序列),引入了一个统一的人景交互框架。该系统将语言输入转换为结构化的任务规划,然后由基于 AMP 架构的统一控制器执行。该框架实现了语言命令和物理动作之间的语义对齐,支持与单个或多个物体的多样化交互。TokenHSI [94] 进一步扩展了这一思路,提出了一种基于 Transformer 的统一策略,将人类本体感觉和任务状态 token 化。通过将共享运动知识(本体感觉 token)与任务特定参数(任务 token)分离,它可以实现无缝的多技能统一,并灵活地适应新任务,例如技能组合(例如,坐着携带物品)、物体或地形的形状变化以及长期任务完成。
相比之下,CLoSD [95] 引入一个文本驱动的 RL 控制器,它将运动扩散模型与基于物理的模拟相结合,实现了鲁棒的多任务人类角色控制。通过在闭环反馈系统中利用实时扩散规划器和运动跟踪控制器,CLoSD 可以处理复杂的任务,例如达到目标、打击以及人与物体的交互,所有这些任务都通过文本提示和目标位置进行控制。同样,UniPhys [96] 引入一个基于扩散的行为克隆框架,该框架将规划和控制与扩散强制统一起来以处理预测误差,从而可以通过文本、速度和目标引导对动态避障和长期规划等应用进行灵活的控制。这些应用表明,BFM 是连接高级语义指令和低级物理执行的关键桥梁,它利用预训练的行为先验知识,实现零样本自适应、多任务泛化和物理感知运动合成。通过集成各种控制范式(例如,基于 Transformer 的 token 化和闭环扩散规划),这些应用凸显了 BFM 在复杂的现实世界场景中(从交互式机器人到动态环境自适应)实现人形机器人控制民主化的潜力。
预计 BFM 将通过提供通用的预训练控制器(该控制器能够泛化至各种任务)来显著增强人形机器人技术。
从宏观角度,探讨 BFM 在医疗机器人和游戏等不同行业中的潜在应用。此外,还将识别当前 BFM 的主要局限性,包括 Sim2Real 差距、数据瓶颈和具身泛化能力。其分析受到了其他基础模型(例如 LLM [97] 和大型视觉模型 [98])的当前发展和应用的启发。
人形机器人通用加速器
BFM 将成为人形机器人变革性的通用加速器,加速先进 WBC 系统的开发和部署。与以往需要资源密集型和任务特定训练的流程不同,BFM 通过在海量多样化的行为数据集上进行预训练,无需从头开始训练,从而嵌入丰富的行为先验,以指数级加速下游的自适应 [42]。此外,具有零样本自适应能力的先进 BFM,例如 Motivo [41],可以将高级任务规范(例如目标状态和奖励函数)直接映射到低级控制动作,完全绕过传统的强化学习循环。此功能不仅高效地解决了基本控制任务,还促进了快速原型设计,使开发人员能够在几分钟内评估机器人在模拟和现实环境中的行为,从而显著缩短开发周期。
虚拟智体与游戏
生成式人工智能极大地革新了数字内容创作,尤其是在艺术、动画和游戏设计领域 [99–105]。其中,控制游戏中非玩家角色 (NPC) 的动态交互行为仍然是一项重大挑战。传统的基于规则或脚本的 NPC 通常表现出有限的多样性、不自然的动作以及对玩家动作的适应性差 [106–108]。BFM 提供了一种突破性的解决方案,它无需大量的手动脚本即可实现逼真的、上下文-觉察的 NPC 行为。BFM 经过各种人类行为数据集的预训练,可以生成自适应动作,例如战术战斗、社交参与或探索,无缝响应动态玩家输入。通过将 BFM 与 LLM 集成,NPC 可以解释复杂的玩家指令(例如角色扮演游戏中的对话驱动命令),并促进沉浸式和响应式交互。这一能力使 BFM 成为革新虚拟智体的关键技术,能够以前所未有的行为真实感和交互性实现下一代游戏体验。
迈向工业 5.0
工业 4.0 引入了包含信息物理系统、物联网和人工智能驱动自动化的智能工厂,而工业 5.0 则转向以人为本、具有弹性和可持续性的制造,强调协作机器人、自适应智能和个性化生产 [109–113]。为此,机器人必须超越僵化的自动化,展现出可泛化、自适应和可解释的行为 [114–118]。BFM 有望赋能这一领域,使人形机器人能够将预训练的运动技能与实时适应性无缝融合,在精密焊接和自适应零件处理等任务之间轻松切换。通过将大型多模态模型与 BFM 集成,机器人可以处理各种输入,例如手势、语音命令(例如“轻拿轻放”)或环境提示,从而在共享工作空间中促进直观的人机协作。BFM 还能确保弹性,能够自主从物流中不平衡负载等干扰中恢复,并通过零样本或少样本学习支持个性化生产。
医疗保健和辅助机器人
全球人口老龄化给医疗保健系统带来了前所未有的挑战 [119–122],这增加了对支持独立生活和康复的辅助技术的需求。目前已开发出多种多样的机器人,用于机器人辅助穿衣、康复治疗、医疗以及老年人和儿童的护理 [123–131]。人形机器人因其拟人化设计、在以人为中心的环境中导航以及执行精确、自然和直观的交互,非常适合执行这些任务。 BFM 提供了一种颇具前景的解决方案,它使机器人能够适应多样化的用户需求和非结构化环境。例如,BFM 可以赋能辅助机器人执行诸如行动支持(例如,防跌倒、步态辅助)或日常任务(例如,取物、准备餐食)等任务,且几乎无需用户进行任何特定调整。在康复领域,经过临床医生指导的演示训练的 BFM 可以通过动态调整任务难度或根据患者进展提供实时反馈来制定个性化治疗方案。
Sim2Real 差距
Sim2Real 差距是机器人技术领域的一个长期挑战,它代表了在模拟器中训练的策略与其在现实世界中的部署之间的性能差异 [30–33]。传统的基于模型的控制器通过显式物理建模和鲁棒优化来解决这个问题,而数据驱动的方法则采用域随机化和系统辨识 [132–135]。像 ASAP [136] 这样的近期进展通过残差动作学习缓解动态失配问题,但也面临着特定于策略的限制,因为它们的残差是基于单一预训练策略的轨迹进行训练的,这限制泛化能力。BFM 通过编码从运动到多接触交互等广泛的行为,引入了高维迁移风险,从而加剧了这一挑战。例如,针对各种类人运动训练的 BFM 可能无法适应现实世界的执行器延迟、摩擦变化或传感器噪声,从而导致执行不稳定或不安全。将视觉信号集成到控制系统中进一步加剧了挑战,感知域的变化(例如,光照、纹理或相机校准不匹配)以及视觉特征的泛化差距可能会破坏基于模拟视觉输入的运动策略。目前的 BFM 仍然主要局限于模拟环境,没有记录在案的大规模现实世界部署。虽然已经有几项开创性的工作致力于在真实的人形机器人中开发类似 BFM 的控制器,例如 HugWBC [55] 和 CLONE [137],但它们的运动技能仍然很狭窄,凸显了 Sim2Real 在保持行为丰富性方面的可行性面临重大挑战。这种差距源于行为过度泛化、动力学不匹配和潜在空间不稳定性,这些因素阻碍了将 Sim2Real 的目标成功案例(例如,四足动物的运动或抓取)扩展到 BFM 的复杂性。
数据瓶颈
数据瓶颈是开发人形机器人 BFM 的根本制约因素。虽然下表中列出的数据集已成功用于训练当前的 BFM,但其规模仍然远小于用于训练 LLM 或大型视觉模型的数据集。当将运动重定向到特定的机器人平台 [138] 时,这种稀缺性会更加严重,因为细微的形态差异都可能导致严重的策略性能损失。由于硬件限制和安全问题,现实世界的机器人数据受到的约束甚至更大。当考虑多模态数据需求时,挑战更加严峻。
泛化中的几个关键挑战。一个主要问题是形态不匹配,即为特定运动学或动态结构设计的策略难以适应具有不同连杆长度、关节类型或质量分布的机器人。此外,执行器动力学方面的差异——例如扭矩、延迟或控制模式(例如位置控制与扭矩控制)的变化——可能会在系统间转移时破坏策略的稳定性。传感器多样性又增加了一层复杂性,因为 BFM 通常假设传感器输入一致,并且难以管理缺失或额外传感模式的情况。此外,为一种实施方式(例如类人行走)创建的奖励函数可能无法有效转换为其他实施方式(例如六足步态模式),从而导致任务适应混乱。这些挑战凸显了对更具适应性的 BFM 架构的必要性,这种架构可以在各种机器人平台上抽象技能。
未来有一些能够提升 BFM 更广泛应用的关键研究机会,包括将其集成到高级机器学习系统、规模化规则、后训练技术以及多智体协调。还将批判性地审视与 BFM 相关的风险,例如人机交互中的伦理问题以及现实世界部署的安全机制。通过应对这些机遇和风险,机器人社区可以确保 BFM 能够发展成为下一代类人机器人系统的稳健、适应性强且具有社会责任感的控制器。
多模态本体感觉模型 (BFM)
BFM 的一个有前景的发展方向在于将本体感受输入扩展到多模态感觉整合,整合视觉、听觉信号和触觉反馈等外部感受信号 [148–150]。虽然目前的 BFM 主要依赖于本体感受信息,但更丰富的感知输入可以在非结构化环境中实现更稳健、更具自适应性的行为。例如,整合实时视觉感知可以使类人机器人根据物体位置、地形条件或人机交互动态调整其运动,从而提高安全性和任务执行能力。然而,实现多模态 BFM 需要大规模数据集和可扩展训练范式的改进,这是该领域面临的关键挑战。
高级机器学习系统
LLM 和 VLA 等基础模型的最新进展已展现出其作为控制器在协调专用人工智能系统方面的潜力 [29, 151–153]。例如,HuggingGPT [151] 利用 LLM 协调跨不同模型的任务规划,而 Eureka [29] 则使用 LLM 自动化强化学习中的奖励函数设计。这些项目为将 BFM 集成到高级机器学习系统中提供了一条自然途径,使其能够充当人形机器人的通用低级控制器。通过将 LLM 的推理能力(用于任务规划和自适应)与 BFM 中编码的运动先验(用于实时执行)相结合,此类系统可以在处理复杂且多步骤的物理任务时实现前所未有的灵活性,同时最大限度地减少特定于任务的工程设计。最终的愿景是创建一个基于 LLM 和 BFM 的统一认知物理架构,实现人类认知和物理控制的无缝集成。
规模化定律
规模化定律的概念描述了神经语言模型的性能如何随着模型规模、数据和计算资源的增加而提升。虽然这些定律在语言和视觉等领域已经得到充分证实,但它们在 BFM 中的适用性仍然是一个悬而未决的问题 [154–158]。初步证据表明,通过更大的架构、多样化的训练数据集和扩展的计算资源来扩展 BFM,可以增强其泛化能力和零样本自适应能力。例如,FB-CPR [41] 在具有更多参数(从 25M 到 288M)的人形控制任务中表现出了性能提升,实现了更稳健的零样本运动跟踪和奖励优化。另一方面,数据缩放对 BFM 来说似乎更为关键,因为它直接决定了学习到的行为先验的质量和物理合理性,而这些基本要求是单靠模型缩放无法解决的。然而,数据缩放的效果仍未得到充分探索,存在一些悬而未决的问题。此外,与 LLM 不同,BFM 的扩展必须在行为覆盖范围(多样化的运动技能)和控制效率(精度和实时稳定性)之间取得适当的平衡。未来的工作应严格量化这些扩展动态,以充分释放 BFM 作为通用控制器的潜力。
后训练学习
后训练技术已成为基础模型持续成功和改进的关键工具,尤其对于 LLM [159] 而言,它通过改进模型来改进推理能力、解决局限性,并更好地符合用户意图和伦理考虑。在这些方法中,微调 [160–165]、强化学习集成 [90, 166–172] 和测试时扩展 [89, 173, 174, 174, 175] 一直是优化 LLM 性能的最突出策略。整合这些训练后策略为 BFM 提供了独特的研究机会。例如,在 BFM 中利用 RLHF 和 RLAIF 等强化学习技术对于优化智能体行为与现实世界人类期望之间的一致性至关重要,尤其是在以人为中心的任务环境中。这为开发能够动态适应用户反馈的更鲁棒的模型开辟了道路。此外,BFM 的测试时扩展可以优化部署期间的计算效率,尤其对于实时机器人控制或决策系统而言。研究可以侧重于提高 BFM 的可扩展性,同时确保模型输出在不同操作条件下保持准确性和情境适用性。
多智体系统
多智体系统 (MAS) 由多个交互的智体组成,这些智体可以是合作的、竞争的或两者兼而有之,旨在解决需要智体之间协作、决策和行为协调的复杂任务 [176–181]。 BFM 可以从根本上加速构建由人形机器人组成的 MAS,从而无需费力地教会每个机器人基本的生存技能(例如平衡和移动),即可实现协作。相反,研究人员可以直接专注于更高级别的协调挑战,例如角色分配和团队策略。然而,当前基于单机器人数据训练的 BFM 缺乏实现最佳协作所需的专门交互能力。这代表了一个有前景的研究方向:开发专门针对多机器人交互场景训练的下一代 BFM。此类模型可以更好地处理物理协调挑战,例如物体交接、队形维持和防撞,同时保持其通用性。
评估机制
虽然像 LLM 这样的基础模型受益于成熟的基准(例如,用于广义知识回忆的 GPQA [182]、用于数学问题求解的 MATH [183] 或用于多步推理的 MUSR [184]),但目前尚无具体而全面的评估机制来评估 BFM 的能力并指导其演进方向。对 BFM 的稳健评估必须考虑多个相互关联的因素,包括在未见过场景中的任务泛化能力、在极少数据下对新技能的适应性、对物理扰动的鲁棒性,以及与人类安全性和可解释性标准的一致性。例如,Motivo [41] 将任务成功率等定量指标与人类对动作自然性的定性评估相结合,但在评估组合技能组合、特定于硬件的约束和长期行为稳定性方面仍然存在关键差距。未来的基准测试应侧重于渐进式难度级别和跨领域迁移测试,以有效评估 BFM 在模拟和现实场景中作为通用物理控制器的潜力。这种方法最终将引导该领域开发出更强大、更可靠的人形系统。
更多推荐



所有评论(0)