UniVLA:让不同机器人说同一种“动作语言“
1. 概述
想象一下在不远的未来,通用机器人真正走进了日常生活。我们希望当你发出一条自然语言指令,无论是“帮我给猫喂食”,还是“帮我关掉台灯”,它都能够理解你的意图,并准确地完成动作——不依赖预定义的任务模板,也不受限于曾经训练过的数据分布。
2025年5月,香港大学、OpenDriveLab和AgiBot的研究团队发表了一项突破性研究《Learning to Act Anywhere with Task-centric Latent Actions》(基于任务中心潜在动作的广域行动学习)。这篇发表在arXiv(arXiv:2505.06111v1)的论文介绍了UniVLA,一种统一的视觉-语言-动作框架,该框架能够让机器人在各种不同环境中学习行动。
- 项目地址:https://github.com/OpenDriveLab/UniVLA
3. 技术优势:
1. 机器人的"万能翻译器":UniVLA可以让不同机器人说同一种"动作语言"
UniVLA就像是一个超级翻译器,它创造了一种所有机器人都能理解的"通用语言"。这种语言不依赖于机器人的具体形态(像是机械臂、移动平台或其他形式),也不需要详细的动作标签或特定的视角。通过这种统一的语言,研究人员可以让机器人从互联网上的大量视频中学习,然后将这些知识应用到各种不同的机器人上,只需极少的调整即可。
这就好比一个人先学会了世界语,之后无论去到哪个国家,只需要学习一点点当地特色表达,就能与当地人顺畅交流。对机器人来说,这意味着它们可以共享学习经验,大大提高学习效率和适应能力。
与之前的方法相比,UniVLA展现出了显著的性能提升。例如,在LIBERO操作任务上,UniVLA的成功率比OpenVLA高出18.5%;在Room2Room导航任务上,提升了29.6%;在真实世界的部署中,性能提升了36.7%。更令人印象深刻的是,UniVLA只需要前代模型1/20的预训练计算资源和1/10的下游数据量就能实现这些提升。
2. UniVLA的广泛适用性:跨任务、跨平台、跨场景的全面表现
UniVLA突破了传统机器人控制系统“任务/平台专用”的局限,表现出卓越的通用性和鲁棒性,真正具备“通用机器人动作语言”的潜力。其在操作任务、导航任务以及真实世界部署场景中均展现出优异性能:
1. 多基准任务的评估成果
✅ 操作任务(如 LIBERO、CALVIN、SimplerEnv):
- 在 LIBERO 四个子任务(空间关系、物体泛化、目标适应、长期操作)中全面领先。
- 长期操作任务:成功率高达 92.0%,相比 OpenVLA 提升 38.3 个百分点。
- 即便仅用 Bridge-V2 数据集预训练,仍达 87.5% 成功率,超越多数完整预训练对手。
✅ 导航任务(如 Room2Room): - Room2Room 成功率从 OpenVLA 的 17.5% 提升至 47.1%,显著提升近 30 个百分点。
- 使用单帧 RGB 输入即可接近 NaVid(完整观测历史输入)性能。
2. 真实世界部署能力评估
- 在四项设计的现实任务中,涵盖多种核心能力
| 任务能力 | 示例任务 |
|---|---|
| 空间感知 | 存放螺丝刀 |
| 可变形物体处理 | 折叠毛巾 |
| 工具/非抓取操作 | 清洁切菜板 |
| 高层语义理解 | 汉诺塔堆叠 |
平均成功率:81.7%,领先第二名方法 LAPA 高达 36.7 个百分点。
- 面对未见场景的强泛化能力
| 挑战情景 | 成功率 | 对比优势 |
|---|---|---|
| 光照变化 | 66.70% | 显著高于其他方法 |
| 视觉干扰 | 53.30% | 具鲁棒性 |
| 新物体泛化 | 86.70% | 体现对语义理解能力的强适应性 |
4. 核心技术

UniVLA核心由三大模块构成:
- 任务中心潜在动作学习(VQ-VAE):连续的视频帧之间的变化转为离散动作码,就像将复杂的动作分解为基本的"动作单词",实现任务相关动作提取。
- 潜在动作预测(Vision-Language Autoregressive Transformer):掌握了“基本动作词汇”后,机器人需要学习如何根据上下文正确使用这些词汇。基于此,UniVLA训练一个自回归视觉-语言模型,该模型接收视觉观察和语言指令作为输入,然后预测应该执行的潜在动作序列。
- 潜在动作解码(Lightweight Decoder):将学习到的通用潜在动作翻译成特定机器人能够执行的物理控制信号。研究团队设计了一个轻量级的解码器,只有约1080万参数,这个解码器可以高效地将潜在动作转换为实际控制信号,让不同类型的机器人执行所需任务
此外,UniVLA使用DINOv2作为特征提取器,并引入条件动作分解机制,显著提高了模型对视频噪声的鲁棒性与任务专注能力。
5. 商业价值:
UniVLA构建的是未来“机器人大脑的通用语言层”,其商业潜力主要体现在:
- 家用,服务型机器人将会更加智能
- 多机器人统一控制平台开发
- 工业级AI自动化机器人系统
- 机器人即服务(RaaS)系统标准化
- 大模型驱动的机器人教育与家庭陪伴助手
预计未来3-5年内,UniVLA可推动构建“通用机器人能力平台”,使得AI原生机器人具备大规模协作部署的技术基础。
更多推荐




所有评论(0)