北京人形开源WoW具身世界模型 WOW: TOWARDS A WORLD-OMNISCIENT WORLDMODEL THROUGH EMBODIED INTERACTION
开源代码地址: https://wow-world-model.github.io/
开源模型地址:https://huggingface.co/WoW-world-model
1. 一段话总结
WoW(World-Omniscient World Model)是一款14B参数的生成式世界模型,核心通过具身交互数据学习真实物理直觉,其训练数据涵盖200万条真实世界机器人交互轨迹(覆盖5275项任务、12种不同机器人);它基于SOPHIA自优化框架(融合视觉语言模型VLM的推理能力与扩散Transformer(DiT)的生成能力,通过迭代优化提升物理一致性),并结合Flow-Mask逆动力学模型(FM-IDM) 实现“想象-动作”闭环(将生成视频转化为7自由度末端执行器动作);为验证性能,研究团队构建了WoWBench基准(含4项核心能力、20个子任务、606个样本,聚焦物理一致性与因果推理),实验显示WoW在该基准上实现SOTA性能,尤其指令理解准确率达96.53%、物理规律符合率达80.16%,最终证明“大规模、因果丰富的真实世界交互数据是AI发展物理直觉的基石”这一核心假设。

3. 详细总结
一、研究背景与动机
-
现有视频模型的局限
以Sora(OpenAI)为代表的视频生成模型,虽能实现高 photorealism 并展现初步物理直觉,但依赖被动观察互联网数据,训练目标聚焦统计相关性而非因果机制,导致物理推理脆弱(如生成逻辑/物理不一致结果),仅掌握“世界的表象”而非“真实动力学规律”。 -
核心假设与研究目标
基于认知科学(Piaget“认知即行动”、Neisser感知循环),提出核心假设:具身模型需从大规模、因果丰富的真实世界交互数据中学习,才能发展出可靠的物理直觉。
研究目标:构建WoW模型,实现“感知-想象-反思-动作”闭环,成为能落地真实机器人操控的世界模型。
二、世界模型的重思考
-
世界模型定义
对环境动态的内部学习表征,可通过确定性 s t + 1 = f θ ( s t , a t , p t ) s_{t+1}=f_{\theta}(s_t,a_t,p_t) st+1=fθ(st,at,pt)或概率性 ( s t + 1 ∼ P θ ( s t + 1 ∣ s t , a t , p t ) (s_{t+1}\sim \mathbb{P}_{\theta}(s_{t+1}|s_t,a_t,p_t) (st+1∼Pθ(st+1∣st,at,pt)函数预测未来状态,核心目标是最小化转换误差(如MSE)以内化物理规律。 -
世界模型演进脉络
阶段 代表模型 核心特点 早期潜变量模型 World Models(Ha et al.)、PlaNet 依赖VAE/MDN-RNN,用于模型基RL的潜空间规划 预测表征模型 JEPA、V-JEPA 优化嵌入空间预测一致性,无像素重建,侧重特征学习 视频世界模型 Sora、Genie AR/扩散架构,高视觉保真度,但物理一致性弱 具身世界模型 WoW 融合具身交互数据,强调物理一致性与动作落地 -
具身世界模型的关键挑战
- 空间一致性:需严格3D一致性(现有视频模型忽视);
- 时间一致性:短期记忆限制导致上下文矛盾;
- 物理一致性:需准确模拟碰撞、形变等物理规律;
- 常识融合:需整合因果/逻辑推理能力。
三、WoW模型架构与核心模块
-
WoW整体认知架构
遵循Neisser感知循环,分为三大阶段:- 任务想象(Schemata):基于SOPHIA框架生成高-level计划与像素级未来视频;
- 经验反思(Perception):VLM代理评估物理一致性,迭代精炼生成结果;
- 行为提取(Action):FM-IDM将想象轨迹转化为可执行机器人动作。
-
SOPHIA自优化框架(核心创新)
- 核心逻辑:通过“生成-评估-精炼”闭环提升物理一致性,基于假设“更详细的语言指令能引导更可靠的物理生成”;
- 两大组件:
- DiT生成器:基于扩散Transformer,输入初始帧+文本指令,生成未来视频;融入DINOv2自监督特征,提升感知能力;
- VLM评估器(Dynamic Critic Team):微调VLM(如Qwen-2.5-VL)评估5维度(任务完成度、动作成功率、物理合理性、运动平滑度、视频质量),输出结构化反馈;
- 闭环流程:用户指令→Refiner Agent生成详细提示→DiT生成视频→Critic评估→反馈精炼提示→迭代至物理一致。
-
FM-IDM(Flow-Mask逆动力学模型)
- 功能:连接“想象”与“动作”,类比人类小脑+运动皮层;
- 输入:当前帧 o t o_t ot、帧间光流 F t → t + 1 \mathcal{F}_{t \to t+1} Ft→t+1(CoTracker3模型提取);
- 输出:7自由度(3平移+3旋转+1夹爪控制)末端执行器动作;
- 训练数据:64.6万图像-动作对(覆盖219项任务);
- 损失函数:加权平滑L1损失(最小化预测动作与真实动作差异)。
四、WoWBench:具身世界模型基准
-
设计目标
填补现有基准空白,聚焦物理一致性与因果推理,评估“Image+Text→Video”生成能力。 -
核心构成
- 4项核心能力(含20子任务):
- 感知理解(物体识别、空间理解、可用性识别,共249样本);
- 预测推理(物体恒存、碰撞动力学、轨迹合理性,共310样本);
- 决策规划(长 horizon 任务分解,25样本);
- 泛化执行(OOD场景如艺术风格,20样本);
- 数据规模:606样本(每个样本含初始图+文本指令+GT视频);
- 数据来源:开源机器人数据(RoboMIND、DROID)+ 自研数据 + AI生成OOD数据。
- 4项核心能力(含20子任务):
-
多维度评估指标
评估维度 具体指标 说明 视频质量 FVD、SSIM、PSNR、Dreamsim 衡量视觉保真度与时间一致性 规划推理 DAG评分(Key-step Recall/Precision、Sequential Consistency) 基于有向无环图评估任务分解合理性 物理规则 轨迹一致性(MED/DTW/Fréchet距离)、物理常识评分 评估物体运动、碰撞等物理规律符合度 指令遵循 caption score、Sequence Match Score、Execution Quality Score GPT-4o评估生成视频与指令的语义对齐 -
整体评分方法
先将原始指标归一化至[0,1],再通过单调参数变换(如Logit temperature、Tanh slope)映射至[0,100],最终按“视频质量、规划推理、物理规则、指令遵循”加权计算总分。
五、实验结果与分析
-
训练数据概况
- 规模:203万视频片段(7300+小时)、24fps;
- 场景:200+模拟场景(家庭/工业);
- 筛选:剔除75%低质量数据(如静态、碰撞失败),保留高价值交互轨迹。
-
核心性能对比(WoWBench)
模型 指令理解准确率 物理规律符合率 整体SOTA CogVideoX - - 39.56(总分) Wan2.1 - - 42.71(总分) Cosmos-Predict - - 41.76(总分) WoW-DiT(cosmos2) 96.53% 80.16% 49.39(总分) -
缩放分析
- 数据规模:从30k→2M样本,易任务性能饱和,难任务持续提升(FVD按幂律下降);
- 模型参数:2B→7B→14B,性能依次提升19.22%、5.91%,但推理速度下降(14B比7B慢44.16%);
- 任务难度:易任务(231样本)成功率94.5%,中任务(237样本)75.2%,难任务(138样本)17.5%。
-
真实机器人操控验证
选取20项代表性任务,FM-IDM实现“视频→动作”转换,真实机器人执行成功率:- 易任务(如“放置面包”):94.5%;
- 中任务(如“打开抽屉”):75.2%;
- 难任务(如“插入筷子”):17.5%;
显著优于基线模型(如ResNet-MLPs易任务68.1%、难任务7.7%)。
六、下游应用与案例研究
-
典型应用场景
- 新视角合成:4D世界模型从少量锚点视图生成几何一致的手腕视角视频;
- 轨迹引导生成:3D占用环境规划物理合理轨迹,再生成对应操控视频;
- 动作到视频:从7DoF动作轨迹生成高分辨率(640×480)、长时长(300+帧)操控视频;
- VLM规划优化:通过WoW模拟反馈,VLM(Qwen-7B)任务成功率从30%提升至89%。
-
案例研究
- 反事实推理:指令“蓝色方块极重”,WoW生成“机器人夹爪用力但方块不动”的物理一致视频;
- 工具使用泛化:“剪绳子”任务中,WoW通过VLM反馈从“直接用夹爪剪”优化为“用剪刀剪”;
- 逻辑一致性:处理“保留蓝色物体”(否定逻辑)、“抽屉开则取物否则敲击”(条件逻辑),生成严格遵循语言逻辑的动作序列。
七、结论
WoW通过大规模具身交互数据、SOPHIA闭环优化、FM-IDM动作落地,验证了“具身交互是AI物理直觉的基石”;其不仅在WoWBench实现SOTA,还能泛化至跨机器人、跨任务场景,并成功落地真实机器人操控,为具身智能提供了“想象-动作”闭环的范式参考。
4. 关键问题
问题1:WoW的核心假设与现有视频生成模型(如Sora)的根本差异是什么?该假设如何通过技术设计落地?
答案:
- 核心差异:现有视频模型(如Sora)依赖被动观察互联网数据,训练目标是建模统计相关性,导致物理直觉脆弱(仅“形似”而非“神似”);WoW的核心假设是AI需从大规模、因果丰富的真实世界具身交互数据中学习,才能发展出可靠的物理直觉,即“认知源于行动”。
- 落地设计:
- 数据层面:使用200万条真实机器人交互轨迹(5275任务、12种机器人),确保数据含“动作-结果”因果链;
- 架构层面:SOPHIA框架通过VLM评估物理一致性,迭代精炼语言指令,引导DiT生成物理合理视频;
- 动作落地:FM-IDM将生成视频转化为7自由度执行器动作,闭合“想象-动作” loop,验证物理直觉的真实性。
问题2:WoW在“从想象到真实动作落地”的过程中,有哪些关键技术突破?如何解决现有具身模型的核心痛点?
答案:
- 关键技术突破:
- SOPHIA自优化框架:首次将VLM的推理能力与DiT的生成能力耦合,通过“生成→评估→反馈→精炼”闭环,解决现有模型物理一致性差的痛点(如物体穿模、轨迹不合理);
- FM-IDM逆动力学模型:基于光流+场景上下文,直接从像素级视频推断7自由度动作,类比人类小脑功能,解决“像素未来→可执行动作”的模态鸿沟;
- 自监督特征融合:将DINOv2自监督视觉特征嵌入DiT backbone,提升模型对物体边界、空间关系的感知能力,解决现有扩散模型感知粗糙的问题。
- 痛点解决:针对具身模型的空间一致性(4D世界模型+3D光流)、时间一致性(闭环反馈+记忆架构)、物理一致性(VLM评估+因果数据)三大痛点,提供端到端解决方案。
问题3:WoWBench基准的设计核心是什么?其与现有视频评估基准(如VBench-2.0)相比,在评估具身世界模型上有何独特价值?
答案:
- 设计核心:聚焦物理一致性与因果推理,而非仅评估视觉质量;以“Image+Text→Video”为任务形式,模拟具身智能“理解指令→生成未来→执行动作”的真实场景。
- 独特价值:
- 评估维度更贴合具身需求:现有基准(如VBench-2.0)侧重视觉保真度(如光效、动作流畅),WoWBench新增“预测推理”(物体恒存、碰撞动力学)、“决策规划”(长horizon任务分解)、“泛化执行”(OOD场景),覆盖具身智能核心能力;
- 评估指标更精准:引入DAG评分(任务分解合理性)、轨迹一致性(MED/DTW/Fréchet距离)等物理专属指标,而非依赖FVD/SSIM等视觉指标;
- 数据与人类偏好高度相关:通过“GPT-4o初筛+人类专家验证”构建606样本,实验显示WoWBench评分与人类评估的Pearson相关系数达0.89,确保评估结果的可信度;
- 支持端到端验证:样本含初始图+指令+GT视频,可直接评估“生成视频→动作落地”的全流程,为具身模型提供闭环评估工具。
更多推荐



所有评论(0)