SOURCE // NEWS

索辰科技联合美梦空间发布首个具身物理世界模型及测评基准

索辰科技联合美梦空间发布首个具身物理世界模型及测评基准

当下,具身智能的商业化正面临瓶颈。北京大学与BeingBeyond联合发布的BeTTER基准指出,最先进的VLA模型(视觉-语言-动作模型)在面对空间布局偏移时,成功率呈断崖式下跌。此外,斯坦福大学的研究也表明,在复杂的接触式任务中,#VLA模型存在“精度失效”与“力失效”两个相互独立的痛点。简而言之,现有的VLA机器人只是统计学模仿者,并不真正懂得杯壁厚度、摩擦力或重心的改变,缺乏对物理世界的真实感知。

为打破这一僵局,在第五届全球数字贸易博览会上,由高文院士领衔的AVS先进视觉系统研究中心孵化的美梦空间(Memo),联合战略投资方索辰科技(688507.SH),正式发布了两项突破性成果:首个具备物理感知能力的Physical-WAM(物理-世界动作模型)和行业首个物理漂移评测基准RoboTwin-Phys。2026年8月,物理AI领军企业索辰科技完成了对美梦空间的独家种子轮战略投资,两者的深度协同正加速物理世界模型的研发落地。

传统机器人训练极度受限于数据。与文本和图像领域动辄数十亿级的数据量相比,机器人物理交互样本仅处于百万量级。物理交互数据的采集硬件损耗大、周期长,且本体间迁移困难。为此,美梦空间提出的Physical-WAM在感知输入与动作输出之间引入了一层“物理Token”表征,旨在让模型不仅能预测“下一帧画面”,更能理解“画面变化的物理成因”。

具体而言,Physical-WAM由三个核心模块构成:PhysLens(物理翻译器)负责从多模态信号中显式估计摩擦、重量和重心等不可直观观测的物理信息并转化为物理Token;PhysDream(物理预言家)结合当前状态预测滑脱、形变等风险;而PhysAct(动作生成器)则基于物理条件实时修正机器人动作。例如,在抓取纸杯并注水的过程中,系统能实时感知重量变化并调整抓握力度,展现出人类般的“物理直觉”。

除了模型本身,美梦空间还推出了RoboTwin-Phys评测基准。传统的具身智能评测主要测量任务完成度,对物理参数扰动不具备鲁棒性。RoboTwin-Phys在RoboTwin的基础上,新增了13类物理扰动因素,涵盖物体属性、接触属性、阻尼、环境及相机配置五大维度。它通过提供物理真值、固定种子配对评估和递进式逻辑,精确定位模型在感知、预测和执行链条中的失效环节,为具身智能的迭代提供了标尺。

AgentUpdate 深度解析

具身智能Agent长期以来受困于“Sim-to-Real”(仿真到真实世界)的鸿沟。传统的VLA模型(如谷歌的RT-2)本质上是基于像素到动作的端到端映射,缺乏对物理底层逻辑的建模。美梦空间与索辰科技推出的Physical-WAM,通过引入显式“物理Token”,标志着具身Agent正从“视觉模仿时代”迈向“物理直觉时代”。相比单纯依靠多模态大模型(VLM)进行高维推理,物理世界动作模型(WAM)通过解耦物理属性(如摩擦力、刚度),能让Agent在未见过的物理环境中具备零样本泛化能力。这种将经典物理引擎先验与深度学习模型表征融合的路径,不仅能大幅降低机器人的物理数据采集成本,更将成为未来工业、服务业具身Agent走向全自主化(L4-L5级具身智能)的底层技术基石。这为整个AI Agent生态在探索真实物理世界交互上,提供了一条极具启发性的高可行性演进路径。