SOURCE // NEWS

ResNet作者任少卿新作:MM-Future多模态世界-动作模型登场

ResNet作者任少卿新作:MM-Future多模态世界-动作模型登场

时隔近十年,计算机视觉领域的传奇人物、ResNet 与 Faster R-CNN 的合作者任少卿再度发表学术论文,以通讯作者身份带来了自动驾驶领域的最新突破。这篇由蔚来(NIO)主导的研究论文题为《MM-Future: Multi-Mode Joint World–Action Modeling for Autonomous Driving》,提出了一种全新的多模式世界—动作联合模型,旨在让自动驾驶系统拥有“走一步想十步”的深度规划能力。

该论文直击端到端自动驾驶的痛点:在复杂的现实驾驶场景中,系统不能只生硬地预测一条轨迹,而必须面对充满不确定性的多个“未来”。MM-Future 的核心思想是摒弃传统单向决策,让模型一次性生成多组“配对场景-动作假设”(paired scene–action hypothesis)。在每组假设中,车辆轨迹与对应的未来环境场景共同演化,双向耦合,最后通过评估器挑选出最安全、最优的行驶路径。

目前的“世界-动作模型”(World–Action Model)主要分为两类路线,但各有硬伤。第一类是级联式方案,即先生成候选轨迹再预测对应场景,或者先预测场景再规划路径。这种单向信息流导致后面的步骤无法修正前面的错误决策。第二类是联合式方案,场景与动作相互交织演化,但现有的此类方法通常只能输出单一未来假设。而现实路况复杂,车辆需要同时具备“双向交互”与“多路径预演”的能力,这正是 MM-Future 填补的技术空白。

同时演化几十个未来场景,必然面临多样性、计算成本以及候选筛选三大门槛。在多样性方面,针对单真值轨迹导致的监督局限,团队在动作端引入了高斯混合噪声(Gaussian Mixture Noise),并在训练中采用“多选一监督”(Best-of-Many),避免所有候选被同一条真值轨迹拉向相似结果,从而保持了未来预测的多样性与物理配对。

在控制计算成本上,MM-Future 创新性地引入了 MM-Tokens。它不进行高成本的 RGB 图像重建或完整的 BEV 恢复,而是将多摄像头、多帧的视觉特征压缩成专为规划服务的紧凑 Token,从而在大幅降低计算开销的同时,精准保留道路结构、交通参与者等关键语义信息。此外,系统通过 Modality-aware Transformer 双向耦合处理动作与场景流,最后由 Future-Conditioned Proposal Scorer 读取每条轨迹专属的预测未来进行综合评分,实现高精度的轨迹筛选。

在权威基准 NAVSIM 和 HUGSIM 上的测试结果表明,MM-Future 展现出了极其优异的性能。在 NAVSIM-v1 测试中,该模型取得了 94.0 PDMS 的优异成绩,显著超越了传统 WAM 方案 DriveFuture 的 90.7,以及端到端模型 DrivoR 的 93.7。消融实验也证实,从单模式动作扩展到 32 组场景-动作联合模式并加入未来条件评分,PDMS 指标从 84.1 飙升至 93.3,充分证明了多未来联合推演的强大实力。

AgentUpdate 深度解析

从 AI Agent 生态的视角来看,MM-Future 不仅仅是一项自动驾驶技术,更代表了具身智能(Embodied AI)世界模型设计的范式转变。相较于单向推理的传统 Agent,MM-Future 通过“动作-场景双向演化”实现了更高级的主动式规划(Proactive Planning)。这与当前大语言模型(LLM) Agent 领域中流行的 MCTS(蒙特卡洛树搜索)和 ToT(思维树)思想不谋而合,但它在物理时空连续体中实现了实时多路径预演。通过将高维传感器特征压缩为紧凑的 MM-Tokens,该系统在保证多假设并行推演的同时降低了计算开销,为解决物理世界中 Agent 的‘幻觉’与安全冗余问题提供了极具启发性的工程范例。未来,这种多模态联合预测与多模态评分机制,或将超越自动驾驶,成为机器人与工业具身智能体的核心决策底座。