SOURCE // NEWS

Sand.ai开源全球首个千亿级MoE视频大模型,生成成本骤降九成

Sand.ai开源全球首个千亿级MoE视频大模型,生成成本骤降九成

近日,清华系AI初创团队Sand.ai发布并开源了其最新视频生成模型MAGI-2-preview。该模型总参数量高达114B(1140亿),但由于采用了先进的MoE(混合专家)架构,单次前向传播仅激活约6B参数。这一突破不仅展示了强大的视频生成质量,更将生成成本拉到了极致低位:以8卡H100算力折算,生成一段10秒1080P超清视频的成本仅需0.5元人民币,仅为行业主流密模型(Dense)的十分之一。

AA视频生成榜单中,MAGI-2-preview位列第六,以极低的激活参数展现了逼近闭源第一梯队的效果。对于视频生成而言,Scaling Law(尺度定律)的落地一直受限于高昂的算力成本。与离散文本token不同,视频中的每一帧画面都需被拆分为海量的空间Patch,连续帧还要记录复杂的时序动作、物体关联与镜头切换。如果直接套用稠密模型(Dense Model),超长序列带来的计算和通信成本将成倍激增,这也是视频模型Scaling路线难以照搬LLM的主要痛点。

引入#MoE架构是解决这一痛点的天然方案,但视频MoE也面临着严峻的通信瓶颈。在传统的专家并行机制中,跨GPU的Token数据传输成本极高,尤其是对于超长序列的视频数据。为了打破这一“不可能三角”,Sand.ai从底层重构了系统,实现了文本、视频与音频的深度融合。MAGI-2-preview延续了在daVinci-MagiHuman中得到验证的单流架构,视频、音频与文本进入同一个Transformer网络,从第一层开始便共同建模,这不仅大幅降低了端到端延迟,也更天然地适配MoE的扩展。

在专家设计上,该模型采用了Multi-Head LatentMoE架构,将3072维的隐层表示拆分为12个256维的Head,使每个Head能够独立进行路由。在36层的主体网络中,每层共包含3072个独立专家单元,每个Token在每个Head内选择6个专家,合计激活72个小专家。这一极细粒度的分工让模型能够拼凑出更丰富的能力组合。为此,Sand.ai自研了MagiMoE高性能算子库,将路由、排序和专家计算深度融合,并提出Head Parallel(Head并行)策略,使通信量不随激活专家数而波动。在优化器方面,则采用了混合设计,对矩阵参数使用Muon,对专家参数使用AdamW

而在数据工程层面,团队传统做法,转而采取“扩大广度、精准组织”的策略。他们保留了极具多样性的数据源,通过更精准的多模态标注将数据组织起来,让模型在预训练阶段尽可能完整地覆盖真实物理世界的分布,随后在后训练(Post-training)阶段再集中解决偏好对齐、可控性和安全性的问题。

AgentUpdate 深度解析

MAGI-2-preview 的开源,标志着多模态大模型正式进入“高吞吐、低成本”的实用化拐点。从 AI Agent 生态的宏观视角来看,高昂的视觉感知与生成成本一直是阻碍物理世界具身智能和自主 Agent 规模化落地的核心掣肘。Sand.ai 通过 Multi-Head LatentMoE 架构与 Head Parallel 技术的底层重构,将视频生成的算力成本压缩了 90%,这为未来具备“实时世界模型建模能力”的 AI Agent 提供了极具可行性的技术范式。横向对比 Sora 等闭源路线,开源千亿 MoE 模型将极大地赋能开发者,允许 Agent 在极低成本下进行高频、实时的环境预测与多模态交互。未来的 AI Agent 将不仅是一个文本对话框,而是拥有极高物理世界常识、能边看边听边生成的多维智能体,这将加速空间智能(Spatial Intelligence)在各行各业的爆发。