SOURCE // NEWS

阿里Wan 3.0大模型公测:支持PPT/文档直出30秒大片

阿里Wan 3.0大模型公测:支持PPT/文档直出30秒大片

8月6日,阿里巴巴旗下视频生成大模型 Wan 3.0 正式开启公测。该版本在生成时长、多模态理解、全能参考以及物理世界还原等维度迎来了全面升级。最直观的改变是,Wan 3.0 支持单次生成长达 30秒 的视频,支持连续运镜和一镜到底,使 AI 视频从单一镜头拼接走向了完整的叙事表达。同时,模型还配备了智能时长功能,可根据 Prompt 自动推荐最佳视频长度。

更具突破性的是,Wan 3.0 正在从单纯的娱乐内容生成工具转变为强大的生产力载体。除了支持文本、图像、音频和视频等常规参考外,它首次支持直接读取 doc、xls、ppt、pdf、md 等格式的结构化文档(单个文件或链接限制在 100MB、50页以内)。这意味着用户只需上传一份产品 PPT 并辅以提示词,模型便能直接输出一段高质量的业务汇报或产品演示视频,背后依托的是其强大的 Prompt 工程 与精准的指令遵循能力。

在画面质感和真实度方面,Wan 3.0 实现了“千人千面”的人物刻画,微表情、皮肤纹理和肢体动作高度自然协同。而在图表、数据和数字化界面的渲染上,视觉审美也大幅度提升。目前,Wan 3.0 已在 阿里云百炼、万镜一刻、万相官网等平台上线公测。API 价格按分辨率分级,1080P 规格定价为 1.2 元/秒,近期将全量开放。

AgentUpdate 深度解析

Wan 3.0 引入对 PPT、PDF 等结构化文档的直接支持,标志着视频大模型正从“内容娱乐”向“工作流 Agent”演进。横向对比 Sora 或 Kling,Wan 3.0 不再局限于被动接收简短 Prompt,而是具备了深度解析复杂上下文和多模态指令的“理解力”。在 AI Agent 生态中,这一能力至关重要。未来的 Agent 不仅需要能调用工具、生成文本,更需要像人类员工一样直接读取需求文档并自动输出商业级的视频、动画或演示汇报。Wan 3.0 的文档读取与长视频生成能力,为构建自动化的“视频内容生产 Agent(Video Agent)”提供了坚实的基础底座,将极大地加速企业级智能体在营销、教育和办公自动化场景中的闭环落地。