返回行业动态
模型与产品

阿里云视频生成大模型 Wan3.0 正式上线:单次生成 30 秒视频,文档可直接转视频

8月24日,阿里云宣布视频生成大模型 Wan3.0 正式上线。该模型单次可生成最长 30 秒视频,并首次支持 doc、xls、ppt、pdf、md 等文档格式直接输入生成视频,在人物一致性、真实感与指令遵循等维度全面升级。API 定价 480P/720P/1080P 分别为 0.3/0.6/1.2 元/秒,8月24日至9月23日阿里云百炼与千问 AI 平台限时 7 折。目前麦芽旗下跳跃视界、京东灵境、美图 RoboNeo、井英科技等平台已完成接入。

来源:阿里云官方(Alibaba Cloud)原标题:Wan3.0: 30-Second AI Video Generation from Any Input查看原文
深蓝色科技感封面:悬浮智能工作站将PPT文档与图片素材转化为视频画面,右侧显示视频播放器与时间轴,顶部标题为“阿里云视频生成大模型Wan3.0正式上线”

图片来源:北京拓实科技原创

发生了什么

8月24日,阿里云宣布视频生成大模型 Wan3.0 正式上线(GA),距离 8 月 6 日开启公测约两周半。与上一代相比,Wan3.0 将单次视频生成时长上限提升至 30 秒,并首次支持 doc、xls、ppt、pdf、md 等文档格式输入,用户上传教学课件、产品演示、业务汇报等办公素材即可直接生成视频。官方称该模型在生成时长、万能创作、全能参考以及真实世界还原等维度全面升级,公测期间持续优化了指令遵循、跨镜头一致性、音频质感与视频编辑能力。

关键升级

  • 单次生成最长 30 秒视频,支持智能时长推荐与视频延长功能,可完成连续运镜、一镜到底等长叙事表达
  • 首次支持文档格式输入(doc、xls、ppt、pdf、md 等),单个文件或链接不超过 100MB、50 页,实现“万物皆可生视频”
  • 人像生成追求“千人千面”,细腻还原五官与皮肤质感;角色、道具、声音、空间关系、风格等参考维度可稳定保持
  • 视频编辑能力升级,支持修改画面、剧情与台词,可在生成基础上迭代而无需从头重做

对企业用户意味着什么

Wan3.0 已从公测进入真实生产流程:短剧与影视团队用它规模化出片,广告公司用于 TVC 制作,文旅传播与 MV 制作亦有落地案例。API 定价 480P 0.3 元/秒、720P 0.6 元/秒、1080P 1.2 元/秒,8月24日至9月23日阿里云百炼与千问 AI 平台开启限时 7 折优惠。麦芽旗下跳跃视界、Deevid、京东灵境平台、美图 RoboNeo、井英科技等已完成接入。对企业而言,文档直接转视频降低了内容生产成本,也意味着视频生成正从“生成单镜头”走向“生产完整内容”的生产力工具形态。

待观察

官方披露,Wan3.0 在声音质感与画面内文字渲染精度上仍有提升空间,将在后续版本继续完善。当前视频生成赛道竞争激烈,Wan3.0 正式商用后的定价策略与生态落地效果,以及它在企业生产场景中能否保持稳定、连续、可落地的输出质量,仍需市场进一步检验。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。