- 单次生成时长
- 0s单次生成时长
- 最高分辨率
- 0p最高分辨率
- 文档格式
- 0文档格式
- 文件大小上限
- 0MB文件大小上限
- 页数上限
- 0页数上限
- 输入类型
- 0输入类型
时长
30 秒,一镜到底
更长的生成时长不只是数字变大。30 秒带来了叙事空间 —— 连续运镜、一镜到底的长镜头,以及短片段承载不了的复杂镜头语言。它让模型从生成一个镜头,走向讲述一段完整的故事。
智能时长
根据提示词自动推荐合适的视频长度。
视频延长
在已有结果上继续延展,让剧情自然生长下去。
一个镜头
一段完整的故事
全能输入
万物皆可生视频
在文本、图片、音频、视频之外,Wan 3.0 首次支持直接读取文档。办公素材无需中间环节,即可成片。
五类输入
文本
图片
音频
视频
文档
新增
支持的文档格式
- .doc
- .xls
- .ppt
- .txt
- .key
- .pages
- .numbers
- .md
同样支持网页链接作为输入。
输入限制
- 每次生成一个文件或链接
- 文件大小不超过 100MB
- 页数不超过 50 页
可以产出什么
教学课件
把课件与讲义变成节奏得当的讲解视频。
产品演示
一份产品文档,直接成为完整的演示影片。
动态图表
表格化为动效,数据本身分毫不差。
业务汇报
汇报材料变成真正有人愿意看下去的内容。
真实感
千人千面
Wan 3.0 着力改善让 AI 人像一眼可辨的油腻感与千篇一律。五官与皮肤细节更丰富,情绪表达自然克制,微表情与肢体动作彼此联动。即便在群像场景中,不同人物也各自承载着复杂而分明的情绪。
生产真正在意的一致性
一致性才是生产工作真正关心的指标。在全能参考任务中,Wan 3.0 能稳定保持参考细节。
- 01
角色
五官、发型发色、形体、服饰与配饰保持稳定 —— 角色不会中途跑偏。
- 02
道具
多角度外观、硬件结构、Logo 与材质细节始终一致。
- 03
场景
角色站位与机位视角之间的关系处理得当。
- 04
风格
影视调性还原精准,多风格创作也不易发生风格混淆。
图表、数据与界面
面向数字与图形类素材,Wan 3.0 提升了审美基线 —— 配色和谐、表达流畅,让图表、数据与界面拥有与实拍内容同等的质感。
视频编辑
视频编辑能力显著增强。画面、剧情与台词,都可以修改。
- 画面
- 剧情
- 台词
沉浸体验
不只看得见,也听得见的真实感
Wan 3.0 在真实感、画面质感与声音设计上同步提升,带来远超单一画面的视听冲击。
真实感
光线、运动与材质的表现符合眼睛的预期。
画面质感
细节经得起细看,不会在放大后变得扁平。
声音设计
声音与画面一同生成,而非事后叠加。
已知局限
仍需改进之处
阿里云明确表示,声音质感与文字准确度仍有进步空间。如果你的创作依赖精确的画面文字或高保真声音,请预留后期处理环节。
演进
从 Wan 1.0 到 Wan 3.0,八个版本
Wan 系列已迭代八个版本。Wan 3.0 的升级来自真实的行业需求,也为回到真实的生产流程而生。
投入生产
为真实创作流程而建
影视创作
30 秒时长、实景级真实感与精准一致性,适配 AI 影视、短剧、音乐舞蹈 MV 与生活 Vlog —— 且成本更低。
AI 影视 · 短剧 · 音乐 MV · Vlog
广告营销
广告对品质与定制程度要求极高。全能创作打破了图文格式的限制,让创意可以被直接呈现出来。
家电 · 美妆 · 汽车 · 快消 · 3C · 服饰 · 软件
设计创意
产品界面走查、软件功能动效与数据可视化,在保留专业度的同时成为会讲故事的作品 —— 省去繁琐的动画制作环节。
界面演示 · 功能动效 · 数据可视化
文旅传播
风景、人文地标与地方美食无需大规模实拍即可产出 —— 低成本、高产能地完成城市宣传片与文化数字化。
城市宣传片 · 地标 · 美食 · 文化存档
常见问题
常见问题
Wan 3.0 单次最长可生成 30 秒。智能时长可根据提示词推荐合适长度,视频延长则可在此基础上继续延展。
doc、xls、ppt、pdf、txt、key、pages、numbers 与 md,以及网页链接。每次生成限一个文件或链接,不超过 100MB 与 50 页。
在全能参考任务中,Wan 3.0 能稳定保持角色的五官、发型、形体、服饰与配饰,以及道具结构、Logo 与材质、场景中角色相对机位的站位关系,还有整体的风格调性。
可以。编辑范围涵盖画面、剧情与台词。
阿里云表示,声音质感与文字准确度仍有进步空间。
在 wan.video 即可体验公测版本。带上提示词、文档或链接就能开始。