wan3.0-video 和端点 POST /v1/video/generations。
对于特定内容请求,请选择
Direct 资源下的 wan3.0-video-nsfw。该 NSFW 变体是 AnyFast 专用模型 ID,并非阿里云官方模型。核心能力
- 可通过提示词、媒体素材或两者组合生成视频;
input.prompt和input.media至少提供一项。 - 支持通过首帧,或首帧与尾帧共同控制视频。
- 单次最多参考 10 张图片、5 段视频和 5 段音频。
- 支持先理解文档、演示文稿、表格、文本文件或公开网页,再据此生成视频。
- 最长生成 30 秒、30 fps 的视频,并默认生成同步音频。
- 通过
duration: -1和ratio: "adaptive"让模型智能选择时长和画面构图。
能力示例
阿里云官方页面仅提供了下方示例的输入素材,没有发布输出视频。请将这些素材视为上游输入示例,不要将其当作通过 AnyFast 复现的结果。
- 文生视频
- 首帧生视频
- 首尾帧生视频
- 多模态参考
- 文件或网页
只传入
input.prompt,不传 input.media。提示词可描述主体、动作、场景、运镜、视觉风格和声音;超过 20,000 字符的部分会自动截断。该工作流支持 2–30 秒的 duration,也可设为 -1 让模型智能选择时长。创建任务
- 文生视频
- 首帧生视频
- 首尾帧生视频
- 多模态参考
- 文件或网页
cURL
Wan3.0 如何选择工作流
Wan3.0 根据媒体素材的type 选择生成工作流。
input.prompt 和 input.media 均可单独省略,但请求必须至少包含其中一项。只传入媒体而不提供提示词时,模型会根据媒体推断生成意图。
控制输出
分辨率取值表示服务档位,并非固定的宽高像素值;实际输出尺寸会随所选宽高比变化。
没有视频输入时,
duration 可设为 2–30 的整数或 -1。请求包含参考视频时,所有输入视频的总时长与输出时长之和不得超过 30 秒。
所有生成视频均为 30 fps。
输入要求
图片
以下要求适用于first_frame、last_frame 和 reference_image。
视频
音频
文件和网页
提示词技巧
- 描述会影响结果的主体、动作、场景、视觉风格、运镜、时间安排、台词、音乐和音效。
- 按媒体类型和顺序使用
图像1、视频1、音频1等名称引用多模态输入,并说明每份素材应提供什么内容。 - 首尾帧生视频应明确描述两张图片之间的动作和视觉转场。
- 文件或网页参考应指出需要采用的事实、产品、幻灯片或页面章节,以及内容顺序。
- 提示词超过 20,000 字符的部分会自动截断。
查询和保存结果
创建接口返回异步任务 ID。轮询GET /v1/video/generations/{id},直到 status 变为 SUCCESS 或 FAILURE。任务可能从 NOT_START 开始,再进入 QUEUED 和 IN_PROGRESS;终态为 SUCCESS 或 FAILURE。progress 是百分比字符串,例如 "0%" 或 "100%"。
阿里云官方说明生成通常需要 1–5 分钟,并建议约每 15 秒轮询一次。该上游典型值不是 AnyFast 的服务等级承诺;AnyFast 的实际处理时间会随请求内容和队列状态变化。
cURL
- 任务创建后可查询 24 小时。
- 生成结果 URL 的有效期为 24 小时。
status变为SUCCESS后请及时下载或转存视频。
Wan3.0 Video API 参考
查看所有工作流的完整请求和响应字段。




