Skip to main content
Wan3.0 Video 是阿里巴巴推出的全能视频生成模型,统一支持文生视频、首帧/首尾帧生视频、多模态参考,以及文件或网页参考。通过 AnyFast 调用时,使用模型 ID wan3.0-video 和端点 POST /v1/video/generations
对于特定内容请求,请选择 Direct 资源下的 wan3.0-video-nsfw。该 NSFW 变体是 AnyFast 专用模型 ID,并非阿里云官方模型。

核心能力

  • 可通过提示词、媒体素材或两者组合生成视频;input.promptinput.media 至少提供一项。
  • 支持通过首帧,或首帧与尾帧共同控制视频。
  • 单次最多参考 10 张图片、5 段视频和 5 段音频。
  • 支持先理解文档、演示文稿、表格、文本文件或公开网页,再据此生成视频。
  • 最长生成 30 秒、30 fps 的视频,并默认生成同步音频。
  • 通过 duration: -1ratio: "adaptive" 让模型智能选择时长和画面构图。

能力示例

阿里云官方页面仅提供了下方示例的输入素材,没有发布输出视频。请将这些素材视为上游输入示例,不要将其当作通过 AnyFast 复现的结果。
只传入 input.prompt,不传 input.media。提示词可描述主体、动作、场景、运镜、视觉风格和声音;超过 20,000 字符的部分会自动截断。该工作流支持 2–30 秒的 duration,也可设为 -1 让模型智能选择时长。

创建任务

cURL

Wan3.0 如何选择工作流

Wan3.0 根据媒体素材的 type 选择生成工作流。 input.promptinput.media 均可单独省略,但请求必须至少包含其中一项。只传入媒体而不提供提示词时,模型会根据媒体推断生成意图。

控制输出

分辨率取值表示服务档位,并非固定的宽高像素值;实际输出尺寸会随所选宽高比变化。 没有视频输入时,duration 可设为 2–30 的整数或 -1。请求包含参考视频时,所有输入视频的总时长与输出时长之和不得超过 30 秒。 所有生成视频均为 30 fps。

输入要求

图片

以下要求适用于 first_framelast_framereference_image

视频

音频

文件和网页

filelink 不能出现在同一个请求中;两者也都不能与 first_framelast_frame 混用。

提示词技巧

  • 描述会影响结果的主体、动作、场景、视觉风格、运镜、时间安排、台词、音乐和音效。
  • 按媒体类型和顺序使用 图像1视频1音频1 等名称引用多模态输入,并说明每份素材应提供什么内容。
  • 首尾帧生视频应明确描述两张图片之间的动作和视觉转场。
  • 文件或网页参考应指出需要采用的事实、产品、幻灯片或页面章节,以及内容顺序。
  • 提示词超过 20,000 字符的部分会自动截断。

查询和保存结果

创建接口返回异步任务 ID。轮询 GET /v1/video/generations/{id},直到 status 变为 SUCCESSFAILURE。任务可能从 NOT_START 开始,再进入 QUEUEDIN_PROGRESS;终态为 SUCCESSFAILUREprogress 是百分比字符串,例如 "0%""100%" 阿里云官方说明生成通常需要 1–5 分钟,并建议约每 15 秒轮询一次。该上游典型值不是 AnyFast 的服务等级承诺;AnyFast 的实际处理时间会随请求内容和队列状态变化。
cURL
  • 任务创建后可查询 24 小时。
  • 生成结果 URL 的有效期为 24 小时。
  • status 变为 SUCCESS 后请及时下载或转存视频。

Wan3.0 Video API 参考

查看所有工作流的完整请求和响应字段。
资料来源:阿里云 Wan3.0 视频生成 API 参考