Skip to main content
Kling 数字人可将人物图片和语音生成口播视频。完整流程包含两个独立的 AnyFast 接口:可选的语音合成接口 POST /kling/v1/audio/tts,以及数字人生成接口 POST /kling/v1/videos/avatar/image2video。
TTS 是独立的同步接口,数字人生成是异步接口。如果已有符合要求的音频,可跳过 TTS,直接通过 sound_file 传入音频。

调用流程

1

准备语音

调用 TTS 将文本转换为音频,并读取 data.task_result.audios[0].id;也可以准备自己的公网音频 URL。
2

创建数字人任务

提交人物图片,并在 audio_id 和 sound_file 中选择一个。两个音频字段不能同时传入。
3

按任务 ID 轮询

从创建响应读取 task_id,轮询 GET /kling/v1/videos/avatar/image2video/{task_id},直到 data.task_status 变为 succeed 或 failed。
4

保存结果

成功后下载 data.task_result.videos[0].url。生成媒体可能过期,请及时转存。

输入要求

传入纯 Base64 时,不要包含 data:image/png;base64, 等前缀。

使用 TTS 生成语音

cURL
TTS 会在同一个响应中返回已完成的音频。请保存音频 ID、URL 和时长:
voice_id 用于选择 TTS 音色。请从 Kling AI Voice List 选择音色 ID,并将 voice_language 设置为该音色对应的语言。返回音频的 id 才是后续接口所需的 audio_id,二者不能混用。

生成数字人视频

cURL
创建响应使用 AnyFast 任务包装格式,可从 task_id 或 id 读取任务 ID。

查询任务

cURL
查询响应使用 Kling 任务字段。轮询 data.task_status 时,submitted 和 processing 可能重复出现或相互切换,不应据此判断任务失败。仅在状态变为 succeed 或 failed 时停止轮询。

选择 std 或 pro

普通口播或低成本预览可使用 std;更重视画面细节时使用 pro。实测中,两种模式都成功生成了包含音轨且可解码的视频,pro 的输出分辨率高于 std。

数字人 API 参考

查看 TTS 与数字人生成的完整请求和响应字段。