POST /kling/v1/audio/tts,以及数字人生成接口 POST /kling/v1/videos/avatar/image2video。
TTS 是独立的同步接口,数字人生成是异步接口。如果已有符合要求的音频,可跳过 TTS,直接通过
sound_file 传入音频。调用流程
1
准备语音
调用 TTS 将文本转换为音频,并读取
data.task_result.audios[0].id;也可以准备自己的公网音频 URL。2
创建数字人任务
提交人物图片,并在
audio_id 和 sound_file 中选择一个。两个音频字段不能同时传入。3
按任务 ID 轮询
从创建响应读取
task_id,轮询 GET /kling/v1/videos/avatar/image2video/{task_id},直到 data.task_status 变为 succeed 或 failed。4
保存结果
成功后下载
data.task_result.videos[0].url。生成媒体可能过期,请及时转存。输入要求
传入纯 Base64 时,不要包含
data:image/png;base64, 等前缀。
使用 TTS 生成语音
cURL
voice_id 用于选择 TTS 音色。请从 Kling AI Voice List 选择音色 ID,并将 voice_language 设置为该音色对应的语言。返回音频的 id 才是后续接口所需的 audio_id,二者不能混用。
生成数字人视频
- 使用 TTS 音频 ID
- 使用自有音频
cURL
task_id 或 id 读取任务 ID。
查询任务
cURL
data.task_status 时,submitted 和 processing 可能重复出现或相互切换,不应据此判断任务失败。仅在状态变为 succeed 或 failed 时停止轮询。
选择 std 或 pro
普通口播或低成本预览可使用 std;更重视画面细节时使用 pro。实测中,两种模式都成功生成了包含音轨且可解码的视频,pro 的输出分辨率高于 std。
数字人 API 参考
查看 TTS 与数字人生成的完整请求和响应字段。