session_id 和 face_choose。
对口型的音频输入为
face_choose[].audio_id 或 face_choose[].sound_file,两者二选一。需要从文本开始时,可先调用 Kling 数字人 TTS 接口,再把返回音频的 id 作为 face_choose[].audio_id 传入。调用流程
- 已有音频
- 文本转语音
voice_id 用于选择 TTS 音色,audio_id 用于标识 TTS 生成的音频。对口型接口需要 audio_id 时,不要传入 voice_id。
前置步骤:识别人脸
调用POST /kling/v1/videos/identify-face,在 video_url 和 video_id 中选择一个。保存:
创建对口型任务
- 使用音频文件
- 使用 TTS 音频 ID
cURL
face_choose 条目。audio_id 和 sound_file 必须二选一。
时间与音量
裁剪后的音频时长必须为 2~60 秒。
sound_file 支持公网 URL 或纯 Base64。MP3、WAV 和 M4A 已通过 AnyFast 验证,文件大小应不超过 5 MB。
查询结果
cURL
data.task_status,中间状态为 submitted、processing,终态为 succeed 或 failed。成功后从 data.task_result.videos[0].url 读取结果视频,从 data.task_result.videos[0].duration 读取接口返回时长。
Kling 对口型 API 参考
查看完整请求、响应、时间和查询字段。