Skip to main content
Kling 对口型可让源视频中的一张已识别人脸匹配指定语音。AnyFast 提供 Kling 原生调用流程:先识别人脸,再在对口型请求根层传入 session_id 和 face_choose。
对口型的音频输入为 face_choose[].audio_id 或 face_choose[].sound_file,两者二选一。需要从文本开始时,可先调用 Kling 数字人 TTS 接口,再把返回音频的 id 作为 face_choose[].audio_id 传入。

调用流程

voice_id 用于选择 TTS 音色,audio_id 用于标识 TTS 生成的音频。对口型接口需要 audio_id 时,不要传入 voice_id。

前置步骤:识别人脸

调用 POST /kling/v1/videos/identify-face,在 video_url 和 video_id 中选择一个。保存:
源视频时长须为 2~60 秒,格式为 MP4 或 MOV,分辨率为 720p 或 1080p,不超过 100 MB,宽高边长均在 512~2,160 px。完整请求见 Kling 对口型 API 参考中的人脸识别 Tab。

创建对口型任务

cURL
当前接口仅支持一个 face_choose 条目。audio_id 和 sound_file 必须二选一。

时间与音量

裁剪后的音频时长必须为 2~60 秒。sound_file 支持公网 URL 或纯 Base64。MP3、WAV 和 M4A 已通过 AnyFast 验证,文件大小应不超过 5 MB。

查询结果

cURL
轮询 data.task_status,中间状态为 submitted、processing,终态为 succeed 或 failed。成功后从 data.task_result.videos[0].url 读取结果视频,从 data.task_result.videos[0].duration 读取接口返回时长。

Kling 对口型 API 参考

查看完整请求、响应、时间和查询字段。