> ## Documentation Index
> Fetch the complete documentation index at: https://docs.anyfast.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Kling 数字人

> 通过 AnyFast 使用 Kling 语音合成和数字人图生视频能力。

Kling 数字人可将人物图片和语音生成口播视频。完整流程包含两个独立的 AnyFast 接口：可选的语音合成接口 `POST /kling/v1/audio/tts`，以及数字人生成接口 `POST /kling/v1/videos/avatar/image2video`。

<Info>
  TTS 是独立的同步接口，数字人生成是异步接口。如果已有符合要求的音频，可跳过 TTS，直接通过 `sound_file` 传入音频。
</Info>

## 调用流程

<Steps>
  <Step title="准备语音">
    调用 TTS 将文本转换为音频，并读取 `data.task_result.audios[0].id`；也可以准备自己的公网音频 URL。
  </Step>

  <Step title="创建数字人任务">
    提交人物图片，并在 `audio_id` 和 `sound_file` 中选择一个。两个音频字段不能同时传入。
  </Step>

  <Step title="按任务 ID 轮询">
    从创建响应读取 `task_id`，轮询 `GET /kling/v1/videos/avatar/image2video/{task_id}`，直到 `data.task_status` 变为 `succeed` 或 `failed`。
  </Step>

  <Step title="保存结果">
    成功后下载 `data.task_result.videos[0].url`。生成媒体可能过期，请及时转存。
  </Step>
</Steps>

## 输入要求

| 能力    | 输入                                                  | 主要限制                                                |
| ----- | --------------------------------------------------- | --------------------------------------------------- |
| TTS   | `text`、`voice_id`、`voice_language`，可选 `voice_speed` | 文本不超过 1,000 字符；语言为 `zh` 或 `en`；语速 `0.8`～`2.0`       |
| 人物图片  | `image` 中的公网 URL 或纯 Base64                          | JPG、JPEG、PNG；不超过 10 MB；宽高均不小于 300 px；比例 1:2.5～2.5:1 |
| 已生成语音 | TTS 返回的 `audio_id`                                  | 30 天内生成；时长 2～300 秒                                  |
| 自有语音  | `sound_file` 中的公网 URL 或纯 Base64                     | MP3、WAV、M4A、AAC；不超过 5 MB；时长 2～300 秒                 |
| 输出质量  | `mode`                                              | `std` 或 `pro`；默认 `std`                              |

传入纯 Base64 时，不要包含 `data:image/png;base64,` 等前缀。

## 使用 TTS 生成语音

```bash cURL theme={null}
curl --request POST \
  --url https://www.anyfast.ai/kling/v1/audio/tts \
  --header 'Authorization: Bearer YOUR_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "text": "你好，欢迎使用 AnyFast 数字人服务。",
    "voice_id": "oversea_male1",
    "voice_language": "zh",
    "voice_speed": 1.0
  }'
```

TTS 会在同一个响应中返回已完成的音频。请保存音频 ID、URL 和时长：

```text theme={null}
data.task_result.audios[0].id
data.task_result.audios[0].url
data.task_result.audios[0].duration
```

`voice_id` 用于选择 TTS 音色。请从 [Kling AI Voice List](https://docs.qingque.cn/s/home/eZQDvafJ4vXQkP8T9ZPvmye8S?identityId=2E1MlYrrPk4) 选择音色 ID，并将 `voice_language` 设置为该音色对应的语言。返回音频的 `id` 才是后续接口所需的 `audio_id`，二者不能混用。

## 生成数字人视频

<Tabs sync={false}>
  <Tab title="使用 TTS 音频 ID">
    ```bash cURL theme={null}
    curl --request POST \
      --url https://www.anyfast.ai/kling/v1/videos/avatar/image2video \
      --header 'Authorization: Bearer YOUR_API_KEY' \
      --header 'Content-Type: application/json' \
      --data '{
        "image": "https://example.com/portrait.png",
        "audio_id": "AUDIO_ID_FROM_TTS",
        "prompt": "人物自然看向镜头说话，神态友好，轻微点头。",
        "mode": "std",
        "watermark_info": {"enabled": true}
      }'
    ```
  </Tab>

  <Tab title="使用自有音频">
    ```bash cURL theme={null}
    curl --request POST \
      --url https://www.anyfast.ai/kling/v1/videos/avatar/image2video \
      --header 'Authorization: Bearer YOUR_API_KEY' \
      --header 'Content-Type: application/json' \
      --data '{
        "image": "https://example.com/portrait.png",
        "sound_file": "https://example.com/speech.mp3",
        "prompt": "人物面向镜头自然讲述，表情友好。",
        "mode": "pro",
        "watermark_info": {"enabled": false}
      }'
    ```
  </Tab>
</Tabs>

创建响应使用 AnyFast 任务包装格式，可从 `task_id` 或 `id` 读取任务 ID。

## 查询任务

```bash cURL theme={null}
curl --request GET \
  --url https://www.anyfast.ai/kling/v1/videos/avatar/image2video/TASK_ID \
  --header 'Authorization: Bearer YOUR_API_KEY'
```

查询响应使用 Kling 任务字段。轮询 `data.task_status` 时，`submitted` 和 `processing` 可能重复出现或相互切换，不应据此判断任务失败。仅在状态变为 `succeed` 或 `failed` 时停止轮询。

## 选择 `std` 或 `pro`

普通口播或低成本预览可使用 `std`；更重视画面细节时使用 `pro`。实测中，两种模式都成功生成了包含音轨且可解码的视频，`pro` 的输出分辨率高于 `std`。

<Card title="数字人 API 参考" icon="code" href="/zh/api-reference/model-api/kuaishou/kling-digital-human">
  查看 TTS 与数字人生成的完整请求和响应字段。
</Card>

<script src="/public/feedback.js" />
