Skip to main content
POST
cURL
使用此端点可通过一张源图像加一个音频源创建会说话的数字人短视频。

调用前准备

  • 提供一个数字人 image,可使用公开 URL 或原始 base64 字符串
  • 使用符合 Kling 像素要求的数字人图像;过小的缩略图会被生成任务拒绝
  • audio_idsound_file 中二选一发送
  • 首次请求请尽量保持简单:一张人脸图像、一个音频片段,以及一个可选的简短 prompt
  • 当引用的音频属于必须关联的先前任务时,请包含 task_id
  • 除非你明确需要更高质量路径,否则请先使用 mode: std

音频源规则

  • 如果你已经通过 Kling TTS 路径生成了语音,audio_id 是最简单的方式
  • 如果你已经有自己的 MP3、WAV、M4A 或 AAC 资源,sound_file 可直接使用
  • 文档说明数字人音频时长为 2 到 60 秒

任务流程

1

创建数字人任务

提交图像和一个音频源,然后保存返回的任务 id。
2

轮询任务

继续使用 获取 Kling 任务,直到任务进入终态。
3

保存最终结果

如果你需要在提供商交付 URL 失效后继续保留结果,请将最终资源复制到你自己的存储中。
完整参数说明请参阅 Kling Avatar 官方文档

授权

Authorization
string
header
必填

Bearer token authentication. Use your CometAPI key.

请求头

Content-Type
string

Optional content type header.

请求体

application/json
image
string
必填

Avatar image URL or base64 image string. Use an image that meets Kling pixel requirements; very small thumbnails are rejected.

prompt
string
必填

Prompt describing the desired avatar performance.

audio_id
string
必填

Audio id from a prior Kling audio task.

sound_file
string

Public audio URL when you provide your own audio.

task_id
string

Optional prior task id associated with the referenced audio asset.

mode
enum<string>

Generation mode. Use std or pro; omitted requests use std.

可用选项:
std,
pro

响应

200 - application/json

Task accepted.

code
integer
必填
message
string
必填
data
object
必填