Skip to main content
POST
cURL
Usa este endpoint para crear clips de avatar parlante a partir de una imagen de origen y una fuente de audio.

Antes de llamarlo

  • Proporciona una image de avatar como URL pública o cadena base64 sin procesar
  • Usa una imagen de avatar que cumpla con los requisitos de píxeles de Kling; las miniaturas muy pequeñas son rechazadas por la tarea de generación
  • Envía exactamente uno de audio_id o sound_file
  • Mantén simple la primera solicitud: una imagen de rostro, un clip de audio y un prompt opcional corto
  • Incluye task_id cuando el audio referenciado pertenezca a una tarea previa que deba vincularse
  • Comienza con mode: std a menos que necesites específicamente la ruta de mayor calidad

Reglas para la fuente de audio

  • audio_id es la vía más sencilla cuando ya generaste voz mediante la ruta TTS de Kling
  • sound_file funciona cuando ya tienes tu propio recurso MP3, WAV, M4A o AAC
  • La documentación indica que el audio del avatar debe durar entre 2 y 60 segundos

Flujo de la tarea

1

Crear la tarea de avatar

Envía la imagen y una fuente de audio, luego guarda el id de tarea devuelto.
2

Consultar la tarea

Continúa con Obtener una tarea de Kling hasta que la tarea alcance un estado terminal.
3

Almacenar el resultado final

Copia el recurso final en tu propio almacenamiento si necesitas conservarlo más allá de la URL de entrega del proveedor.
Para consultar la referencia completa de parámetros, consulta la documentación oficial de Kling Avatar.

Autorizaciones

Authorization
string
header
requerido

Bearer token authentication. Use your CometAPI key.

Encabezados

Content-Type
string

Optional content type header.

Cuerpo

application/json
image
string
requerido

Avatar image URL or base64 image string. Use an image that meets Kling pixel requirements; very small thumbnails are rejected.

prompt
string
requerido

Prompt describing the desired avatar performance.

audio_id
string
requerido

Audio id from a prior Kling audio task.

sound_file
string

Public audio URL when you provide your own audio.

task_id
string

Optional prior task id associated with the referenced audio asset.

mode
enum<string>

Generation mode. Use std or pro; omitted requests use std.

Opciones disponibles:
std,
pro

Respuesta

200 - application/json

Task accepted.

code
integer
requerido
message
string
requerido
data
object
requerido