Skip to main content
POST
Usa este endpoint para iniciar un trabajo de video de Grok a partir de texto, una imagen de origen o entradas de referencia. Devuelve request_id de inmediato, así que trátalo como el primer paso de un flujo de trabajo asíncrono. Envía siempre model: grok-imagine-video-1.5 explícitamente. model y prompt son obligatorios para las estructuras de solicitud 1.5 documentadas aquí.

Elige un modo de entrada

Para un URI de datos, usa data:image/png;base64,<BASE64_IMAGE_DATA>. Cada elemento reference_images usa el mismo campo url. Un elemento de audio de referencia usa un voice_id predefinido, como eve. En el Prompt, etiquetas como <IMAGE_0> y <AUDIO_0> pueden identificar la referencia correspondiente.

Empieza con una solicitud pequeña

  • Usa model: grok-imagine-video-1.5
  • Para una primera solicitud, mantén duration en 1 y resolution en 480p
  • Mantén prompt explícito para que la escena y el movimiento sean claros
  • Agrega un modo de entrada a la vez antes de combinar imágenes de referencia y voces

Duración y resolución

Los videos generados incluyen una pista de audio. Establece duration, resolution y aspect_ratio explícitamente cuando tu aplicación dependa de una estructura de salida determinada.

Flujo de tareas

1

Crea el trabajo

Envía el modelo, el Prompt y cualquier entrada, y luego guarda el request_id devuelto.
2

Consulta hasta que se complete

Llama a Obtener resultados de video de xAI hasta que el status de nivel superior pase a ser done, failed o expired. Una respuesta inicial puede contener solo el request_id repetido mientras se preparan los metadatos de la tarea.
3

Conserva la salida

Copia el video.url final en tu propio almacenamiento si lo necesitas después de la ventana de entrega temporal.

Autorizaciones

Authorization
string
header
requerido

Use your CometAPI API key as the bearer value.

Cuerpo

application/json
model
enum<string>
requerido

The Grok video model ID. Send this field explicitly so the request uses Grok Imagine Video 1.5.

Opciones disponibles:
grok-imagine-video-1.5
Ejemplo:

"grok-imagine-video-1.5"

prompt
string
requerido

A description of the scene, motion, and audio. Reference-to-video prompts can identify inputs with tags such as <IMAGE_0> and <AUDIO_0>.

Minimum string length: 1
Ejemplo:

"A paper boat glides across a quiet pond at sunrise."

duration
integer
predeterminado:8

The output duration in seconds. Use an integer from 1 through 15.

Rango requerido: 1 <= x <= 15
aspect_ratio
enum<string>

The output aspect ratio. Text-to-video uses 16:9 when omitted. Image-to-video uses the source image's aspect ratio when omitted.

Opciones disponibles:
1:1,
16:9,
9:16,
4:3,
3:4,
3:2,
2:3
Ejemplo:

"16:9"

resolution
enum<string>
predeterminado:480p

The output resolution. Reference-to-video requests support 480p and 720p; text-to-video and image-to-video also support 1080p.

Opciones disponibles:
480p,
720p,
1080p
image
object

The source image for image-to-video. Do not combine this field with reference_images or reference_audios.

reference_images
object[]

Visual references for reference-to-video. Each item accepts a public image URL or image data URI. Do not combine this field with image.

Required array length: 1 - 7 elements
reference_audios
object[]

Preset voice references for reference-to-video. Do not combine this field with image.

Required array length: 1 - 3 elements

Respuesta

200 - application/json

Request accepted.

request_id
string
requerido

The deferred request ID used to poll GET /grok/v1/videos/{request_id}.

Última modificación el 21 de agosto de 2026