Skip to main content
POST
Usa questo endpoint per avviare un job video Grok da testo, un’immagine di origine o input di riferimento. Restituisce immediatamente un request_id, quindi consideralo il primo passaggio di un flusso di lavoro asincrono. Invia sempre esplicitamente model: grok-imagine-video-1.5. model e prompt sono obbligatori per le forme di richiesta 1.5 qui documentate.

Scegli una modalità di input

Per un URI di dati, usa data:image/png;base64,<BASE64_IMAGE_DATA>. Ogni elemento reference_images usa lo stesso campo url. Un elemento audio di riferimento usa una voce voice_id preimpostata, ad esempio eve. Nel prompt, tag come <IMAGE_0> e <AUDIO_0> possono identificare il riferimento corrispondente.

Inizia con una richiesta ridotta

  • Usa model: grok-imagine-video-1.5
  • Per una prima richiesta, mantieni duration a 1 e resolution a 480p
  • Mantieni prompt esplicito affinché la scena e il movimento siano chiari
  • Aggiungi una modalità di input alla volta prima di combinare immagini di riferimento e voci

Durata e risoluzione

I video generati includono una traccia audio. Imposta esplicitamente duration, resolution e aspect_ratio quando l’applicazione dipende da una particolare forma di output.

Flusso del task

1

Crea il job

Invia il modello, il prompt e gli eventuali input, quindi salva il valore request_id restituito.
2

Esegui il polling per il completamento

Chiama Ottieni i risultati video xAI finché il valore status di livello superiore non diventa done, failed o expired. Una risposta iniziale può contenere solo il valore request_id ripetuto mentre vengono preparati i metadati del task.
3

Rendi persistente l'output

Copia il valore video.url finale nel tuo spazio di archiviazione se ti serve dopo la finestra di consegna temporanea.

Autorizzazioni

Authorization
string
header
obbligatorio

Use your CometAPI API key as the bearer value.

Corpo

application/json
model
enum<string>
obbligatorio

The Grok video model ID. Send this field explicitly so the request uses Grok Imagine Video 1.5.

Opzioni disponibili:
grok-imagine-video-1.5
Esempio:

"grok-imagine-video-1.5"

prompt
string
obbligatorio

A description of the scene, motion, and audio. Reference-to-video prompts can identify inputs with tags such as <IMAGE_0> and <AUDIO_0>.

Minimum string length: 1
Esempio:

"A paper boat glides across a quiet pond at sunrise."

duration
integer
predefinito:8

The output duration in seconds. Use an integer from 1 through 15.

Intervallo richiesto: 1 <= x <= 15
aspect_ratio
enum<string>

The output aspect ratio. Text-to-video uses 16:9 when omitted. Image-to-video uses the source image's aspect ratio when omitted.

Opzioni disponibili:
1:1,
16:9,
9:16,
4:3,
3:4,
3:2,
2:3
Esempio:

"16:9"

resolution
enum<string>
predefinito:480p

The output resolution. Reference-to-video requests support 480p and 720p; text-to-video and image-to-video also support 1080p.

Opzioni disponibili:
480p,
720p,
1080p
image
object

The source image for image-to-video. Do not combine this field with reference_images or reference_audios.

reference_images
object[]

Visual references for reference-to-video. Each item accepts a public image URL or image data URI. Do not combine this field with image.

Required array length: 1 - 7 elements
reference_audios
object[]

Preset voice references for reference-to-video. Do not combine this field with image.

Required array length: 1 - 3 elements

Risposta

200 - application/json

Request accepted.

request_id
string
obbligatorio

The deferred request ID used to poll GET /grok/v1/videos/{request_id}.

Ultima modifica il 21 agosto 2026