Skip to main content
POST
Bruk dette endepunktet for å starte en Grok-videooppgave fra tekst, et kildebilde eller referanseinndata. Det returnerer umiddelbart en request_id, så behandle det som det første trinnet i en asynkron arbeidsflyt. Send alltid model: grok-imagine-video-1.5 eksplisitt. model og prompt kreves for 1.5-forespørselsformene som dokumenteres her.

Velg en inndatamodus

For en data URI bruker du data:image/png;base64,<BASE64_IMAGE_DATA>. Hvert reference_images-element bruker det samme url-feltet. Et referanselydelement bruker en forhåndsinnstilt voice_id, for eksempel eve. I Prompt kan tagger som <IMAGE_0> og <AUDIO_0> identifisere den tilsvarende referansen.

Begynn med en liten forespørsel

  • Bruk model: grok-imagine-video-1.5
  • For den første forespørselen bør du holde duration1 og resolution480p
  • Hold prompt eksplisitt slik at scenen og bevegelsen er tydelige
  • Legg til én inndatamodus om gangen før du kombinerer referansebilder og stemmer

Varighet og oppløsning

Genererte videoer inkluderer et lydspor. Angi duration, resolution og aspect_ratio eksplisitt når applikasjonen din avhenger av et bestemt utdataformat.

Oppgaveflyt

1

Opprett oppgaven

Send modellen, Prompt og eventuelle inndata, og lagre den returnerte request_id.
2

Sjekk om den er fullført

Kall Hent xAI-videoresultater til status på toppnivå blir done, failed eller expired. Et første svar kan bare inneholde den gjentatte request_id mens oppgavemetadata klargjøres.
3

Lagre utdataene

Kopier den endelige video.url til din egen lagring hvis du trenger den etter det midlertidige leveringsvinduet.

Autorisasjoner

Authorization
string
header
påkrevd

Use your CometAPI API key as the bearer value.

Kropp

application/json
model
enum<string>
påkrevd

The Grok video model ID. Send this field explicitly so the request uses Grok Imagine Video 1.5.

Tilgjengelige alternativer:
grok-imagine-video-1.5
Eksempel:

"grok-imagine-video-1.5"

prompt
string
påkrevd

A description of the scene, motion, and audio. Reference-to-video prompts can identify inputs with tags such as <IMAGE_0> and <AUDIO_0>.

Minimum string length: 1
Eksempel:

"A paper boat glides across a quiet pond at sunrise."

duration
integer
standard:8

The output duration in seconds. Use an integer from 1 through 15.

Nødvendig område: 1 <= x <= 15
aspect_ratio
enum<string>

The output aspect ratio. Text-to-video uses 16:9 when omitted. Image-to-video uses the source image's aspect ratio when omitted.

Tilgjengelige alternativer:
1:1,
16:9,
9:16,
4:3,
3:4,
3:2,
2:3
Eksempel:

"16:9"

resolution
enum<string>
standard:480p

The output resolution. Reference-to-video requests support 480p and 720p; text-to-video and image-to-video also support 1080p.

Tilgjengelige alternativer:
480p,
720p,
1080p
image
object

The source image for image-to-video. Do not combine this field with reference_images or reference_audios.

reference_images
object[]

Visual references for reference-to-video. Each item accepts a public image URL or image data URI. Do not combine this field with image.

Required array length: 1 - 7 elements
reference_audios
object[]

Preset voice references for reference-to-video. Do not combine this field with image.

Required array length: 1 - 3 elements

Svar

200 - application/json

Request accepted.

request_id
string
påkrevd

The deferred request ID used to poll GET /grok/v1/videos/{request_id}.

Sist endret 21. august 2026