Skip to main content
POST
Dùng endpoint này để khởi chạy một tác vụ video Grok từ văn bản, hình ảnh nguồn hoặc dữ liệu đầu vào tham chiếu. Endpoint trả về request_id ngay lập tức, vì vậy hãy coi đây là bước đầu tiên trong quy trình bất đồng bộ. Luôn gửi model: grok-imagine-video-1.5 một cách tường minh. modelprompt là bắt buộc đối với các dạng yêu cầu 1.5 được trình bày ở đây.

Chọn chế độ đầu vào

Đối với URI dữ liệu, hãy dùng data:image/png;base64,<BASE64_IMAGE_DATA>. Mỗi mục reference_images dùng cùng trường url. Một mục âm thanh tham chiếu sử dụng voice_id cài sẵn, chẳng hạn như eve. Trong Prompt, các thẻ như <IMAGE_0><AUDIO_0> có thể xác định tham chiếu tương ứng.

Bắt đầu với một yêu cầu nhỏ

  • Dùng model: grok-imagine-video-1.5
  • Đối với yêu cầu đầu tiên, hãy giữ duration ở mức 1resolution ở mức 480p
  • Giữ prompt rõ ràng để cảnh và chuyển động được xác định rõ
  • Thêm từng chế độ đầu vào một trước khi kết hợp hình ảnh tham chiếu và giọng nói

Thời lượng và độ phân giải

Video được tạo bao gồm một bản âm thanh. Hãy đặt duration, resolutionaspect_ratio một cách tường minh khi ứng dụng của bạn phụ thuộc vào một dạng đầu ra cụ thể.

Luồng tác vụ

1

Tạo tác vụ

Gửi model, Prompt và mọi dữ liệu đầu vào, sau đó lưu request_id được trả về.
2

Thăm dò trạng thái hoàn tất

Gọi Lấy kết quả video xAI cho đến khi status cấp cao nhất trở thành done, failed hoặc expired. Phản hồi ban đầu có thể chỉ chứa request_id được lặp lại trong khi siêu dữ liệu tác vụ đang được chuẩn bị.
3

Lưu trữ đầu ra

Sao chép video.url cuối cùng vào kho lưu trữ của riêng bạn nếu cần dùng sau khoảng thời gian phân phối tạm thời.

Ủy quyền

Authorization
string
header
bắt buộc

Use your CometAPI API key as the bearer value.

Nội dung

application/json
model
enum<string>
bắt buộc

The Grok video model ID. Send this field explicitly so the request uses Grok Imagine Video 1.5.

Tùy chọn có sẵn:
grok-imagine-video-1.5
Ví dụ:

"grok-imagine-video-1.5"

prompt
string
bắt buộc

A description of the scene, motion, and audio. Reference-to-video prompts can identify inputs with tags such as <IMAGE_0> and <AUDIO_0>.

Minimum string length: 1
Ví dụ:

"A paper boat glides across a quiet pond at sunrise."

duration
integer
mặc định:8

The output duration in seconds. Use an integer from 1 through 15.

Phạm vi bắt buộc: 1 <= x <= 15
aspect_ratio
enum<string>

The output aspect ratio. Text-to-video uses 16:9 when omitted. Image-to-video uses the source image's aspect ratio when omitted.

Tùy chọn có sẵn:
1:1,
16:9,
9:16,
4:3,
3:4,
3:2,
2:3
Ví dụ:

"16:9"

resolution
enum<string>
mặc định:480p

The output resolution. Reference-to-video requests support 480p and 720p; text-to-video and image-to-video also support 1080p.

Tùy chọn có sẵn:
480p,
720p,
1080p
image
object

The source image for image-to-video. Do not combine this field with reference_images or reference_audios.

reference_images
object[]

Visual references for reference-to-video. Each item accepts a public image URL or image data URI. Do not combine this field with image.

Required array length: 1 - 7 elements
reference_audios
object[]

Preset voice references for reference-to-video. Do not combine this field with image.

Required array length: 1 - 3 elements

Phản hồi

200 - application/json

Request accepted.

request_id
string
bắt buộc

The deferred request ID used to poll GET /grok/v1/videos/{request_id}.

Lần sửa đổi cuối 21 tháng 8, 2026