Skip to main content
POST
Python
Gunakan endpoint ini untuk mentranskripsikan audio menjadi teks dalam bahasa sumber. Endpoint ini cocok untuk catatan rapat, pesan suara, pengindeksan media, caption, dan alur kerja dukungan yang memerlukan teks yang dapat dicari.

Permintaan pertama

Kirim file audio yang didukung dengan model dan file. Pertahankan file pertama tetap singkat saat Anda memvalidasi penanganan upload, autentikasi, dan parsing respons.

Baca respons

Respons default menyertakan text hasil transkripsi. Jika Anda meminta format respons lain, pastikan klien Anda mem-parsing format tersebut alih-alih mengasumsikan bentuk JSON default.

Langkah berikutnya

Otorisasi

Authorization
string
header
wajib

Bearer token authentication. Use your CometAPI key.

Body

multipart/form-data
file
file
wajib

The audio file to transcribe. Supported formats: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm.

model
string
default:whisper-1
wajib

The speech-to-text model to use. Choose a current speech model from the Models page.

language
string

The language of the input audio in ISO-639-1 format (e.g., en, zh, ja). Supplying the language improves accuracy and latency.

prompt
string

Optional text to guide the model's style or continue a previous audio segment. The prompt should match the audio language.

response_format
enum<string>
default:json

The output format for the transcription.

Opsi yang tersedia:
json,
text,
srt,
verbose_json,
vtt
temperature
number
default:0

Sampling temperature between 0 and 1. Higher values produce more random output; lower values are more focused. When set to 0, the model auto-adjusts temperature using log probability.

Rentang yang diperlukan: 0 <= x <= 1

Respons

200 - application/json

The transcription result.

text
string
wajib

The transcribed text.