Skip to main content
POST
Python
Usa questo endpoint per trascrivere l’audio in testo nella lingua di origine. È adatto a note di riunioni, messaggi vocali, indicizzazione dei media, sottotitoli e flussi di supporto che richiedono testo ricercabile.

Prima richiesta

Invia un file audio supportato con model e file. Mantieni il primo file breve mentre verifichi la gestione dell’upload, l’autenticazione e il parsing della risposta.

Leggere la risposta

La risposta predefinita include il text trascritto. Se richiedi un altro formato di risposta, assicurati che il client analizzi quel formato invece di dare per scontata la struttura JSON predefinita.

Passaggi successivi

Autorizzazioni

Authorization
string
header
obbligatorio

Bearer token authentication. Use your CometAPI key.

Corpo

multipart/form-data
file
file
obbligatorio

The audio file to transcribe. Supported formats: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm.

model
string
predefinito:whisper-1
obbligatorio

The speech-to-text model to use. Choose a current speech model from the Models page.

language
string

The language of the input audio in ISO-639-1 format (e.g., en, zh, ja). Supplying the language improves accuracy and latency.

prompt
string

Optional text to guide the model's style or continue a previous audio segment. The prompt should match the audio language.

response_format
enum<string>
predefinito:json

The output format for the transcription.

Opzioni disponibili:
json,
text,
srt,
verbose_json,
vtt
temperature
number
predefinito:0

Sampling temperature between 0 and 1. Higher values produce more random output; lower values are more focused. When set to 0, the model auto-adjusts temperature using log probability.

Intervallo richiesto: 0 <= x <= 1

Risposta

200 - application/json

The transcription result.

text
string
obbligatorio

The transcribed text.