Skip to main content
POST
Python
Verwenden Sie diesen Endpunkt, um Audio in der Ausgangssprache in Text zu transkribieren. Er eignet sich für Besprechungsnotizen, Sprachnachrichten, Medienindizierung, Untertitel und Support-Workflows, die durchsuchbaren Text benötigen.

Erste Anfrage

Senden Sie eine unterstützte Audiodatei mit model und file. Halten Sie die erste Datei kurz, während Sie Upload-Verarbeitung, Authentifizierung und Antwort-Parsing validieren.

Antwort lesen

Die Standardantwort enthält den transkribierten text. Wenn Sie ein anderes Antwortformat anfordern, stellen Sie sicher, dass Ihr Client dieses Format parst, anstatt die Standard-JSON-Struktur anzunehmen.

Nächste Schritte

  • Verwenden Sie Create Speech, wenn Sie eine Text-zu-Sprache-Ausgabe benötigen.
  • Verwenden Sie Create Translation, wenn die Zielausgabe Englisch sein soll.

Autorisierungen

Authorization
string
header
erforderlich

Bearer token authentication. Use your CometAPI key.

Body

multipart/form-data
file
file
erforderlich

The audio file to transcribe. Supported formats: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm.

model
string
Standard:whisper-1
erforderlich

The speech-to-text model to use. Choose a current speech model from the Models page.

language
string

The language of the input audio in ISO-639-1 format (e.g., en, zh, ja). Supplying the language improves accuracy and latency.

prompt
string

Optional text to guide the model's style or continue a previous audio segment. The prompt should match the audio language.

response_format
enum<string>
Standard:json

The output format for the transcription.

Verfügbare Optionen:
json,
text,
srt,
verbose_json,
vtt
temperature
number
Standard:0

Sampling temperature between 0 and 1. Higher values produce more random output; lower values are more focused. When set to 0, the model auto-adjusts temperature using log probability.

Erforderlicher Bereich: 0 <= x <= 1

Antwort

200 - application/json

The transcription result.

text
string
erforderlich

The transcribed text.