Skip to main content
POST
Python
Використовуйте цей endpoint, щоб транскрибувати аудіо в текст мовою оригіналу. Він підходить для нотаток зустрічей, голосових повідомлень, індексації медіа, субтитрів і процесів підтримки, яким потрібен текст із можливістю пошуку.

Перший запит

Надішліть підтримуваний аудіофайл із model і file. Під час перевірки обробки завантаження, автентифікації та парсингу відповіді перший файл має бути коротким.

Як читати відповідь

Відповідь за замовчуванням містить транскрибований text. Якщо ви запитуєте інший формат відповіді, переконайтеся, що ваш клієнт обробляє саме цей формат, а не покладається на стандартну JSON-структуру.

Наступні кроки

  • Використовуйте Create Speech, коли вам потрібен вихід text-to-speech.
  • Використовуйте Create Translation, коли цільовим результатом має бути англійська мова.

Авторизації

Authorization
string
header
обов'язково

Bearer token authentication. Use your CometAPI key.

Тіло

multipart/form-data
file
file
обов'язково

The audio file to transcribe. Supported formats: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm.

model
string
за замовчуванням:whisper-1
обов'язково

The speech-to-text model to use. Choose a current speech model from the Models page.

language
string

The language of the input audio in ISO-639-1 format (e.g., en, zh, ja). Supplying the language improves accuracy and latency.

prompt
string

Optional text to guide the model's style or continue a previous audio segment. The prompt should match the audio language.

response_format
enum<string>
за замовчуванням:json

The output format for the transcription.

Доступні опції:
json,
text,
srt,
verbose_json,
vtt
temperature
number
за замовчуванням:0

Sampling temperature between 0 and 1. Higher values produce more random output; lower values are more focused. When set to 0, the model auto-adjusts temperature using log probability.

Необхідний діапазон: 0 <= x <= 1

Відповідь

200 - application/json

The transcription result.

text
string
обов'язково

The transcribed text.