Skip to main content
POST
Python
Użyj tego endpointu, aby zamienić tekst na plik audio za pośrednictwem zgodnego z OpenAI audio API. Sprawdza się to w narracji, krótkich promptach głosowych, funkcjach odczytu na głos oraz innych workflow, w których aplikacja ma już tekst i potrzebuje wyjścia mowy.

Pierwsze żądanie

Zacznij od trzech pól: model, input i voice. Pierwsze żądanie powinno być krótkie, aby można było zweryfikować uwierzytelnianie, format audio i obsługę plików, zanim dostroisz szybkość lub format wyjściowy.

Odczyt odpowiedzi

Odpowiedź ma postać binarnego audio, a nie JSON. W przykładach SDK zapisz odpowiedź do pliku, takiego jak output.mp3. W bezpośrednich klientach HTTP zapisz body odpowiedzi i ustaw rozszerzenie pliku tak, aby odpowiadało żądanemu response_format.

Kolejne kroki

Autoryzacje

Authorization
string
header
wymagane

Bearer token authentication. Use your CometAPI key.

Treść

application/json
model
string
domyślnie:tts-1
wymagane

The TTS model to use. Choose a current speech model from the Models page.

input
string
wymagane

The text to generate audio for. Maximum length is 4096 characters.

Maximum string length: 4096
voice
enum<string>
domyślnie:alloy
wymagane

The voice to use for speech synthesis.

Dostępne opcje:
alloy,
ash,
ballad,
coral,
echo,
fable,
onyx,
nova,
sage,
shimmer
response_format
enum<string>
domyślnie:mp3

The audio output format.

Dostępne opcje:
mp3,
opus,
aac,
flac,
wav,
pcm
speed
number
domyślnie:1

The speed of the generated audio. Select a value between 0.25 and 4.0.

Wymagany zakres: 0.25 <= x <= 4

Odpowiedź

200 - audio/mpeg

The audio file content.

The response is of type file.