Modele audio
Create Speech
Użyj CometAPI POST /v1/audio/speech, aby przekształcić tekst w audio przy użyciu wybranego modelu text-to-speech i formatu wyjściowego.
POST
Python
Użyj tego endpointu, aby zamienić tekst na plik audio za pośrednictwem zgodnego z OpenAI audio API. Sprawdza się to w narracji, krótkich promptach głosowych, funkcjach odczytu na głos oraz innych workflow, w których aplikacja ma już tekst i potrzebuje wyjścia mowy.
Pierwsze żądanie
Zacznij od trzech pól:model, input i voice. Pierwsze żądanie powinno być krótkie, aby można było zweryfikować uwierzytelnianie, format audio i obsługę plików, zanim dostroisz szybkość lub format wyjściowy.
Odczyt odpowiedzi
Odpowiedź ma postać binarnego audio, a nie JSON. W przykładach SDK zapisz odpowiedź do pliku, takiego jakoutput.mp3. W bezpośrednich klientach HTTP zapisz body odpowiedzi i ustaw rozszerzenie pliku tak, aby odpowiadało żądanemu response_format.
Kolejne kroki
- Użyj Create Transcription, gdy chcesz przekształcić mowę z powrotem w tekst.
- Użyj Create Translation, gdy potrzebujesz angielskiego tekstu z nieangielskiego audio.
Autoryzacje
Bearer token authentication. Use your CometAPI key.
Treść
application/json
The TTS model to use. Choose a current speech model from the Models page.
The text to generate audio for. Maximum length is 4096 characters.
Maximum string length:
4096The voice to use for speech synthesis.
Dostępne opcje:
alloy, ash, ballad, coral, echo, fable, onyx, nova, sage, shimmer The audio output format.
Dostępne opcje:
mp3, opus, aac, flac, wav, pcm The speed of the generated audio. Select a value between 0.25 and 4.0.
Wymagany zakres:
0.25 <= x <= 4Odpowiedź
200 - audio/mpeg
The audio file content.
The response is of type file.