Audiomodelle
Create Speech
Verwenden Sie CometAPI POST /v1/audio/speech, um Text mit einem ausgewählten Text-zu-Sprache-Modell und Ausgabeformat in Audio umzuwandeln.
POST
Python
Verwenden Sie diesen Endpoint, um Text über die OpenAI-kompatible Audio-API in eine Audiodatei umzuwandeln. Er eignet sich für Erzählungen, kurze Sprach-Prompts, Vorlesefunktionen und andere Workflows, bei denen Ihre App bereits Text hat und eine Sprachausgabe benötigt.
Erste Anfrage
Beginnen Sie mit drei Feldern:model, input und voice. Halten Sie die erste Anfrage kurz, damit Sie Authentifizierung, Audioformat und Dateiverarbeitung überprüfen können, bevor Sie Geschwindigkeit oder Ausgabeformat anpassen.
Antwort lesen
Die Antwort ist binäres Audio, kein JSON. Schreiben Sie in SDK-Beispielen die Antwort in eine Datei wieoutput.mp3. Speichern Sie in direkten HTTP-Clients den Response-Body und legen Sie die Dateiendung so fest, dass sie zum angeforderten response_format passt.
Nächste Schritte
- Verwenden Sie Create Transcription, wenn Sie Sprache wieder in Text umwandeln müssen.
- Verwenden Sie Create Translation, wenn Sie englischen Text aus nicht-englischem Audio benötigen.
Autorisierungen
Bearer token authentication. Use your CometAPI key.
Body
application/json
The TTS model to use. Choose a current speech model from the Models page.
The text to generate audio for. Maximum length is 4096 characters.
Maximum string length:
4096The voice to use for speech synthesis.
Verfügbare Optionen:
alloy, ash, ballad, coral, echo, fable, onyx, nova, sage, shimmer The audio output format.
Verfügbare Optionen:
mp3, opus, aac, flac, wav, pcm The speed of the generated audio. Select a value between 0.25 and 4.0.
Erforderlicher Bereich:
0.25 <= x <= 4Antwort
200 - audio/mpeg
The audio file content.
The response is of type file.