Modelli audio
Create speech
Usa CometAPI POST /v1/audio/speech per convertire il testo in audio con un modello text-to-speech e un formato di output selezionati.
POST
Python
Usa questo endpoint per trasformare il testo in un file audio tramite l’API audio compatibile con OpenAI. È adatto per narrazione, brevi prompt vocali, funzionalità di lettura ad alta voce e altri flussi di lavoro in cui la tua app ha già del testo e necessita di un output vocale.
Prima richiesta
Inizia con tre campi:model, input e voice. Mantieni la prima richiesta breve così puoi verificare autenticazione, formato audio e gestione dei file prima di regolare la velocità o il formato di output.
Leggere la risposta
La risposta è audio binario, non JSON. Negli esempi SDK, scrivi la risposta in un file comeoutput.mp3. Nei client HTTP diretti, salva il corpo della risposta e imposta l’estensione del file in modo che corrisponda al response_format richiesto.
Passaggi successivi
- Usa Create Transcription quando devi riconvertire il parlato in testo.
- Usa Create Translation quando ti serve testo in inglese a partire da audio non in inglese.
Autorizzazioni
Bearer token authentication. Use your CometAPI key.
Corpo
application/json
The TTS model to use. Choose a current speech model from the Models page.
The text to generate audio for. Maximum length is 4096 characters.
Maximum string length:
4096The voice to use for speech synthesis.
Opzioni disponibili:
alloy, ash, ballad, coral, echo, fable, onyx, nova, sage, shimmer The audio output format.
Opzioni disponibili:
mp3, opus, aac, flac, wav, pcm The speed of the generated audio. Select a value between 0.25 and 4.0.
Intervallo richiesto:
0.25 <= x <= 4Risposta
200 - audio/mpeg
The audio file content.
The response is of type file.