Modelos de audio
Create Speech
Usa CometAPI POST /v1/audio/speech para convertir texto en audio con un modelo de texto a voz y un formato de salida seleccionados.
POST
Python
Usa este endpoint para convertir texto en un archivo de audio mediante la API de audio compatible con OpenAI. Es adecuado para narración, indicaciones de voz cortas, funciones de lectura en voz alta y otros flujos de trabajo en los que tu aplicación ya tiene texto y necesita salida de voz.
Primera solicitud
Comienza con tres campos:model, input y voice. Mantén la primera solicitud breve para que puedas verificar la autenticación, el formato de audio y el manejo de archivos antes de ajustar la velocidad o el formato de salida.
Lee la respuesta
La respuesta es audio binario, no JSON. En los ejemplos de SDK, escribe la respuesta en un archivo comooutput.mp3. En clientes HTTP directos, guarda el cuerpo de la respuesta y establece la extensión del archivo para que coincida con el response_format solicitado.
Siguientes pasos
- Usa Create Transcription cuando necesites convertir voz de nuevo en texto.
- Usa Create Translation cuando necesites texto en inglés a partir de audio que no esté en inglés.
Autorizaciones
Bearer token authentication. Use your CometAPI key.
Cuerpo
application/json
The TTS model to use. Choose a current speech model from the Models page.
The text to generate audio for. Maximum length is 4096 characters.
Maximum string length:
4096The voice to use for speech synthesis.
Opciones disponibles:
alloy, ash, ballad, coral, echo, fable, onyx, nova, sage, shimmer The audio output format.
Opciones disponibles:
mp3, opus, aac, flac, wav, pcm The speed of the generated audio. Select a value between 0.25 and 4.0.
Rango requerido:
0.25 <= x <= 4Respuesta
200 - audio/mpeg
The audio file content.
The response is of type file.