Аудиомодели
Create Speech
Используйте CometAPI POST /v1/audio/speech, чтобы преобразовать текст в аудио с помощью выбранной модели text-to-speech и формата вывода.
POST
Python
Используйте этот endpoint, чтобы преобразовать текст в аудиофайл через OpenAI-совместимый audio API. Он подходит для озвучивания, коротких голосовых подсказок, функций чтения вслух и других сценариев, где в вашем приложении уже есть текст и требуется речевой вывод.
Первый запрос
Начните с трех полей:model, input и voice. Сделайте первый запрос коротким, чтобы можно было проверить аутентификацию, формат аудио и обработку файла, прежде чем настраивать скорость или формат вывода.
Как читать ответ
Ответ представляет собой бинарное аудио, а не JSON. В примерах SDK записывайте ответ в файл, напримерoutput.mp3. В прямых HTTP-клиентах сохраняйте тело ответа и задавайте расширение файла в соответствии с запрошенным response_format.
Дальнейшие шаги
- Используйте Create Transcription, если вам нужно преобразовать речь обратно в текст.
- Используйте Create Translation, если вам нужен английский текст из неанглоязычного аудио.
Авторизации
Bearer token authentication. Use your CometAPI key.
Тело
application/json
The TTS model to use. Choose a current speech model from the Models page.
The text to generate audio for. Maximum length is 4096 characters.
Maximum string length:
4096The voice to use for speech synthesis.
Доступные опции:
alloy, ash, ballad, coral, echo, fable, onyx, nova, sage, shimmer The audio output format.
Доступные опции:
mp3, opus, aac, flac, wav, pcm The speed of the generated audio. Select a value between 0.25 and 4.0.
Требуемый диапазон:
0.25 <= x <= 4Ответ
200 - audio/mpeg
The audio file content.
The response is of type file.