Аудіомоделі
Create speech
Використовуйте CometAPI POST /v1/audio/speech, щоб перетворювати текст на аудіо за допомогою вибраної text-to-speech моделі та формату виводу.
POST
Python
Використовуйте цей endpoint, щоб перетворювати текст на аудіофайл через сумісний з OpenAI audio API. Він підходить для озвучення, коротких голосових підказок, функцій читання вголос та інших сценаріїв, де ваш застосунок уже має текст і потребує мовного виводу.
Перший запит
Почніть із трьох полів:model, input і voice. Нехай перший запит буде коротким, щоб ви могли перевірити автентифікацію, аудіоформат і обробку файлів, перш ніж налаштовувати швидкість або формат виводу.
Прочитайте відповідь
Відповідь — це двійкове аудіо, а не JSON. У прикладах SDK записуйте відповідь у файл, наприкладoutput.mp3. У прямих HTTP-клієнтах збережіть тіло відповіді та встановіть розширення файлу відповідно до запитаного response_format.
Наступні кроки
- Використовуйте Create Transcription, коли потрібно перетворити мовлення назад на текст.
- Використовуйте Create Translation, коли потрібен англійський текст із неангломовного аудіо.
Авторизації
Bearer token authentication. Use your CometAPI key.
Тіло
application/json
The TTS model to use. Choose a current speech model from the Models page.
The text to generate audio for. Maximum length is 4096 characters.
Maximum string length:
4096The voice to use for speech synthesis.
Доступні опції:
alloy, ash, ballad, coral, echo, fable, onyx, nova, sage, shimmer The audio output format.
Доступні опції:
mp3, opus, aac, flac, wav, pcm The speed of the generated audio. Select a value between 0.25 and 4.0.
Необхідний діапазон:
0.25 <= x <= 4Відповідь
200 - audio/mpeg
The audio file content.
The response is of type file.