Skip to main content
POST
Python
このエンドポイントを使用すると、OpenAI 互換の音声 API を通じてテキストを音声ファイルに変換できます。ナレーション、短い音声プロンプト、読み上げ機能、その他、アプリにすでにテキストがあり音声出力が必要なワークフローに適しています。

First request

まずは modelinputvoice の 3 つのフィールドから始めます。speed や出力形式を調整する前に、最初のリクエストは短くして、認証、音声形式、ファイル処理を確認できるようにしてください。

Read the response

レスポンスは JSON ではなくバイナリ音声です。SDK の例では、レスポンスを output.mp3 のようなファイルに書き込みます。直接 HTTP クライアントを使う場合は、レスポンスボディを保存し、要求した response_format に合わせてファイル拡張子を設定してください。

Next steps

  • 音声を再びテキストに変換する必要がある場合は、文字起こし を使用します。
  • 英語以外の音声から英語テキストが必要な場合は、翻訳 を使用します。

承認

Authorization
string
header
必須

Bearer token authentication. Use your CometAPI key.

ボディ

application/json
model
string
デフォルト:tts-1
必須

The TTS model to use. Choose a current speech model from the Models page.

input
string
必須

The text to generate audio for. Maximum length is 4096 characters.

Maximum string length: 4096
voice
enum<string>
デフォルト:alloy
必須

The voice to use for speech synthesis.

利用可能なオプション:
alloy,
ash,
ballad,
coral,
echo,
fable,
onyx,
nova,
sage,
shimmer
response_format
enum<string>
デフォルト:mp3

The audio output format.

利用可能なオプション:
mp3,
opus,
aac,
flac,
wav,
pcm
speed
number
デフォルト:1

The speed of the generated audio. Select a value between 0.25 and 4.0.

必須範囲: 0.25 <= x <= 4

レスポンス

200 - audio/mpeg

The audio file content.

The response is of type file.