Créer une complétion de chat
Utilisez CometAPI POST /v1/chat/completions pour envoyer des conversations à plusieurs messages aux modèles de chat avec Streaming, sortie structurée et appels d’outils.
base_url="https://api.cometapi.com/v1" et votre clé API CometAPI.
Les exemples de base, d’images, de Streaming et de sortie structurée utilisent gpt-6-astra. L’exemple d’appel de fonction utilise gpt-5.6-sol, et l’exemple de probabilités logarithmiques utilise gpt-4.1.
Rôles des messages
Envoyer une entrée Multimodal
Utilisez un tableau de parties de contenu pour envoyer une image avec du texte :image_url.detail pour sélectionner le niveau de détail du traitement de l’image. Cet exemple utilise high.
Diffuser les réponses en continu
Pour recevoir une sortie incrémentielle, définissezstream sur true. La réponse est fournie sous forme de Server-Sent Events (SSE). Le texte arrive dans des objets chat.completion.chunk ; cet exemple abrégé inclut le chunk final d’utilisation :
Demander une sortie structurée
Utilisezresponse_format pour demander une sortie structurée :
Appeler des outils et des fonctions
Utilisezgpt-5.6-sol avec une définition de fonction :
finish_reason: "tool_calls" et un tableau message.tool_calls. Analysez arguments de la fonction, encodé en JSON, exécutez votre fonction, puis ajoutez le message de l’assistant et un message de résultat tool avec son tool_call_id correspondant.
Choisir les paramètres de requête
Paramètres spécifiques au modèle
Paramètres spécifiques au modèle
reasoning_effort et max_completion_tokens avec GPT-6 Astra. Les exemples Functions et Logprobs présentent les options de requête pour gpt-5.6-sol et gpt-4.1, respectivement.Pour les formats de requête spécifiques à Claude ou Gemini, consultez Anthropic Messages et Gemini Generate content.max_tokens et max_completion_tokens
max_tokens et max_completion_tokens
max_completion_tokens pour limiter les tokens générés dans les exemples GPT-6 Astra. Cela inclut le raisonnement et la sortie visible ; prévoyez donc de la place pour les deux. max_tokens est un paramètre obsolète.Rôles d’instruction
Rôles d’instruction
developer pour les instructions de l’application dans les exemples GPT-6 Astra. Conservez le contenu des utilisateurs finaux dans les messages user et préservez les réponses précédentes de l’assistant lorsque vous poursuivez une conversation.FAQ
Comment gérer les limites de débit ?
Lorsque vous rencontrez429 Too Many Requests, mettez en œuvre un backoff exponentiel :
Comment maintenir le contexte de la conversation ?
Incluez l’historique complet de la conversation dans le tableaumessages :
Que signifie finish_reason ?
Comment contrôler les coûts ?
- Utilisez
max_completion_tokenspour limiter la longueur de sortie. - Comparez les tarifs des modèles et choisissez un modèle adapté aux exigences de votre charge de travail.
- Gardez les prompts concis — évitez le contexte redondant.
- Surveillez l’utilisation des tokens dans le champ de réponse
usage.
Autorisations
Bearer token authentication. Use your CometAPI key.
Corps
Model ID to use for this request. See the Models page for current options.
"gpt-6-astra"
Conversation messages, including instructions, user input, assistant replies, and tool results.
If true, partial response tokens are delivered incrementally via server-sent events (SSE). The stream ends with a data: [DONE] message.
Sampling temperature. Omit this field for GPT-6 Astra.
0 <= x <= 2Nucleus sampling threshold. Omit this field for GPT-6 Astra. For sampling overrides, adjust either top_p or temperature.
0 <= x <= 1Number of completion choices to generate for each input message. Defaults to 1.
Stop string or list of up to four strings, for models that support stop sequences.
Legacy output-token limit. Use max_completion_tokens for the GPT-6 Astra examples.
Number between -2.0 and 2.0. Positive values penalize tokens based on whether they have already appeared, encouraging the model to explore new topics.
-2 <= x <= 2Number between -2.0 and 2.0. Positive values penalize tokens proportionally to how often they have appeared, reducing verbatim repetition.
-2 <= x <= 2A JSON object mapping token IDs to bias values from -100 to 100. The bias is added to the model's logits before sampling. Values between -1 and 1 subtly adjust likelihood; -100 or 100 effectively ban or force selection of a token.
A unique identifier for your end-user. Helps with abuse detection and monitoring.
Maximum generated tokens, including visible output and reasoning. Leave enough room for both, as in the image-input example.
Specifies the output format. Use {"type": "json_object"} for JSON mode, or {"type": "json_schema", "json_schema": {...}} for strict structured output.
Function definitions for a model that supports tool calling on Chat Completions. The function example uses GPT-5.6 Sol; use Responses for GPT-6 Astra tool calls.
Controls how the model selects tools. auto (default): model decides. none: no tools. required: must call a tool.
Return token log probabilities. Use gpt-4.1 as shown in the Logprobs example.
Number of most likely tokens to return at each position (0-20). Requires logprobs to be true.
0 <= x <= 20Reasoning effort supported by the selected model. The GPT-6 Astra examples use low; the GPT-5.6 Sol function example uses none. See the model reference for other supported levels.
Options for streaming. Only valid when stream is true.
Specifies the processing tier.
auto, default, flex, priority Réponse
Successful chat completion response.
Unique completion identifier.
"chatcmpl_example"
Object type. Non-streaming responses use chat.completion.
chat.completion "chat.completion"
Unix timestamp of creation.
1788763703
The model used (may include version suffix).
"gpt-6-astra"
Array of completion choices.
Token accounting for this request. Billing uses these counts.
Service tier that processed the request, when returned.
Model configuration fingerprint, when returned.