Créer un message
Appelez Claude via le point de terminaison Messages de CometAPI avec des entrées texte et image, la réflexion adaptative, la mise en cache des Prompts, le Streaming et des outils.
POST /v1/messages pour envoyer des requêtes à Claude au format Anthropic Messages.
Les exemples configurent le SDK Anthropic officiel avec l’URL de base CometAPI et
lisent votre clé API depuis $COMETAPI_KEY.
x-api-key ou Authorization: Bearer. Le SDK Anthropic utilise
x-api-key. Les exemples HTTP incluent anthropic-version: 2023-06-01.Démarrage rapide
Les exemples suivants demandent trois requêtes de recherche. Définissez$COMETAPI_KEY avant de
les exécuter. Installez anthropic pour Python ou @anthropic-ai/sdk pour JavaScript :
content. Lisez les blocs dont type est text ;
des blocs de réflexion et d’outils peuvent apparaître avant le texte.
Contrôler le raisonnement adaptatif
Définissezthinking.type sur adaptive et choisissez une valeur pour output_config.effort.
L’exemple suivant utilise xhigh et lit le message terminé à partir d’un flux :
max_tokens. Prévoyez également de la place pour la réponse finale ainsi que pour le raisonnement.
réponse sans bloc de raisonnement visible. Une réponse peut contenir du texte sans bloc de raisonnement visible.
Conservez tous les blocs de raisonnement renvoyés sans les modifier dans l’historique de la conversation
.
Pour la configuration de raisonnement propre au modèle, consultez
Réflexion.
Les exemples omettent temperature, top_p et top_k ; consultez la documentation des paramètres du modèle sélectionné
avant d’ajouter des contrôles d’échantillonnage.
Mettre les prompts en cache
Placez un point d’arrêt de cache sur le contenu de référence que vous réutilisez entre les requêtes. Enregistrez votre contenu de référence dans un fichierreference.txt encodé en UTF-8 avant d’exécuter cet
exemple. Utilisez un préfixe qui respecte la
longueur minimale pouvant être mise en cache:
cache_creation_input_tokenscompte les tokens écrits dans le cache.cache_read_input_tokenscompte les tokens lus depuis le cache.input_tokenscompte les données d’entrée traitées en dehors de ces compteurs de cache.
cache_read_input_tokens indique combien de tokens d’entrée
ont été lus depuis le cache. L’exemple OpenAPI Prompt Cache
contient une référence fictive complète que vous pouvez enregistrer sous
reference.txt afin d’essayer l’exemple.
Diffuser les réponses en Streaming
Définissezstream: true pour les événements envoyés par le serveur. Le SDK expose les fragments de texte à mesure qu’ils
arrivent :
message_start, des événements de blocs de contenu, message_delta,
et message_stop. Les blocs de contenu peuvent contenir du texte, de la réflexion ou de l’activité d’outil.
Pour un bloc de texte, content_block_delta contient un text_delta. Lisez l’utilisation finale
et le motif d’arrêt dans message_delta.
Contrôler l’effort
Définissezoutput_config.effort afin d’orienter la quantité de raisonnement. Cet exemple utilise
low pour une courte explication et attend la fin du message diffusé en Streaming :
max_tokens afin de limiter la longueur de sortie.
Utiliser les outils serveur
Les outils serveur s’exécutent pendant la requête API et renvoient des blocs de résultats en même temps que la réponse de Claude.- Récupération Web
- Recherche Web
web_fetch_tool_result bloc :server_tool_use à un web_fetch_tool_result
contenant le document récupéré ou une erreur d’outil.Renvoyer les résultats des outils client
Pour un outil client, Claude renvoie un bloctool_use. Exécutez la fonction de votre application
et envoyez son résultat dans un bloc tool_result avec le tool_use_id correspondant.
Conservez l’intégralité du contenu de l’assistant entre les deux requêtes.
Cet exemple fournit un résultat de commande fictif et demande à Claude d’utiliser ce résultat :
Exemple de réponse
Une requête non-Streaming renvoie un objet message. L’exemple suivant montre ses champs text et usage avec un identifiant de message illustratif :end_turn termine la réponse,
max_tokens signifie que la sortie a atteint la limite, et tool_use demande le résultat d’un outil client
résultat. Pour un tour d’outil serveur qui renvoie pause_turn, poursuivez avec le
contenu de l’assistant renvoyé sans le modifier.Autorisations
Your CometAPI key passed via the x-api-key header. Authorization: Bearer $COMETAPI_KEY is also supported.
En-têtes
The Anthropic API version to use. Defaults to 2023-06-01.
"2023-06-01"
Comma-separated feature identifiers required by a specific beta API feature. Omit this header for the examples on this page.
Corps
The Claude model to use. See the Models page for available Claude model IDs.
"claude-opus-5"
Conversation history. Use user and assistant messages with text strings or content-block arrays. Return complete assistant content blocks when continuing a tool call.
The maximum number of tokens to generate. The model may stop before reaching this limit. When using thinking, the thinking tokens count towards this limit.
x >= 11024
System prompt providing context and instructions to Claude. Can be a plain string or an array of content blocks (useful for prompt caching).
Sampling temperature. The examples omit sampling overrides.
0 <= x <= 1Nucleus sampling threshold. The examples omit sampling overrides.
0 <= x <= 1Limits sampling to the k most likely tokens. The examples omit sampling overrides.
x >= 0If true, stream the response incrementally using Server-Sent Events (SSE). Events include message_start, content_block_start, content_block_delta, content_block_stop, message_delta, and message_stop.
Custom strings that cause the model to stop generating when encountered. The stop sequence is not included in the response.
Thinking configuration. The adaptive example uses type adaptive and sets output_config.effort separately.
Client tools define a name and input_schema. Server tools use a versioned type and name, such as the web_fetch and web_search examples on this page.
Controls how the model uses tools.
Request metadata for tracking and analytics.
Configuration for reasoning effort and structured output.
The service tier to use. auto tries priority capacity first, standard_only uses only standard capacity.
auto, standard_only Réponse
Successful response. When stream is true, the response is a stream of SSE events.
Message identifier returned by the API.
Always message.
message Always assistant.
assistant The response content blocks. May include text, thinking, tool_use, and other block types.
Model ID reported by the response.
Why the model stopped generating. refusal can be returned as a successful HTTP response when the model declines a request.
end_turn, max_tokens, stop_sequence, tool_use, pause_turn, refusal The stop sequence that caused the model to stop, if applicable.
Token usage statistics.