Criar uma mensagem
Chame o Claude por meio do endpoint Messages da CometAPI com entrada de texto e imagem, pensamento adaptativo, cache de Prompt, Streaming e ferramentas.
POST /v1/messages para enviar solicitações ao Claude no formato Anthropic Messages.
Os exemplos configuram o SDK oficial da Anthropic com a URL base da CometAPI e
leem sua chave de API de $COMETAPI_KEY.
x-api-key ou Authorization: Bearer. O SDK da Anthropic usa
x-api-key. Os exemplos HTTP incluem anthropic-version: 2023-06-01.Início rápido
Os exemplos a seguir solicitam três consultas de pesquisa. Defina$COMETAPI_KEY antes de
executá-los. Instale anthropic para Python ou @anthropic-ai/sdk para JavaScript:
content. Leia os blocos cujo type é text;
blocos de pensamento e de ferramentas podem aparecer antes do texto.
Controle o raciocínio adaptativo
Definathinking.type como adaptive e escolha um valor de output_config.effort.
O exemplo a seguir usa xhigh e lê a mensagem concluída de um fluxo:
max_tokens. Reserve espaço para a resposta final
e também para o raciocínio. Uma resposta pode conter texto sem um bloco de raciocínio visível.
Preserve os blocos de raciocínio retornados sem alterações no histórico da conversa
.
Para a configuração de raciocínio específica do modelo, consulte
Raciocínio.
Os exemplos omitem temperature, top_p e top_k; consulte a documentação de parâmetros do modelo selecionado
antes de adicionar controles de amostragem.
Armazene prompts em cache
Coloque um ponto de interrupção de cache no material de referência que você reutiliza entre solicitações. Salve seu material de referência em um arquivoreference.txt em UTF-8 antes de executar este
exemplo. Use um prefixo que atenda ao requisito do modelo selecionado de
comprimento mínimo armazenável em cache:
cache_creation_input_tokensconta os Tokens gravados no cache.cache_read_input_tokensconta os Tokens lidos do cache.input_tokensconta a entrada processada fora desses contadores de cache.
cache_read_input_tokens informa quantos Tokens de entrada
foram lidos do cache. O exemplo OpenAPI Prompt Cache
contém uma referência fictícia completa que você pode salvar como
reference.txt para testar o exemplo.
Transmitir respostas
Definastream: true para Server-Sent Events. O SDK expõe fragmentos de texto à medida que eles
chegam:
message_start, eventos de bloco de conteúdo, message_delta,
e message_stop. Os blocos de conteúdo podem conter texto, raciocínio ou atividade de ferramenta.
Para um bloco de texto, content_block_delta contém um text_delta. Leia o uso final
e o motivo da interrupção em message_delta.
Controlar esforço
Definaoutput_config.effort para orientar a quantidade de raciocínio. Este exemplo usa
low para uma explicação curta e aguarda a mensagem transmitida concluída:
max_tokens separadamente para limitar o comprimento da saída.
Use ferramentas do servidor
As ferramentas do servidor são executadas durante a solicitação da API e retornam blocos de resultado junto com a resposta do Claude.- Web Fetch
- Web Search
web_fetch_tool_result bloco:server_tool_use a um web_fetch_tool_result
que contém o documento recuperado ou um erro da ferramenta.Retornar resultados de ferramentas do cliente
Para uma ferramenta do cliente, o Claude retorna um blocotool_use. Execute a função da sua aplicação
e envie o resultado dela em um bloco tool_result com o tool_use_id correspondente.
Preserve todo o conteúdo do assistente entre as duas solicitações.
Este exemplo fornece um resultado fictício de pedido e solicita que o Claude use esse resultado:
Exemplo de resposta
Uma solicitação sem Streaming retorna um objeto de mensagem. O exemplo a seguir mostra seus campos text e usage com um identificador de mensagem ilustrativo:end_turn conclui a resposta,
max_tokens significa que a saída atingiu o limite, e tool_use solicita o resultado de uma ferramenta do cliente
resultado. Para um turno de ferramenta do servidor que retorna pause_turn, continue com o
conteúdo retornado do assistente sem alterações.Autorizações
Your CometAPI key passed via the x-api-key header. Authorization: Bearer $COMETAPI_KEY is also supported.
Cabeçalhos
The Anthropic API version to use. Defaults to 2023-06-01.
"2023-06-01"
Comma-separated feature identifiers required by a specific beta API feature. Omit this header for the examples on this page.
Corpo
The Claude model to use. See the Models page for available Claude model IDs.
"claude-opus-5"
Conversation history. Use user and assistant messages with text strings or content-block arrays. Return complete assistant content blocks when continuing a tool call.
The maximum number of tokens to generate. The model may stop before reaching this limit. When using thinking, the thinking tokens count towards this limit.
x >= 11024
System prompt providing context and instructions to Claude. Can be a plain string or an array of content blocks (useful for prompt caching).
Sampling temperature. The examples omit sampling overrides.
0 <= x <= 1Nucleus sampling threshold. The examples omit sampling overrides.
0 <= x <= 1Limits sampling to the k most likely tokens. The examples omit sampling overrides.
x >= 0If true, stream the response incrementally using Server-Sent Events (SSE). Events include message_start, content_block_start, content_block_delta, content_block_stop, message_delta, and message_stop.
Custom strings that cause the model to stop generating when encountered. The stop sequence is not included in the response.
Thinking configuration. The adaptive example uses type adaptive and sets output_config.effort separately.
Client tools define a name and input_schema. Server tools use a versioned type and name, such as the web_fetch and web_search examples on this page.
Controls how the model uses tools.
Request metadata for tracking and analytics.
Configuration for reasoning effort and structured output.
The service tier to use. auto tries priority capacity first, standard_only uses only standard capacity.
auto, standard_only Resposta
Successful response. When stream is true, the response is a stream of SSE events.
Message identifier returned by the API.
Always message.
message Always assistant.
assistant The response content blocks. May include text, thinking, tool_use, and other block types.
Model ID reported by the response.
Why the model stopped generating. refusal can be returned as a successful HTTP response when the model declines a request.
end_turn, max_tokens, stop_sequence, tool_use, pause_turn, refusal The stop sequence that caused the model to stop, if applicable.
Token usage statistics.