Skip to main content
Este guia demonstra como usar modelos de imagem Gemini via CometAPI com o Google Gen AI SDK. Ele aborda:
  • Geração de texto para imagem
  • Edição de imagem para imagem
  • Composição com múltiplas imagens
  • Como salvar imagens geradas
  • Base URL: https://api.cometapi.com
  • Instale o SDK: pip install google-genai (Python) ou npm install @google/genai (Node.js)

Configuração

Inicialize o cliente com a base URL do CometAPI:

Geração de imagem a partir de texto

Gere uma imagem a partir de um prompt de texto e salve-a em um arquivo.
Salve a parte final da imagem: Os dados da imagem estão em candidates[0].content.parts, que podem conter partes de texto e/ou de imagem. Os modelos de imagem Gemini também podem retornar partes de pensamento intermediárias antes da imagem final, especialmente quando você solicita texto e imagens ao mesmo tempo ou habilita explicitamente a saída de thinking. Não salve a primeira inlineData cegamente; ignore as partes em que thought for true e então salve a última parte de imagem restante. Resposta típica contendo apenas a imagem final:
Resposta com uma parte de texto, uma imagem de pensamento intermediária e a imagem final:
Use esta regra de parsing para toda resposta de imagem do Gemini:

Geração de imagem para imagem

Envie uma imagem de entrada e transforme-a com um prompt de texto.
  • O SDK de Python aceita objetos PIL.Image diretamente — não é necessária codificação manual em Base64.
  • Não inclua o prefixo data:image/jpeg;base64, ao passar strings Base64 brutas.

Composição com múltiplas imagens

Gere uma nova imagem a partir de várias imagens de entrada. O CometAPI oferece suporte a duas abordagens:

Método 1: Uma única imagem de colagem

Combine várias imagens de origem em uma única colagem e, em seguida, descreva a saída desejada.
Exemplo de colagem de entrada
Saída gerada

Método 2: Várias imagens separadas (até 14)

Passe várias imagens diretamente. Os modelos Gemini 3 oferecem suporte a até 14 imagens de referência (objetos + personagens):
Resultado da geração com múltiplas imagens

Geração de imagens em 4K

Especifique image_config com aspect_ratio e image_size para saída em alta resolução:
Para solicitações em alta resolução, avalie a saída pela parte final da imagem que não seja de pensamento. Se a sua integração salvar a primeira parte inlineData, ela poderá salvar uma imagem de pensamento intermediária com resolução mais baixa do que o imageSize solicitado.

Edição de imagem em múltiplos turnos (chat)

Use o recurso de chat do SDK para refinar imagens de forma iterativa:

Dicas

Especifique palavras-chave de estilo (por exemplo, “cyberpunk, granulação de filme, baixo contraste”), proporção, assunto, plano de fundo, iluminação e nível de detalhe.
Ao usar HTTP bruto, não inclua o prefixo data:image/png;base64, — use apenas a string Base64 bruta. O SDK Python lida com isso automaticamente com objetos PIL.Image.
Defina "responseModalities" como apenas ["IMAGE"] para garantir saída de imagem sem texto.
Verifique se seu código salvou uma imagem intermediária de thought. As respostas de imagem do Gemini podem incluir partes de imagem em que thought é true; essas não são a saída final. Ignore as partes com thought: true e salve a última parte de imagem em que inlineData existe e thought não é true. Se você não precisar de saída de texto, solicite "responseModalities": ["IMAGE"] para reduzir o tratamento de respostas mistas de texto/imagem.
Para mais detalhes, consulte a Referência da API. Documentação oficial: Geração de imagens Nano Banana