- Geração de texto para imagem
- Edição de imagem para imagem
- Composição com múltiplas imagens
- Como salvar imagens geradas
- Base URL:
https://api.cometapi.com - Instale o SDK:
pip install google-genai(Python) ounpm install @google/genai(Node.js)
Configuração
Inicialize o cliente com a base URL do CometAPI:Geração de imagem a partir de texto
Gere uma imagem a partir de um prompt de texto e salve-a em um arquivo.candidates[0].content.parts, que podem conter partes de texto e/ou de imagem. Os modelos de imagem Gemini também podem retornar partes de pensamento intermediárias antes da imagem final, especialmente quando você solicita texto e imagens ao mesmo tempo ou habilita explicitamente a saída de thinking. Não salve a primeira inlineData cegamente; ignore as partes em que thought for true e então salve a última parte de imagem restante.
Resposta típica contendo apenas a imagem final:
Geração de imagem para imagem
Envie uma imagem de entrada e transforme-a com um prompt de texto.- O SDK de Python aceita objetos
PIL.Imagediretamente — não é necessária codificação manual em Base64. - Não inclua o prefixo
data:image/jpeg;base64,ao passar strings Base64 brutas.
Composição com múltiplas imagens
Gere uma nova imagem a partir de várias imagens de entrada. O CometAPI oferece suporte a duas abordagens:Método 1: Uma única imagem de colagem
Combine várias imagens de origem em uma única colagem e, em seguida, descreva a saída desejada.

Método 2: Várias imagens separadas (até 14)
Passe várias imagens diretamente. Os modelos Gemini 3 oferecem suporte a até 14 imagens de referência (objetos + personagens):
Geração de imagens em 4K
Especifiqueimage_config com aspect_ratio e image_size para saída em alta resolução:
Para solicitações em alta resolução, avalie a saída pela parte final da imagem que não seja de pensamento. Se a sua integração salvar a primeira parte
inlineData, ela poderá salvar uma imagem de pensamento intermediária com resolução mais baixa do que o imageSize solicitado.Edição de imagem em múltiplos turnos (chat)
Use o recurso de chat do SDK para refinar imagens de forma iterativa:Dicas
Otimização de Prompt
Otimização de Prompt
Especifique palavras-chave de estilo (por exemplo, “cyberpunk, granulação de filme, baixo contraste”), proporção, assunto, plano de fundo, iluminação e nível de detalhe.
Formato Base64
Formato Base64
Ao usar HTTP bruto, não inclua o prefixo
data:image/png;base64, — use apenas a string Base64 bruta. O SDK Python lida com isso automaticamente com objetos PIL.Image.Forçar saída de imagem
Forçar saída de imagem
Defina
"responseModalities" como apenas ["IMAGE"] para garantir saída de imagem sem texto.Por que minha imagem está borrada ou com resolução mais baixa?
Por que minha imagem está borrada ou com resolução mais baixa?
Verifique se seu código salvou uma imagem intermediária de thought. As respostas de imagem do Gemini podem incluir partes de imagem em que
thought é true; essas não são a saída final. Ignore as partes com thought: true e salve a última parte de imagem em que inlineData existe e thought não é true. Se você não precisar de saída de texto, solicite "responseModalities": ["IMAGE"] para reduzir o tratamento de respostas mistas de texto/imagem.