- Generación de texto a imagen
- Edición de imagen a imagen
- Composición de múltiples imágenes
- Guardado de imágenes generadas
- URL base:
https://api.cometapi.com - Instala el SDK:
pip install google-genai(Python) onpm install @google/genai(Node.js)
Configuración
Inicializa el cliente con la URL base de CometAPI:Generación de texto a imagen
Genera una imagen a partir de un prompt de texto y guárdala en un archivo.candidates[0].content.parts, que puede contener partes de texto y/o de imagen. Los modelos de imagen de Gemini también pueden devolver partes de pensamiento intermedias antes de la imagen final, especialmente cuando solicitas tanto texto como imágenes o habilitas explícitamente la salida de pensamiento. No guardes a ciegas el primer inlineData; omite las partes donde thought sea true y luego guarda la última parte de imagen restante.
Respuesta típica solo con la imagen final:
Generación de imagen a imagen
Sube una imagen de entrada y transfórmala con un prompt de texto.- El SDK de Python acepta objetos
PIL.Imagedirectamente; no se necesita codificación manual en Base64. - No incluyas el prefijo
data:image/jpeg;base64,al pasar cadenas Base64 sin procesar.
Composición de múltiples imágenes
Genera una nueva imagen a partir de varias imágenes de entrada. CometAPI admite dos enfoques:Método 1: Una sola imagen de collage
Combina varias imágenes de origen en un solo collage y luego describe la salida deseada.

Método 2: Varias imágenes separadas (hasta 14)
Pasa varias imágenes directamente. Los modelos Gemini 3 admiten hasta 14 imágenes de referencia (objetos + personajes):
Generación de imágenes 4K
Especificaimage_config con aspect_ratio e image_size para una salida de alta resolución:
Para las solicitudes de alta resolución, evalúa el resultado según la parte final de imagen que no sea de pensamiento. Si tu integración guarda la primera parte
inlineData, puede que guarde una imagen de pensamiento intermedia con una resolución inferior a la imageSize solicitada.Edición de imágenes en varios turnos (chat)
Usa la función de chat del SDK para refinar imágenes de forma iterativa:Consejos
Optimización del Prompt
Optimización del Prompt
Especifica palabras clave de estilo (p. ej., “cyberpunk, film grain, low contrast”), relación de aspecto, sujeto, fondo, iluminación y nivel de detalle.
Formato Base64
Formato Base64
Al usar HTTP sin procesar, no incluyas el prefijo
data:image/png;base64, — usa solo la cadena Base64 sin procesar. El SDK de Python maneja esto automáticamente con objetos PIL.Image.Forzar salida de imagen
Forzar salida de imagen
Establece
"responseModalities" en ["IMAGE"] únicamente para garantizar una salida de imagen sin texto.¿Por qué mi imagen está borrosa o tiene menor resolución?
¿Por qué mi imagen está borrosa o tiene menor resolución?
Comprueba si tu código guardó una imagen de pensamiento intermedia. Las respuestas de imágenes de Gemini pueden incluir partes de imagen donde
thought es true; estas no son la salida final. Omite las partes con thought: true y guarda la última parte de imagen donde exista inlineData y thought no sea true. Si no necesitas salida de texto, solicita "responseModalities": ["IMAGE"] para reducir el manejo de respuestas mixtas de texto/imagen.