Skip to main content
Esta guía muestra cómo usar modelos de imagen Gemini a través de CometAPI usando el Google Gen AI SDK. Cubre:
  • Generación de texto a imagen
  • Edición de imagen a imagen
  • Composición de múltiples imágenes
  • Guardado de imágenes generadas
  • URL base: https://api.cometapi.com
  • Instala el SDK: pip install google-genai (Python) o npm install @google/genai (Node.js)

Configuración

Inicializa el cliente con la URL base de CometAPI:

Generación de texto a imagen

Genera una imagen a partir de un prompt de texto y guárdala en un archivo.
Guarda la parte de la imagen final: Los datos de la imagen están en candidates[0].content.parts, que puede contener partes de texto y/o de imagen. Los modelos de imagen de Gemini también pueden devolver partes de pensamiento intermedias antes de la imagen final, especialmente cuando solicitas tanto texto como imágenes o habilitas explícitamente la salida de pensamiento. No guardes a ciegas el primer inlineData; omite las partes donde thought sea true y luego guarda la última parte de imagen restante. Respuesta típica solo con la imagen final:
Respuesta con una parte de texto, una imagen de pensamiento intermedia y la imagen final:
Usa esta regla de análisis para cada respuesta de imagen de Gemini:

Generación de imagen a imagen

Sube una imagen de entrada y transfórmala con un prompt de texto.
  • El SDK de Python acepta objetos PIL.Image directamente; no se necesita codificación manual en Base64.
  • No incluyas el prefijo data:image/jpeg;base64, al pasar cadenas Base64 sin procesar.

Composición de múltiples imágenes

Genera una nueva imagen a partir de varias imágenes de entrada. CometAPI admite dos enfoques:

Método 1: Una sola imagen de collage

Combina varias imágenes de origen en un solo collage y luego describe la salida deseada.
Ejemplo de collage de entrada
Salida generada

Método 2: Varias imágenes separadas (hasta 14)

Pasa varias imágenes directamente. Los modelos Gemini 3 admiten hasta 14 imágenes de referencia (objetos + personajes):
Resultado de la generación con múltiples imágenes

Generación de imágenes 4K

Especifica image_config con aspect_ratio e image_size para una salida de alta resolución:
Para las solicitudes de alta resolución, evalúa el resultado según la parte final de imagen que no sea de pensamiento. Si tu integración guarda la primera parte inlineData, puede que guarde una imagen de pensamiento intermedia con una resolución inferior a la imageSize solicitada.

Edición de imágenes en varios turnos (chat)

Usa la función de chat del SDK para refinar imágenes de forma iterativa:

Consejos

Especifica palabras clave de estilo (p. ej., “cyberpunk, film grain, low contrast”), relación de aspecto, sujeto, fondo, iluminación y nivel de detalle.
Al usar HTTP sin procesar, no incluyas el prefijo data:image/png;base64, — usa solo la cadena Base64 sin procesar. El SDK de Python maneja esto automáticamente con objetos PIL.Image.
Establece "responseModalities" en ["IMAGE"] únicamente para garantizar una salida de imagen sin texto.
Comprueba si tu código guardó una imagen de pensamiento intermedia. Las respuestas de imágenes de Gemini pueden incluir partes de imagen donde thought es true; estas no son la salida final. Omite las partes con thought: true y guarda la última parte de imagen donde exista inlineData y thought no sea true. Si no necesitas salida de texto, solicita "responseModalities": ["IMAGE"] para reducir el manejo de respuestas mixtas de texto/imagen.
Para más detalles, consulta la Referencia de la API. Documentación oficial: Generación de imágenes de Nano Banana