Skip to main content
Questa guida mostra come usare i modelli immagine Gemini tramite CometAPI usando il Google Gen AI SDK. Include:
  • Generazione text-to-image
  • Modifica image-to-image
  • Composizione multi-immagine
  • Salvataggio delle immagini generate
  • Base URL: https://api.cometapi.com
  • Installa l’SDK: pip install google-genai (Python) o npm install @google/genai (Node.js)

Configurazione

Inizializza il client con il base URL di CometAPI:

Generazione text-to-image

Genera un’immagine a partire da un prompt di testo e salvala in un file.
Salva la parte finale dell’immagine: I dati dell’immagine si trovano in candidates[0].content.parts, che può contenere parti di testo e/o immagini. I modelli di immagini Gemini possono anche restituire parti di ragionamento intermedie prima dell’immagine finale, soprattutto quando richiedi sia testo che immagini o abiliti esplicitamente l’output di thinking. Non salvare alla cieca il primo inlineData; salta le parti in cui thought è true, quindi salva l’ultima parte di immagine rimanente. Risposta tipica con solo l’immagine finale:
Risposta con una parte di testo, un’immagine di ragionamento intermedia e l’immagine finale:
Usa questa regola di parsing per ogni risposta di immagini Gemini:

Generazione image-to-image

Carica un’immagine di input e trasformala con un prompt di testo.
  • L’SDK Python accetta direttamente oggetti PIL.Image — non è necessaria alcuna codifica Base64 manuale.
  • Non includere il prefisso data:image/jpeg;base64, quando passi stringhe Base64 raw.

Composizione multi-immagine

Genera una nuova immagine a partire da più immagini di input. CometAPI supporta due approcci:

Metodo 1: Una singola immagine collage

Combina più immagini sorgente in un unico collage, quindi descrivi l’output desiderato.
Esempio di collage di input
Output generato

Metodo 2: Più immagini separate (fino a 14)

Passa più immagini direttamente. I modelli Gemini 3 supportano fino a 14 immagini di riferimento (oggetti + personaggi):
Risultato della generazione multi-immagine

Generazione di immagini 4K

Specifica image_config con aspect_ratio e image_size per un output ad alta risoluzione:
Per le richieste ad alta risoluzione, valuta l’output in base alla parte finale dell’immagine non-thought. Se la tua integrazione salva la prima parte inlineData, potrebbe salvare un’immagine thought intermedia con una risoluzione inferiore rispetto a imageSize richiesto.

Modifica iterativa delle immagini (chat)

Usa la funzionalità chat dell’SDK per perfezionare iterativamente le immagini:

Suggerimenti

Specifica parole chiave di stile (ad esempio, “cyberpunk, grana della pellicola, basso contrasto”), aspect ratio, soggetto, sfondo, illuminazione e livello di dettaglio.
Quando usi HTTP raw, non includere il prefisso data:image/png;base64, — usa solo la stringa Base64 raw. Il Python SDK gestisce questo automaticamente con oggetti PIL.Image.
Imposta "responseModalities" solo su ["IMAGE"] per garantire un output immagine senza testo.
Controlla se il tuo codice ha salvato un’immagine di thought intermedia. Le risposte immagine di Gemini possono includere parti immagine in cui thought è true; queste non sono l’output finale. Salta le parti thought: true e salva l’ultima parte immagine in cui inlineData esiste e thought non è true. Se non ti serve l’output di testo, richiedi "responseModalities": ["IMAGE"] per ridurre la gestione di risposte miste testo/immagine.
Per maggiori dettagli, vedi la API Reference. Documentazione ufficiale: Generazione di immagini Nano Banana