- Generazione text-to-image
- Modifica image-to-image
- Composizione multi-immagine
- Salvataggio delle immagini generate
- Base URL:
https://api.cometapi.com - Installa l’SDK:
pip install google-genai(Python) onpm install @google/genai(Node.js)
Configurazione
Inizializza il client con il base URL di CometAPI:Generazione text-to-image
Genera un’immagine a partire da un prompt di testo e salvala in un file.candidates[0].content.parts, che può contenere parti di testo e/o immagini. I modelli di immagini Gemini possono anche restituire parti di ragionamento intermedie prima dell’immagine finale, soprattutto quando richiedi sia testo che immagini o abiliti esplicitamente l’output di thinking. Non salvare alla cieca il primo inlineData; salta le parti in cui thought è true, quindi salva l’ultima parte di immagine rimanente.
Risposta tipica con solo l’immagine finale:
Generazione image-to-image
Carica un’immagine di input e trasformala con un prompt di testo.- L’SDK Python accetta direttamente oggetti
PIL.Image— non è necessaria alcuna codifica Base64 manuale. - Non includere il prefisso
data:image/jpeg;base64,quando passi stringhe Base64 raw.
Composizione multi-immagine
Genera una nuova immagine a partire da più immagini di input. CometAPI supporta due approcci:Metodo 1: Una singola immagine collage
Combina più immagini sorgente in un unico collage, quindi descrivi l’output desiderato.

Metodo 2: Più immagini separate (fino a 14)
Passa più immagini direttamente. I modelli Gemini 3 supportano fino a 14 immagini di riferimento (oggetti + personaggi):
Generazione di immagini 4K
Specificaimage_config con aspect_ratio e image_size per un output ad alta risoluzione:
Per le richieste ad alta risoluzione, valuta l’output in base alla parte finale dell’immagine non-thought. Se la tua integrazione salva la prima parte
inlineData, potrebbe salvare un’immagine thought intermedia con una risoluzione inferiore rispetto a imageSize richiesto.Modifica iterativa delle immagini (chat)
Usa la funzionalità chat dell’SDK per perfezionare iterativamente le immagini:Suggerimenti
Ottimizzazione del Prompt
Ottimizzazione del Prompt
Specifica parole chiave di stile (ad esempio, “cyberpunk, grana della pellicola, basso contrasto”), aspect ratio, soggetto, sfondo, illuminazione e livello di dettaglio.
Formato Base64
Formato Base64
Quando usi HTTP raw, non includere il prefisso
data:image/png;base64, — usa solo la stringa Base64 raw. Il Python SDK gestisce questo automaticamente con oggetti PIL.Image.Forzare l'output immagine
Forzare l'output immagine
Imposta
"responseModalities" solo su ["IMAGE"] per garantire un output immagine senza testo.Perché la mia immagine è sfocata o ha una risoluzione più bassa?
Perché la mia immagine è sfocata o ha una risoluzione più bassa?
Controlla se il tuo codice ha salvato un’immagine di thought intermedia. Le risposte immagine di Gemini possono includere parti immagine in cui
thought è true; queste non sono l’output finale. Salta le parti thought: true e salva l’ultima parte immagine in cui inlineData esiste e thought non è true. Se non ti serve l’output di testo, richiedi "responseModalities": ["IMAGE"] per ridurre la gestione di risposte miste testo/immagine.