Skip to main content
Ce guide montre comment utiliser les modèles d’image Gemini via CometAPI avec le Google Gen AI SDK. Il couvre :
  • Génération de texte en image
  • Édition d’image à image
  • Composition multi-image
  • Enregistrement des images générées
  • URL de base : https://api.cometapi.com
  • Installez le SDK : pip install google-genai (Python) ou npm install @google/genai (Node.js)

Configuration

Initialisez le client avec l’URL de base de CometAPI :

Génération de texte vers image

Générez une image à partir d’un prompt textuel et enregistrez-la dans un fichier.
Enregistrez la partie image finale : Les données de l’image se trouvent dans candidates[0].content.parts, qui peut contenir des parties texte et/ou image. Les modèles d’image Gemini peuvent aussi renvoyer des parties de réflexion intermédiaires avant l’image finale, en particulier lorsque vous demandez à la fois du texte et des images ou que vous activez explicitement la sortie de réflexion. N’enregistrez pas aveuglément le premier inlineData ; ignorez les parties où thought vaut true, puis enregistrez la dernière partie image restante. Réponse typique avec uniquement l’image finale :
Réponse avec une partie texte, une image de réflexion intermédiaire et l’image finale :
Utilisez cette règle d’analyse pour chaque réponse d’image Gemini :

Génération d’image à image

Téléversez une image d’entrée et transformez-la à l’aide d’un prompt textuel.
  • Le SDK Python accepte directement les objets PIL.Image — aucun encodage Base64 manuel n’est nécessaire.
  • N’incluez pas le préfixe data:image/jpeg;base64, lors du passage de chaînes Base64 brutes.

Composition multi-images

Générez une nouvelle image à partir de plusieurs images d’entrée. CometAPI prend en charge deux approches :

Méthode 1 : Une seule image en collage

Combinez plusieurs images sources en un seul collage, puis décrivez le résultat souhaité.
Exemple de collage d’entrée
Résultat généré

Méthode 2 : Plusieurs images séparées (jusqu’à 14)

Transmettez directement plusieurs images. Les modèles Gemini 3 prennent en charge jusqu’à 14 images de référence (objets + personnages) :
Résultat de génération multi-images

Génération d’images 4K

Spécifiez image_config avec aspect_ratio et image_size pour une sortie en haute résolution :
Pour les requêtes en haute résolution, évaluez la sortie à partir de la dernière partie d’image non thought. Si votre intégration enregistre la première partie inlineData, elle peut enregistrer une image thought intermédiaire dont la résolution est inférieure au imageSize demandé.

Édition d’images multi-tour (chat)

Utilisez la fonctionnalité de chat du SDK pour affiner des images de manière itérative :

Conseils

Précisez des mots-clés de style (par ex., “cyberpunk, grain pellicule, faible contraste”), le ratio d’aspect, le sujet, l’arrière-plan, l’éclairage et le niveau de détail.
Lors de l’utilisation du HTTP brut, n’incluez pas le préfixe data:image/png;base64, — utilisez uniquement la chaîne Base64 brute. Le SDK Python gère cela automatiquement avec les objets PIL.Image.
Définissez "responseModalities" sur ["IMAGE"] uniquement afin de garantir une sortie image sans texte.
Vérifiez si votre code a enregistré une image de pensée intermédiaire. Les réponses d’image Gemini peuvent inclure des parties image où thought vaut true ; il ne s’agit pas du résultat final. Ignorez les parties thought: true et enregistrez la dernière partie image où inlineData existe et thought n’est pas true. Si vous n’avez pas besoin de sortie texte, demandez "responseModalities": ["IMAGE"] afin de réduire la gestion des réponses mixtes texte/image.
Pour plus de détails, consultez la référence de l’API. Documentation officielle : Génération d’images Nano Banana