- Génération de texte en image
- Édition d’image à image
- Composition multi-image
- Enregistrement des images générées
- URL de base :
https://api.cometapi.com - Installez le SDK :
pip install google-genai(Python) ounpm install @google/genai(Node.js)
Configuration
Initialisez le client avec l’URL de base de CometAPI :Génération de texte vers image
Générez une image à partir d’un prompt textuel et enregistrez-la dans un fichier.candidates[0].content.parts, qui peut contenir des parties texte et/ou image. Les modèles d’image Gemini peuvent aussi renvoyer des parties de réflexion intermédiaires avant l’image finale, en particulier lorsque vous demandez à la fois du texte et des images ou que vous activez explicitement la sortie de réflexion. N’enregistrez pas aveuglément le premier inlineData ; ignorez les parties où thought vaut true, puis enregistrez la dernière partie image restante.
Réponse typique avec uniquement l’image finale :
Génération d’image à image
Téléversez une image d’entrée et transformez-la à l’aide d’un prompt textuel.- Le SDK Python accepte directement les objets
PIL.Image— aucun encodage Base64 manuel n’est nécessaire. - N’incluez pas le préfixe
data:image/jpeg;base64,lors du passage de chaînes Base64 brutes.
Composition multi-images
Générez une nouvelle image à partir de plusieurs images d’entrée. CometAPI prend en charge deux approches :Méthode 1 : Une seule image en collage
Combinez plusieurs images sources en un seul collage, puis décrivez le résultat souhaité.

Méthode 2 : Plusieurs images séparées (jusqu’à 14)
Transmettez directement plusieurs images. Les modèles Gemini 3 prennent en charge jusqu’à 14 images de référence (objets + personnages) :
Génération d’images 4K
Spécifiezimage_config avec aspect_ratio et image_size pour une sortie en haute résolution :
Pour les requêtes en haute résolution, évaluez la sortie à partir de la dernière partie d’image non thought. Si votre intégration enregistre la première partie
inlineData, elle peut enregistrer une image thought intermédiaire dont la résolution est inférieure au imageSize demandé.Édition d’images multi-tour (chat)
Utilisez la fonctionnalité de chat du SDK pour affiner des images de manière itérative :Conseils
Optimisation du Prompt
Optimisation du Prompt
Précisez des mots-clés de style (par ex., “cyberpunk, grain pellicule, faible contraste”), le ratio d’aspect, le sujet, l’arrière-plan, l’éclairage et le niveau de détail.
Format Base64
Format Base64
Lors de l’utilisation du HTTP brut, n’incluez pas le préfixe
data:image/png;base64, — utilisez uniquement la chaîne Base64 brute. Le SDK Python gère cela automatiquement avec les objets PIL.Image.Forcer la sortie image
Forcer la sortie image
Définissez
"responseModalities" sur ["IMAGE"] uniquement afin de garantir une sortie image sans texte.Pourquoi mon image est-elle floue ou en plus basse résolution ?
Pourquoi mon image est-elle floue ou en plus basse résolution ?
Vérifiez si votre code a enregistré une image de pensée intermédiaire. Les réponses d’image Gemini peuvent inclure des parties image où
thought vaut true ; il ne s’agit pas du résultat final. Ignorez les parties thought: true et enregistrez la dernière partie image où inlineData existe et thought n’est pas true. Si vous n’avez pas besoin de sortie texte, demandez "responseModalities": ["IMAGE"] afin de réduire la gestion des réponses mixtes texte/image.