- Text-zu-Bild-Generierung
- Bild-zu-Bild-Bearbeitung
- Komposition mehrerer Bilder
- Generierte Bilder speichern
- Base URL:
https://api.cometapi.com - Installieren Sie das SDK:
pip install google-genai(Python) odernpm install @google/genai(Node.js)
Einrichtung
Initialisieren Sie den Client mit der Base URL von CometAPI:Text-to-image-Generierung
Erzeugen Sie ein Bild aus einem Text-Prompt und speichern Sie es in einer Datei.candidates[0].content.parts, die Text- und/oder Bildteile enthalten können. Gemini-Bildmodelle können auch Zwischen-Thought-Teile vor dem endgültigen Bild zurückgeben, insbesondere wenn Sie sowohl Text als auch Bilder anfordern oder die Thinking-Ausgabe explizit aktivieren. Speichern Sie nicht blind das erste inlineData; überspringen Sie Teile, bei denen thought den Wert true hat, und speichern Sie dann den letzten verbleibenden Bildteil.
Typische Antwort nur mit dem endgültigen Bild:
Bild-zu-Bild-Generierung
Laden Sie ein Eingabebild hoch und transformieren Sie es mit einem Text-Prompt.- Das Python SDK akzeptiert
PIL.Image-Objekte direkt — keine manuelle Base64-Kodierung erforderlich. - Fügen Sie nicht das Präfix
data:image/jpeg;base64,ein, wenn Sie rohe Base64-Strings übergeben.
Multi-image-Komposition
Erzeuge ein neues Bild aus mehreren Eingabebildern. CometAPI unterstützt zwei Ansätze:Methode 1: Einzelnes Collage-Bild
Kombiniere mehrere Quellbilder zu einer Collage und beschreibe dann die gewünschte Ausgabe.

Methode 2: Mehrere separate Bilder (bis zu 14)
Übergebe mehrere Bilder direkt. Gemini 3-Modelle unterstützen bis zu 14 Referenzbilder (Objekte + Charaktere):
4K-Bildgenerierung
Geben Sieimage_config mit aspect_ratio und image_size für eine hochauflösende Ausgabe an:
Beurteilen Sie bei hochauflösenden Anfragen die Ausgabe anhand des letzten Bildteils ohne thought. Wenn Ihre Integration den ersten
inlineData-Teil speichert, speichert sie möglicherweise ein Zwischenbild aus dem thought-Prozess, das eine niedrigere Auflösung als die angeforderte imageSize hat.Mehrstufige Bildbearbeitung (Chat)
Verwenden Sie die Chat-Funktion des SDK, um Bilder iterativ zu verfeinern:Tipps
Prompt-Optimierung
Prompt-Optimierung
Gib Stil-Schlüsselwörter an (z. B. „cyberpunk, film grain, low contrast“), Seitenverhältnis, Motiv, Hintergrund, Beleuchtung und Detailgrad.
Base64-Format
Base64-Format
Wenn du rohes HTTP verwendest, füge nicht das Präfix
data:image/png;base64, hinzu — verwende nur den rohen Base64-String. Das Python SDK übernimmt dies automatisch mit PIL.Image-Objekten.Bildausgabe erzwingen
Bildausgabe erzwingen
Setze
"responseModalities" nur auf ["IMAGE"], um eine Bildausgabe ohne Text zu gewährleisten.Warum ist mein Bild unscharf oder hat eine niedrigere Auflösung?
Warum ist mein Bild unscharf oder hat eine niedrigere Auflösung?
Prüfe, ob dein Code ein Zwischenbild aus den Gedanken gespeichert hat. Gemini-Bildantworten können Bildteile enthalten, bei denen
thought auf true gesetzt ist; diese sind nicht die endgültige Ausgabe. Überspringe Teile mit thought: true und speichere den letzten Bildteil, bei dem inlineData vorhanden ist und thought nicht true ist. Wenn du keine Textausgabe benötigst, fordere "responseModalities": ["IMAGE"] an, um die Verarbeitung gemischter Text-/Bildantworten zu reduzieren.