Skip to main content
Diese Anleitung zeigt, wie Sie Gemini-Bildmodelle über CometAPI mit dem Google Gen AI SDK verwenden. Sie behandelt:
  • Text-zu-Bild-Generierung
  • Bild-zu-Bild-Bearbeitung
  • Komposition mehrerer Bilder
  • Generierte Bilder speichern
  • Base URL: https://api.cometapi.com
  • Installieren Sie das SDK: pip install google-genai (Python) oder npm install @google/genai (Node.js)

Einrichtung

Initialisieren Sie den Client mit der Base URL von CometAPI:

Text-to-image-Generierung

Erzeugen Sie ein Bild aus einem Text-Prompt und speichern Sie es in einer Datei.
Speichern Sie den endgültigen Bildteil: Die Bilddaten befinden sich in candidates[0].content.parts, die Text- und/oder Bildteile enthalten können. Gemini-Bildmodelle können auch Zwischen-Thought-Teile vor dem endgültigen Bild zurückgeben, insbesondere wenn Sie sowohl Text als auch Bilder anfordern oder die Thinking-Ausgabe explizit aktivieren. Speichern Sie nicht blind das erste inlineData; überspringen Sie Teile, bei denen thought den Wert true hat, und speichern Sie dann den letzten verbleibenden Bildteil. Typische Antwort nur mit dem endgültigen Bild:
Antwort mit einem Textteil, einem Zwischenbild für Thought und dem endgültigen Bild:
Verwenden Sie diese Parsing-Regel für jede Gemini-Bildantwort:

Bild-zu-Bild-Generierung

Laden Sie ein Eingabebild hoch und transformieren Sie es mit einem Text-Prompt.
  • Das Python SDK akzeptiert PIL.Image-Objekte direkt — keine manuelle Base64-Kodierung erforderlich.
  • Fügen Sie nicht das Präfix data:image/jpeg;base64, ein, wenn Sie rohe Base64-Strings übergeben.

Multi-image-Komposition

Erzeuge ein neues Bild aus mehreren Eingabebildern. CometAPI unterstützt zwei Ansätze:

Methode 1: Einzelnes Collage-Bild

Kombiniere mehrere Quellbilder zu einer Collage und beschreibe dann die gewünschte Ausgabe.
Beispiel für Eingabe-Collage
Generierte Ausgabe

Methode 2: Mehrere separate Bilder (bis zu 14)

Übergebe mehrere Bilder direkt. Gemini 3-Modelle unterstützen bis zu 14 Referenzbilder (Objekte + Charaktere):
Ergebnis der Multi-image-Generierung

4K-Bildgenerierung

Geben Sie image_config mit aspect_ratio und image_size für eine hochauflösende Ausgabe an:
Beurteilen Sie bei hochauflösenden Anfragen die Ausgabe anhand des letzten Bildteils ohne thought. Wenn Ihre Integration den ersten inlineData-Teil speichert, speichert sie möglicherweise ein Zwischenbild aus dem thought-Prozess, das eine niedrigere Auflösung als die angeforderte imageSize hat.

Mehrstufige Bildbearbeitung (Chat)

Verwenden Sie die Chat-Funktion des SDK, um Bilder iterativ zu verfeinern:

Tipps

Gib Stil-Schlüsselwörter an (z. B. „cyberpunk, film grain, low contrast“), Seitenverhältnis, Motiv, Hintergrund, Beleuchtung und Detailgrad.
Wenn du rohes HTTP verwendest, füge nicht das Präfix data:image/png;base64, hinzu — verwende nur den rohen Base64-String. Das Python SDK übernimmt dies automatisch mit PIL.Image-Objekten.
Setze "responseModalities" nur auf ["IMAGE"], um eine Bildausgabe ohne Text zu gewährleisten.
Prüfe, ob dein Code ein Zwischenbild aus den Gedanken gespeichert hat. Gemini-Bildantworten können Bildteile enthalten, bei denen thought auf true gesetzt ist; diese sind nicht die endgültige Ausgabe. Überspringe Teile mit thought: true und speichere den letzten Bildteil, bei dem inlineData vorhanden ist und thought nicht true ist. Wenn du keine Textausgabe benötigst, fordere "responseModalities": ["IMAGE"] an, um die Verarbeitung gemischter Text-/Bildantworten zu reduzieren.
Weitere Details findest du in der API-Referenz. Offizielle Dokumentation: Nano Banana-Bildgenerierung