Skip to main content
Deze handleiding laat zien hoe je Gemini-afbeeldingsmodellen via CometAPI gebruikt met de Google Gen AI SDK. Dit omvat:
  • Text-to-image generatie
  • Image-to-image bewerking
  • Compositie met meerdere afbeeldingen
  • Gegenereerde afbeeldingen opslaan
  • Base URL: https://api.cometapi.com
  • Installeer de SDK: pip install google-genai (Python) of npm install @google/genai (Node.js)

Setup

Initialiseer de client met de base URL van CometAPI:

Tekst-naar-afbeelding generatie

Genereer een afbeelding vanuit een tekstprompt en sla deze op in een bestand.
Sla het uiteindelijke afbeeldingsdeel op: De afbeeldingsdata staat in candidates[0].content.parts, die tekst- en/of afbeeldingsdelen kan bevatten. Gemini-afbeeldingsmodellen kunnen ook tussenliggende thought-delen retourneren vóór de uiteindelijke afbeelding, vooral wanneer je zowel tekst als afbeeldingen opvraagt of thinking output expliciet inschakelt. Sla niet blindelings de eerste inlineData op; sla delen over waarbij thought true is en sla vervolgens het laatste overgebleven afbeeldingsdeel op. Typische response met alleen de uiteindelijke afbeelding:
Response met een tekstdeel, een tussenliggende thought-afbeelding en de uiteindelijke afbeelding:
Gebruik deze parseerregel voor elke Gemini-afbeeldingsresponse:

Afbeelding-naar-afbeeldinggeneratie

Upload een invoerafbeelding en transformeer die met een tekstprompt.
  • De Python SDK accepteert PIL.Image-objecten direct — handmatige Base64-codering is niet nodig.
  • Voeg niet het voorvoegsel data:image/jpeg;base64, toe wanneer je ruwe Base64-strings doorgeeft.

Compositie met meerdere afbeeldingen

Genereer een nieuwe afbeelding op basis van meerdere invoerafbeeldingen. CometAPI ondersteunt twee benaderingen:

Methode 1: Eén collage-afbeelding

Combineer meerdere bronafbeeldingen tot één collage en beschrijf vervolgens de gewenste uitvoer.
Voorbeeld van invoercollage
Gegenereerde uitvoer

Methode 2: Meerdere losse afbeeldingen (tot 14)

Geef meerdere afbeeldingen direct door. Gemini 3-modellen ondersteunen tot 14 referentieafbeeldingen (objecten + personages):
Resultaat van generatie met meerdere afbeeldingen

4K-beeldgeneratie

Geef image_config op met aspect_ratio en image_size voor uitvoer met hoge resolutie:
Beoordeel verzoeken met hoge resolutie op basis van het laatste niet-thought afbeeldingsdeel van de output. Als je integratie het eerste inlineData-deel opslaat, kan het een tussentijdse thought-afbeelding opslaan met een lagere resolutie dan de gevraagde imageSize.

Multi-turn afbeeldingbewerking (chat)

Gebruik de chatfunctie van de SDK om afbeeldingen iteratief te verfijnen:

Tips

Specificeer stijlzoekwoorden (bijv. “cyberpunk, film grain, low contrast”), beeldverhouding, onderwerp, achtergrond, belichting en detailniveau.
Wanneer je raw HTTP gebruikt, voeg dan niet het voorvoegsel data:image/png;base64, toe — gebruik alleen de ruwe Base64-string. De Python SDK verwerkt dit automatisch met PIL.Image-objecten.
Stel "responseModalities" alleen in op ["IMAGE"] om afbeeldingsuitvoer zonder tekst te garanderen.
Controleer of je code een tussentijdse thought-afbeelding heeft opgeslagen. Gemini-afbeeldingsresponses kunnen afbeeldingsonderdelen bevatten waarbij thought true is; dit is niet de uiteindelijke output. Sla onderdelen met thought: true over en bewaar het laatste afbeeldingsonderdeel waar inlineData bestaat en thought niet true is. Als je geen tekstoutput nodig hebt, vraag dan "responseModalities": ["IMAGE"] aan om de verwerking van gemengde tekst-/afbeeldingsresponses te beperken.
Zie voor meer details de API Reference. Officiële documentatie: Nano Banana image generation