Skip to main content
Denne veiledningen viser hvordan du bruker Gemini-bildemodeller via CometAPI med Google Gen AI SDK. Den dekker:
  • Tekst-til-bilde-generering
  • Bilde-til-bilde-redigering
  • Komposisjon med flere bilder
  • Lagring av genererte bilder
  • Base URL: https://api.cometapi.com
  • Installer SDK-en: pip install google-genai (Python) eller npm install @google/genai (Node.js)

Oppsett

Initialiser klienten med CometAPIs base URL:

Tekst-til-bilde-generering

Generer et bilde fra en tekst Prompt og lagre det til en fil.
Lagre den endelige bildedelen: Bildedataene ligger i candidates[0].content.parts, som kan inneholde tekst- og/eller bildedeler. Gemini-bildemodeller kan også returnere mellomliggende thought-deler før det endelige bildet, spesielt når du ber om både tekst og bilder eller eksplisitt aktiverer thinking-utdata. Ikke lagre den første inlineData blindt; hopp over deler der thought er true, og lagre deretter den siste gjenværende bildedelen. Typisk respons med bare det endelige bildet:
Respons med en tekstdel, et mellomliggende thought-bilde og det endelige bildet:
Bruk denne parseregelen for hver Gemini-bilderespons:

Bilde-til-bilde-generering

Last opp et inndatabilde og transformer det med en tekst-Prompt.
  • Python SDK-en godtar PIL.Image-objekter direkte — ingen manuell Base64-koding er nødvendig.
  • Ikke inkluder prefikset data:image/jpeg;base64, når du sender rå Base64-strenger.

Komponering med flere bilder

Generer et nytt bilde fra flere inndatabilder. CometAPI støtter to tilnærminger:

Metode 1: Ett kollasjbilde

Kombiner flere kildebilder til én kollasj, og beskriv deretter ønsket utdata.
Eksempel på inndatakollasj
Generert utdata

Metode 2: Flere separate bilder (opptil 14)

Send flere bilder direkte. Gemini 3-modeller støtter opptil 14 referansebilder (objekter + karakterer):
Resultat for generering med flere bilder

4K-bildegenerering

Spesifiser image_config med aspect_ratio og image_size for høyoppløselig utdata:
For høyoppløselige forespørsler bør du vurdere resultatet ut fra den siste ikke-thought-bildedelen. Hvis integrasjonen din lagrer den første inlineData-delen, kan den lagre et mellomliggende thought-bilde med lavere oppløsning enn den forespurte imageSize.

Flerturns bilderedigering (chat)

Bruk SDK-ens chat-funksjon til å forbedre bilder iterativt:

Tips

Spesifiser stilnøkkelord (f.eks. “cyberpunk, film grain, low contrast”), sideforhold, motiv, bakgrunn, belysning og detaljnivå.
Når du bruker rå HTTP, ikke inkluder prefikset data:image/png;base64, — bruk bare den rå Base64-strengen. Python SDK håndterer dette automatisk med PIL.Image-objekter.
Sett "responseModalities" til bare ["IMAGE"] for å garantere bildeutdata uten tekst.
Sjekk om koden din lagret et mellomliggende thought-bilde. Gemini-bildesvar kan inkludere bildedeler der thought er true; disse er ikke den endelige utdataen. Hopp over deler med thought: true og lagre den siste bildedelen der inlineData finnes og thought ikke er true. Hvis du ikke trenger tekstutdata, be om "responseModalities": ["IMAGE"] for å redusere håndtering av blandede tekst-/bildesvar.
For flere detaljer, se API-referansen. Offisiell dokumentasjon: Nano Banana-bildegenerering
Sist endret 23. juni 2026