Skip to main content
Ten przewodnik pokazuje, jak używać modeli obrazowych Gemini przez CometAPI za pomocą Google Gen AI SDK. Obejmuje on:
  • Generowanie obrazu z tekstu
  • Edycję obrazu na podstawie obrazu
  • Kompozycję wielu obrazów
  • Zapisywanie wygenerowanych obrazów
  • Base URL: https://api.cometapi.com
  • Zainstaluj SDK: pip install google-genai (Python) lub npm install @google/genai (Node.js)

Konfiguracja

Zainicjalizuj klienta z bazowym adresem URL CometAPI:

Generowanie obrazów z tekstu

Wygeneruj obraz z promptu tekstowego i zapisz go do pliku.
Zapisz końcową część obrazu: Dane obrazu znajdują się w candidates[0].content.parts, które mogą zawierać części tekstowe i/lub części obrazu. Modele obrazów Gemini mogą również zwracać pośrednie części thought przed końcowym obrazem, zwłaszcza gdy żądasz zarówno tekstu, jak i obrazów albo jawnie włączasz wyjście thinking. Nie zapisuj bezrefleksyjnie pierwszego inlineData; pomiń części, w których thought ma wartość true, a następnie zapisz ostatnią pozostałą część obrazu. Typowa odpowiedź zawierająca tylko końcowy obraz:
Odpowiedź z częścią tekstową, pośrednim obrazem thought i końcowym obrazem:
Użyj tej reguły parsowania dla każdej odpowiedzi obrazu Gemini:

Generowanie image-to-image

Prześlij obraz wejściowy i przekształć go za pomocą tekstowego Prompt.
  • Python SDK akceptuje obiekty PIL.Image bezpośrednio — nie jest potrzebne ręczne kodowanie Base64.
  • Nie dołączaj prefiksu data:image/jpeg;base64, podczas przekazywania surowych ciągów Base64.

Kompozycja z wielu obrazów

Wygeneruj nowy obraz na podstawie wielu obrazów wejściowych. CometAPI obsługuje dwa podejścia:

Metoda 1: Jeden obraz w formie kolażu

Połącz wiele obrazów źródłowych w jeden kolaż, a następnie opisz oczekiwany wynik.
Przykład kolażu wejściowego
Wygenerowany wynik

Metoda 2: Wiele oddzielnych obrazów (do 14)

Przekaż bezpośrednio wiele obrazów. Modele Gemini 3 obsługują do 14 obrazów referencyjnych (obiekty + postacie):
Wynik generowania z wielu obrazów

Generowanie obrazów 4K

Określ image_config z aspect_ratio i image_size, aby uzyskać wynik w wysokiej rozdzielczości:
W przypadku żądań wysokiej rozdzielczości oceniaj wynik na podstawie ostatniej części obrazu, która nie jest myślą. Jeśli Twoja integracja zapisuje pierwszą część inlineData, może zapisać pośredni obraz-myśl o niższej rozdzielczości niż żądane imageSize.

Edycja obrazów w wielu turach (chat)

Użyj funkcji chat w SDK, aby iteracyjnie dopracowywać obrazy:

Wskazówki

Określ słowa kluczowe stylu (np. “cyberpunk, film grain, low contrast”), proporcje obrazu, temat, tło, oświetlenie i poziom szczegółowości.
Podczas korzystania z surowego HTTP nie dołączaj prefiksu data:image/png;base64, — użyj tylko surowego ciągu Base64. Python SDK obsługuje to automatycznie za pomocą obiektów PIL.Image.
Ustaw "responseModalities" tylko na ["IMAGE"], aby zagwarantować wyjście obrazu bez tekstu.
Sprawdź, czy Twój kod nie zapisał pośredniego obrazu thought. Odpowiedzi obrazowe Gemini mogą zawierać części obrazu, w których thought ma wartość true; nie są one końcowym wynikiem. Pomijaj części z thought: true i zapisuj ostatnią część obrazu, w której istnieje inlineData, a thought nie ma wartości true. Jeśli nie potrzebujesz wyjścia tekstowego, zażądaj "responseModalities": ["IMAGE"], aby ograniczyć obsługę mieszanych odpowiedzi tekst/obraz.
Aby uzyskać więcej informacji, zobacz API Reference. Oficjalna dokumentacja: Generowanie obrazów Nano Banana