- Generowanie obrazu z tekstu
- Edycję obrazu na podstawie obrazu
- Kompozycję wielu obrazów
- Zapisywanie wygenerowanych obrazów
- Base URL:
https://api.cometapi.com - Zainstaluj SDK:
pip install google-genai(Python) lubnpm install @google/genai(Node.js)
Konfiguracja
Zainicjalizuj klienta z bazowym adresem URL CometAPI:Generowanie obrazów z tekstu
Wygeneruj obraz z promptu tekstowego i zapisz go do pliku.candidates[0].content.parts, które mogą zawierać części tekstowe i/lub części obrazu. Modele obrazów Gemini mogą również zwracać pośrednie części thought przed końcowym obrazem, zwłaszcza gdy żądasz zarówno tekstu, jak i obrazów albo jawnie włączasz wyjście thinking. Nie zapisuj bezrefleksyjnie pierwszego inlineData; pomiń części, w których thought ma wartość true, a następnie zapisz ostatnią pozostałą część obrazu.
Typowa odpowiedź zawierająca tylko końcowy obraz:
Generowanie image-to-image
Prześlij obraz wejściowy i przekształć go za pomocą tekstowego Prompt.- Python SDK akceptuje obiekty
PIL.Imagebezpośrednio — nie jest potrzebne ręczne kodowanie Base64. - Nie dołączaj prefiksu
data:image/jpeg;base64,podczas przekazywania surowych ciągów Base64.
Kompozycja z wielu obrazów
Wygeneruj nowy obraz na podstawie wielu obrazów wejściowych. CometAPI obsługuje dwa podejścia:Metoda 1: Jeden obraz w formie kolażu
Połącz wiele obrazów źródłowych w jeden kolaż, a następnie opisz oczekiwany wynik.

Metoda 2: Wiele oddzielnych obrazów (do 14)
Przekaż bezpośrednio wiele obrazów. Modele Gemini 3 obsługują do 14 obrazów referencyjnych (obiekty + postacie):
Generowanie obrazów 4K
Określimage_config z aspect_ratio i image_size, aby uzyskać wynik w wysokiej rozdzielczości:
W przypadku żądań wysokiej rozdzielczości oceniaj wynik na podstawie ostatniej części obrazu, która nie jest myślą. Jeśli Twoja integracja zapisuje pierwszą część
inlineData, może zapisać pośredni obraz-myśl o niższej rozdzielczości niż żądane imageSize.Edycja obrazów w wielu turach (chat)
Użyj funkcji chat w SDK, aby iteracyjnie dopracowywać obrazy:Wskazówki
Optymalizacja Prompt
Optymalizacja Prompt
Określ słowa kluczowe stylu (np. “cyberpunk, film grain, low contrast”), proporcje obrazu, temat, tło, oświetlenie i poziom szczegółowości.
Format Base64
Format Base64
Podczas korzystania z surowego HTTP nie dołączaj prefiksu
data:image/png;base64, — użyj tylko surowego ciągu Base64. Python SDK obsługuje to automatycznie za pomocą obiektów PIL.Image.Wymuś wyjście obrazu
Wymuś wyjście obrazu
Ustaw
"responseModalities" tylko na ["IMAGE"], aby zagwarantować wyjście obrazu bez tekstu.Dlaczego mój obraz jest rozmyty lub ma niższą rozdzielczość?
Dlaczego mój obraz jest rozmyty lub ma niższą rozdzielczość?
Sprawdź, czy Twój kod nie zapisał pośredniego obrazu thought. Odpowiedzi obrazowe Gemini mogą zawierać części obrazu, w których
thought ma wartość true; nie są one końcowym wynikiem. Pomijaj części z thought: true i zapisuj ostatnią część obrazu, w której istnieje inlineData, a thought nie ma wartości true. Jeśli nie potrzebujesz wyjścia tekstowego, zażądaj "responseModalities": ["IMAGE"], aby ograniczyć obsługę mieszanych odpowiedzi tekst/obraz.