Skip to main content
Цей посібник показує, як використовувати моделі зображень Gemini через CometAPI за допомогою Google Gen AI SDK. Він охоплює:
  • Генерацію text-to-image
  • Редагування image-to-image
  • Композицію з кількох зображень
  • Збереження згенерованих зображень
  • Base URL: https://api.cometapi.com
  • Встановіть SDK: pip install google-genai (Python) або npm install @google/genai (Node.js)

Налаштування

Ініціалізуйте клієнт із базовою URL-адресою CometAPI:

Генерація text-to-image

Згенеруйте зображення з текстового Prompt і збережіть його у файл.
Збереження фінальної частини зображення: Дані зображення містяться в candidates[0].content.parts, які можуть містити текстові частини та/або частини зображення. Моделі зображень Gemini також можуть повертати проміжні частини thought перед фінальним зображенням, особливо якщо ви запитуєте і текст, і зображення або явно вмикаєте вивід thinking. Не зберігайте перший inlineData без перевірки; пропускайте частини, де thought дорівнює true, а потім зберігайте останню частину зображення, що залишилася. Типова відповідь лише з фінальним зображенням:
Відповідь із текстовою частиною, проміжним thought-зображенням і фінальним зображенням:
Використовуйте це правило парсингу для кожної відповіді Gemini image:

Генерація image-to-image

Завантажте вхідне зображення та трансформуйте його за допомогою текстового Prompt.
  • Python SDK напряму приймає об’єкти PIL.Image — ручне кодування в Base64 не потрібне.
  • Не додавайте префікс data:image/jpeg;base64, під час передавання сирих рядків Base64.

Композиція з кількох зображень

Згенеруйте нове зображення з кількох вхідних зображень. CometAPI підтримує два підходи:

Метод 1: Єдине зображення-колаж

Об’єднайте кілька вихідних зображень в один колаж, а потім опишіть бажаний результат.
Приклад вхідного колажу
Згенерований результат

Метод 2: Кілька окремих зображень (до 14)

Передавайте кілька зображень напряму. Моделі Gemini 3 підтримують до 14 еталонних зображень (об’єкти + персонажі):
Результат генерації з кількох зображень

Генерація зображень 4K

Вкажіть image_config з aspect_ratio та image_size для виводу у високій роздільній здатності:
Для запитів у високій роздільній здатності оцінюйте результат за останньою частиною зображення, яка не є thought. Якщо ваша інтеграція зберігає першу частину inlineData, вона може зберегти проміжне thought-зображення, яке має нижчу роздільну здатність, ніж запитаний imageSize.

Багатокрокове редагування зображень (chat)

Використовуйте функцію chat в SDK, щоб ітеративно вдосконалювати зображення:

Поради

Укажіть ключові слова стилю (наприклад, “cyberpunk, film grain, low contrast”), співвідношення сторін, об’єкт, тло, освітлення та рівень деталізації.
Під час використання сирого HTTP не додавайте префікс data:image/png;base64, — використовуйте лише сирий рядок Base64. Python SDK обробляє це автоматично за допомогою об’єктів PIL.Image.
Установіть "responseModalities" лише в ["IMAGE"], щоб гарантувати вивід зображення без тексту.
Перевірте, чи ваш код не зберіг проміжне thought-зображення. Відповіді Gemini із зображеннями можуть містити частини зображення, де thought дорівнює true; це не фінальний результат. Пропускайте частини з thought: true і зберігайте останню частину зображення, де існує inlineData і thought не дорівнює true. Якщо вам не потрібен текстовий вивід, запитуйте "responseModalities": ["IMAGE"], щоб зменшити обробку змішаних текстових/графічних відповідей.
Докладніше дивіться в API Reference. Офіційна документація: Генерація зображень Nano Banana