- Генерацію text-to-image
- Редагування image-to-image
- Композицію з кількох зображень
- Збереження згенерованих зображень
- Base URL:
https://api.cometapi.com - Встановіть SDK:
pip install google-genai(Python) абоnpm install @google/genai(Node.js)
Налаштування
Ініціалізуйте клієнт із базовою URL-адресою CometAPI:Генерація text-to-image
Згенеруйте зображення з текстового Prompt і збережіть його у файл.candidates[0].content.parts, які можуть містити текстові частини та/або частини зображення. Моделі зображень Gemini також можуть повертати проміжні частини thought перед фінальним зображенням, особливо якщо ви запитуєте і текст, і зображення або явно вмикаєте вивід thinking. Не зберігайте перший inlineData без перевірки; пропускайте частини, де thought дорівнює true, а потім зберігайте останню частину зображення, що залишилася.
Типова відповідь лише з фінальним зображенням:
Генерація image-to-image
Завантажте вхідне зображення та трансформуйте його за допомогою текстового Prompt.- Python SDK напряму приймає об’єкти
PIL.Image— ручне кодування в Base64 не потрібне. - Не додавайте префікс
data:image/jpeg;base64,під час передавання сирих рядків Base64.
Композиція з кількох зображень
Згенеруйте нове зображення з кількох вхідних зображень. CometAPI підтримує два підходи:Метод 1: Єдине зображення-колаж
Об’єднайте кілька вихідних зображень в один колаж, а потім опишіть бажаний результат.

Метод 2: Кілька окремих зображень (до 14)
Передавайте кілька зображень напряму. Моделі Gemini 3 підтримують до 14 еталонних зображень (об’єкти + персонажі):
Генерація зображень 4K
Вкажітьimage_config з aspect_ratio та image_size для виводу у високій роздільній здатності:
Для запитів у високій роздільній здатності оцінюйте результат за останньою частиною зображення, яка не є thought. Якщо ваша інтеграція зберігає першу частину
inlineData, вона може зберегти проміжне thought-зображення, яке має нижчу роздільну здатність, ніж запитаний imageSize.Багатокрокове редагування зображень (chat)
Використовуйте функцію chat в SDK, щоб ітеративно вдосконалювати зображення:Поради
Оптимізація Prompt
Оптимізація Prompt
Укажіть ключові слова стилю (наприклад, “cyberpunk, film grain, low contrast”), співвідношення сторін, об’єкт, тло, освітлення та рівень деталізації.
Формат Base64
Формат Base64
Під час використання сирого HTTP не додавайте префікс
data:image/png;base64, — використовуйте лише сирий рядок Base64. Python SDK обробляє це автоматично за допомогою об’єктів PIL.Image.Примусовий вивід зображення
Примусовий вивід зображення
Установіть
"responseModalities" лише в ["IMAGE"], щоб гарантувати вивід зображення без тексту.Чому моє зображення розмите або має нижчу роздільну здатність?
Чому моє зображення розмите або має нижчу роздільну здатність?
Перевірте, чи ваш код не зберіг проміжне thought-зображення. Відповіді Gemini із зображеннями можуть містити частини зображення, де
thought дорівнює true; це не фінальний результат. Пропускайте частини з thought: true і зберігайте останню частину зображення, де існує inlineData і thought не дорівнює true. Якщо вам не потрібен текстовий вивід, запитуйте "responseModalities": ["IMAGE"], щоб зменшити обробку змішаних текстових/графічних відповідей.