- Генерация изображения по тексту
- Редактирование изображения по изображению
- Компоновка нескольких изображений
- Сохранение сгенерированных изображений
- Base URL:
https://api.cometapi.com - Установите SDK:
pip install google-genai(Python) илиnpm install @google/genai(Node.js)
Настройка
Инициализируйте клиент с base URL CometAPI:Генерация изображений по тексту
Сгенерируйте изображение из текстового Prompt и сохраните его в файл.candidates[0].content.parts, который может содержать текстовые части и/или части изображения. Модели изображений Gemini также могут возвращать промежуточные thought-части перед финальным изображением, особенно если вы запрашиваете и текст, и изображения или явно включаете вывод thinking. Не сохраняйте первый inlineData без проверки; пропускайте части, где thought равно true, а затем сохраняйте последнюю оставшуюся часть изображения.
Типичный ответ только с финальным изображением:
Генерация image-to-image
Загрузите входное изображение и преобразуйте его с помощью текстового Prompt.- Python SDK принимает объекты
PIL.Imageнапрямую — ручное кодирование в Base64 не требуется. - Не включайте префикс
data:image/jpeg;base64,при передаче необработанных строк Base64.
Композиция из нескольких изображений
Сгенерируйте новое изображение из нескольких входных изображений. CometAPI поддерживает два подхода:Метод 1: Одно изображение-коллаж
Объедините несколько исходных изображений в один коллаж, затем опишите желаемый результат.

Метод 2: Несколько отдельных изображений (до 14)
Передайте несколько изображений напрямую. Модели Gemini 3 поддерживают до 14 reference images (объекты + персонажи):
Генерация изображений 4K
Укажитеimage_config с aspect_ratio и image_size для вывода в высоком разрешении:
Для запросов с высоким разрешением оценивайте результат по последней части изображения без thought. Если ваша интеграция сохраняет первую часть
inlineData, она может сохранить промежуточное thought-изображение с более низким разрешением, чем запрошенный imageSize.Многошаговое редактирование изображений (чат)
Используйте функцию чата в SDK, чтобы итеративно дорабатывать изображения:Советы
Оптимизация Prompt
Оптимизация Prompt
Укажите ключевые слова стиля (например, “cyberpunk, film grain, low contrast”), соотношение сторон, объект, фон, освещение и уровень детализации.
Формат Base64
Формат Base64
При использовании raw HTTP не включайте префикс
data:image/png;base64, — используйте только raw-строку Base64. Python SDK обрабатывает это автоматически с объектами PIL.Image.Принудительный вывод изображения
Принудительный вывод изображения
Установите
"responseModalities" только в ["IMAGE"], чтобы гарантировать вывод изображения без текста.Почему мое изображение размытое или более низкого разрешения?
Почему мое изображение размытое или более низкого разрешения?
Проверьте, не сохранил ли ваш код промежуточное thought-изображение. Ответы Gemini с изображениями могут включать части изображения, где
thought имеет значение true; это не финальный результат. Пропускайте части с thought: true и сохраняйте последнюю часть изображения, где существует inlineData и thought не равно true. Если текстовый вывод вам не нужен, запрашивайте "responseModalities": ["IMAGE"], чтобы сократить обработку смешанных ответов текст/изображение.