Skip to main content
Это руководство показывает, как использовать модели изображений Gemini через CometAPI с помощью Google Gen AI SDK. В нем рассматриваются:
  • Генерация изображения по тексту
  • Редактирование изображения по изображению
  • Компоновка нескольких изображений
  • Сохранение сгенерированных изображений
  • Base URL: https://api.cometapi.com
  • Установите SDK: pip install google-genai (Python) или npm install @google/genai (Node.js)

Настройка

Инициализируйте клиент с base URL CometAPI:

Генерация изображений по тексту

Сгенерируйте изображение из текстового Prompt и сохраните его в файл.
Сохраните финальную часть изображения: Данные изображения находятся в candidates[0].content.parts, который может содержать текстовые части и/или части изображения. Модели изображений Gemini также могут возвращать промежуточные thought-части перед финальным изображением, особенно если вы запрашиваете и текст, и изображения или явно включаете вывод thinking. Не сохраняйте первый inlineData без проверки; пропускайте части, где thought равно true, а затем сохраняйте последнюю оставшуюся часть изображения. Типичный ответ только с финальным изображением:
Ответ с текстовой частью, промежуточным thought-изображением и финальным изображением:
Используйте это правило парсинга для каждого ответа Gemini с изображением:

Генерация image-to-image

Загрузите входное изображение и преобразуйте его с помощью текстового Prompt.
  • Python SDK принимает объекты PIL.Image напрямую — ручное кодирование в Base64 не требуется.
  • Не включайте префикс data:image/jpeg;base64, при передаче необработанных строк Base64.

Композиция из нескольких изображений

Сгенерируйте новое изображение из нескольких входных изображений. CometAPI поддерживает два подхода:

Метод 1: Одно изображение-коллаж

Объедините несколько исходных изображений в один коллаж, затем опишите желаемый результат.
Пример входного коллажа
Сгенерированный результат

Метод 2: Несколько отдельных изображений (до 14)

Передайте несколько изображений напрямую. Модели Gemini 3 поддерживают до 14 reference images (объекты + персонажи):
Результат генерации из нескольких изображений

Генерация изображений 4K

Укажите image_config с aspect_ratio и image_size для вывода в высоком разрешении:
Для запросов с высоким разрешением оценивайте результат по последней части изображения без thought. Если ваша интеграция сохраняет первую часть inlineData, она может сохранить промежуточное thought-изображение с более низким разрешением, чем запрошенный imageSize.

Многошаговое редактирование изображений (чат)

Используйте функцию чата в SDK, чтобы итеративно дорабатывать изображения:

Советы

Укажите ключевые слова стиля (например, “cyberpunk, film grain, low contrast”), соотношение сторон, объект, фон, освещение и уровень детализации.
При использовании raw HTTP не включайте префикс data:image/png;base64, — используйте только raw-строку Base64. Python SDK обрабатывает это автоматически с объектами PIL.Image.
Установите "responseModalities" только в ["IMAGE"], чтобы гарантировать вывод изображения без текста.
Проверьте, не сохранил ли ваш код промежуточное thought-изображение. Ответы Gemini с изображениями могут включать части изображения, где thought имеет значение true; это не финальный результат. Пропускайте части с thought: true и сохраняйте последнюю часть изображения, где существует inlineData и thought не равно true. Если текстовый вывод вам не нужен, запрашивайте "responseModalities": ["IMAGE"], чтобы сократить обработку смешанных ответов текст/изображение.
Подробности см. в API Reference. Официальная документация: Генерация изображений Nano Banana