Skip to main content
이 가이드는 Google Gen AI SDK를 사용하여 CometAPI를 통해 Gemini 이미지 모델을 사용하는 방법을 보여줍니다. 다음 내용을 다룹니다:
  • 텍스트-투-이미지 생성
  • 이미지-투-이미지 편집
  • 다중 이미지 합성
  • 생성된 이미지 저장
  • Base URL: https://api.cometapi.com
  • SDK 설치: pip install google-genai (Python) 또는 npm install @google/genai (Node.js)

설정

CometAPI의 base URL로 클라이언트를 초기화합니다:

텍스트-이미지 생성

텍스트 프롬프트에서 이미지를 생성하고 파일로 저장합니다.
최종 이미지 파트 저장하기: 이미지 데이터는 candidates[0].content.parts에 있으며, 여기에는 텍스트 파트 및/또는 이미지 파트가 포함될 수 있습니다. Gemini 이미지 모델은 최종 이미지 전에 중간 thought 파트를 반환할 수도 있으며, 특히 텍스트와 이미지를 모두 요청하거나 thinking 출력을 명시적으로 활성화한 경우에 그렇습니다. 첫 번째 inlineData를 그대로 저장하지 말고, thoughttrue인 파트는 건너뛴 다음 남은 마지막 이미지 파트를 저장하세요. 최종 이미지만 포함된 일반적인 응답:
텍스트 파트, 중간 thought 이미지, 최종 이미지가 포함된 응답:
모든 Gemini 이미지 응답에 이 파싱 규칙을 사용하세요:

이미지-투-이미지 생성

입력 이미지를 업로드하고 텍스트 프롬프트로 변환하세요.
  • Python SDK는 PIL.Image 객체를 직접 받을 수 있으므로 수동 Base64 인코딩이 필요하지 않습니다.
  • 원시 Base64 문자열을 전달할 때는 data:image/jpeg;base64, 접두사를 포함하지 마세요.

다중 이미지 합성

여러 입력 이미지로부터 새로운 이미지를 생성합니다. CometAPI는 두 가지 접근 방식을 지원합니다:

방법 1: 단일 콜라주 이미지

여러 원본 이미지를 하나의 콜라주로 결합한 다음, 원하는 출력을 설명합니다.
입력 콜라주 예시
생성된 출력

방법 2: 여러 개의 개별 이미지(최대 14개)

여러 이미지를 직접 전달합니다. Gemini 3 모델은 최대 14개의 참조 이미지(객체 + 캐릭터)를 지원합니다:
다중 이미지 생성 결과

4K 이미지 생성

고해상도 출력을 위해 aspect_ratioimage_size를 포함한 image_config를 지정하세요:
고해상도 요청의 경우 마지막 비생각(non-thought) 이미지 part를 기준으로 출력을 판단하세요. 통합에서 첫 번째 inlineData part를 저장하면 요청한 imageSize보다 해상도가 낮은 중간 thought 이미지를 저장할 수 있습니다.

멀티턴 이미지 편집 (채팅)

이미지를 반복적으로 다듬으려면 SDK의 채팅 기능을 사용하세요:

스타일 키워드(예: “cyberpunk, film grain, low contrast”), 종횡비, 피사체, 배경, 조명, 디테일 수준을 구체적으로 지정하세요.
raw HTTP를 사용할 때는 data:image/png;base64, 접두사를 포함하지 말고, raw Base64 문자열만 사용하세요. Python SDK는 PIL.Image 객체를 사용해 이를 자동으로 처리합니다.
텍스트 없이 이미지 출력만 보장하려면 "responseModalities"["IMAGE"]로만 설정하세요.
코드가 중간 thought 이미지를 저장했는지 확인하세요. Gemini 이미지 응답에는 thoughttrue인 image part가 포함될 수 있으며, 이것은 최종 출력이 아닙니다. thought: true part는 건너뛰고, inlineData가 존재하며 thoughttrue가 아닌 마지막 image part를 저장하세요. 텍스트 출력이 필요 없다면 "responseModalities": ["IMAGE"]를 요청해 텍스트/이미지 혼합 응답 처리를 줄일 수 있습니다.
자세한 내용은 API Reference를 참고하세요. 공식 문서: Nano Banana image generation