Skip to main content
本指南示範如何透過 CometAPI 使用 Google Gen AI SDK 操作 Gemini 圖像模型。內容涵蓋:
  • 文字生圖
  • 圖生圖編輯
  • 多圖合成
  • 儲存產生的圖片
  • Base URL: https://api.cometapi.com
  • 安裝 SDK:pip install google-genai(Python)或 npm install @google/genai(Node.js)

設定

使用 CometAPI 的 base URL 初始化 client:

文字轉圖片生成

根據文字 Prompt 生成圖片並將其儲存到檔案中。
儲存最終圖片部分: 圖片資料位於 candidates[0].content.parts 中,其中可能包含文字和/或圖片部分。Gemini 圖片模型也可能在最終圖片之前回傳中間 thought 部分,特別是在你同時要求文字與圖片,或明確啟用 thinking 輸出時。不要盲目儲存第一個 inlineData;請略過 thoughttrue 的部分,然後儲存最後一個剩餘的圖片部分。 僅包含最終圖片的典型回應:
包含文字部分、中間 thought 圖片,以及最終圖片的回應:
對每個 Gemini 圖片回應都使用這個解析規則:

圖生圖生成

上傳輸入影像,並使用文字提示詞對其進行轉換。
  • Python SDK 可直接接受 PIL.Image 物件——不需要手動進行 Base64 編碼。
  • 傳遞原始 Base64 字串時,不要包含 data:image/jpeg;base64, 前綴。

多圖合成

從多張輸入圖片產生一張新圖片。CometAPI 支援兩種方式:

方法 1:單一拼貼圖片

將多張來源圖片合併為一張拼貼圖,然後描述期望的輸出結果。
輸入拼貼範例
生成輸出

方法 2:多張獨立圖片(最多 14 張)

直接傳入多張圖片。Gemini 3 模型最多支援 14 張參考圖片(物件 + 角色):
多圖生成結果

4K 圖像生成

指定具有 aspect_ratioimage_sizeimage_config,以輸出高解析度結果:
對於高解析度請求,請以最後一個非 thought 的圖像部分作為輸出判斷依據。如果你的整合會儲存第一個 inlineData 部分,可能會存到中間的 thought 圖像,其解析度會低於所要求的 imageSize

多輪圖像編輯(聊天)

使用 SDK 的聊天功能來逐步精修圖像:

提示

請明確指定風格關鍵字(例如:「cyberpunk、film grain、low contrast」)、長寬比、主體、背景、光線與細節層級。
使用原始 HTTP 時,請不要包含 data:image/png;base64, 前綴 — 只使用原始 Base64 字串。Python SDK 會透過 PIL.Image 物件自動處理這一點。
"responseModalities" 僅設為 ["IMAGE"],即可保證只輸出圖片而不含文字。
請檢查你的程式碼是否儲存了中間 thought 圖片。Gemini 圖片回應可能包含 thoughttrue 的圖片部分;這些不是最終輸出。請略過 thought: true 的部分,並儲存最後一個存在 inlineDatathought 不為 true 的圖片部分。如果你不需要文字輸出,請求 "responseModalities": ["IMAGE"] 可減少混合文字/圖片回應的處理。
如需更多詳細資訊,請參閱 API 參考文件 官方文件: Nano Banana image generation