Skip to main content
本指南演示如何通过 CometAPI 使用 Google Gen AI SDK 调用 Gemini 图像模型。内容包括:
  • 文生图
  • 图像到图像编辑
  • 多图合成
  • 保存生成的图像
  • Base URL: https://api.cometapi.com
  • 安装 SDK:pip install google-genai(Python)或 npm install @google/genai(Node.js)

设置

使用 CometAPI 的 base URL 初始化客户端:

文本转图像生成

根据文本 Prompt 生成图像并将其保存到文件中。
保存最终图像部分: 图像数据位于 candidates[0].content.parts 中,其中可能同时包含文本部分和/或图像部分。Gemini 图像模型也可能在最终图像之前返回中间 thought 部分,尤其是在你同时请求文本和图像,或者显式启用 thinking 输出时。不要盲目保存第一个 inlineData;应跳过 thoughttrue 的部分,然后保存最后一个剩余的图像部分。 仅包含最终图像的典型响应:
包含文本部分、中间 thought 图像以及最终图像的响应:
对每个 Gemini 图像响应都使用这条解析规则:

图生图生成

上传输入图像,并使用文本提示词对其进行转换。
  • Python SDK 可直接接受 PIL.Image 对象——无需手动进行 Base64 编码。
  • 传递原始 Base64 字符串时,不要包含 data:image/jpeg;base64, 前缀。

多图像合成

基于多个输入图像生成一张新图像。CometAPI 支持两种方式:

方法 1:单张拼贴图像

将多个源图像合并为一张拼贴图,然后描述期望的输出。
输入拼贴示例
生成结果

方法 2:多张独立图像(最多 14 张)

直接传入多张图像。Gemini 3 模型最多支持 14 张参考图像(物体 + 角色):
多图像生成结果

4K 图像生成

指定带有 aspect_ratioimage_sizeimage_config 以获得高分辨率输出:
对于高分辨率请求,请以最后一个非 thought 的图像 part 作为输出判断依据。如果你的集成保存的是第一个 inlineData part,则可能会保存一个中间 thought 图像,其分辨率会低于请求的 imageSize

多轮图像编辑(聊天)

使用 SDK 的聊天功能来迭代优化图像:

提示

明确指定风格关键词(例如 "cyberpunk, film grain, low contrast")、宽高比、主体、背景、光照和细节级别。
使用原始 HTTP 时,不要包含 data:image/png;base64, 前缀——只使用原始 Base64 字符串。Python SDK 会通过 PIL.Image 对象自动处理这一点。
"responseModalities" 仅设置为 ["IMAGE"],以保证只输出图像而不输出文本。
检查你的代码是否保存了中间思考图像。Gemini 图像响应可能包含 thoughttrue 的图像部分;这些不是最终输出。请跳过 thought: true 的部分,并保存最后一个存在 inlineDatathought 不为 true 的图像部分。如果你不需要文本输出,请请求 "responseModalities": ["IMAGE"],以减少处理文本/图像混合响应的复杂度。
更多详情,请参阅 API 参考 官方文档: Nano Banana 图像生成