Skip to main content
Hướng dẫn này minh họa cách sử dụng các model hình ảnh Gemini thông qua CometAPI bằng Google Gen AI SDK. Nội dung bao gồm:
  • Tạo ảnh từ văn bản
  • Chỉnh sửa ảnh từ ảnh
  • Ghép nhiều hình ảnh
  • Lưu hình ảnh được tạo
  • Base URL: https://api.cometapi.com
  • Cài đặt SDK: pip install google-genai (Python) hoặc npm install @google/genai (Node.js)

Thiết lập

Khởi tạo client với base URL của CometAPI:

Tạo ảnh từ văn bản

Tạo một hình ảnh từ prompt văn bản và lưu nó vào một tệp.
Lưu phần ảnh cuối cùng: Dữ liệu hình ảnh nằm trong candidates[0].content.parts, có thể chứa các phần văn bản và/hoặc hình ảnh. Các model hình ảnh Gemini cũng có thể trả về các phần suy nghĩ trung gian trước hình ảnh cuối cùng, đặc biệt khi bạn yêu cầu cả văn bản và hình ảnh hoặc bật rõ ràng đầu ra thinking. Không nên lưu inlineData đầu tiên một cách máy móc; hãy bỏ qua các phần có thoughttrue, rồi lưu phần ảnh còn lại cuối cùng. Phản hồi điển hình chỉ có hình ảnh cuối cùng:
Phản hồi có một phần văn bản, một ảnh suy nghĩ trung gian và hình ảnh cuối cùng:
Sử dụng quy tắc phân tích này cho mọi phản hồi hình ảnh Gemini:

Tạo ảnh từ ảnh

Tải lên một ảnh đầu vào và biến đổi nó bằng một Prompt văn bản.
  • SDK Python chấp nhận trực tiếp các đối tượng PIL.Image — không cần mã hóa Base64 thủ công.
  • Không thêm tiền tố data:image/jpeg;base64, khi truyền các chuỗi Base64 thô.

Tổ hợp nhiều ảnh

Tạo một hình ảnh mới từ nhiều hình ảnh đầu vào. CometAPI hỗ trợ hai cách tiếp cận:

Phương pháp 1: Một ảnh ghép duy nhất

Kết hợp nhiều ảnh nguồn thành một ảnh ghép, sau đó mô tả đầu ra mong muốn.
Ví dụ ảnh ghép đầu vào
Đầu ra được tạo

Phương pháp 2: Nhiều ảnh riêng biệt (tối đa 14)

Truyền trực tiếp nhiều ảnh. Các model Gemini 3 hỗ trợ tối đa 14 ảnh tham chiếu (đối tượng + nhân vật):
Kết quả tạo từ nhiều ảnh

Tạo ảnh 4K

Chỉ định image_config với aspect_ratioimage_size để có đầu ra độ phân giải cao:
Với các yêu cầu độ phân giải cao, hãy đánh giá đầu ra dựa trên phần ảnh không phải thought cuối cùng. Nếu tích hợp của bạn lưu phần inlineData đầu tiên, nó có thể lưu một ảnh thought trung gian có độ phân giải thấp hơn imageSize được yêu cầu.

Chỉnh sửa ảnh nhiều lượt (chat)

Sử dụng tính năng chat của SDK để tinh chỉnh ảnh theo từng bước lặp:

Mẹo

Chỉ định các từ khóa về phong cách (ví dụ: “cyberpunk, film grain, low contrast”), tỷ lệ khung hình, chủ thể, nền, ánh sáng và mức độ chi tiết.
Khi sử dụng HTTP thô, không bao gồm tiền tố data:image/png;base64, — chỉ dùng chuỗi Base64 thô. Python SDK tự động xử lý việc này với các đối tượng PIL.Image.
Đặt "responseModalities" thành chỉ ["IMAGE"] để đảm bảo đầu ra là hình ảnh mà không có văn bản.
Kiểm tra xem mã của bạn có lưu một hình ảnh thought trung gian hay không. Phản hồi hình ảnh của Gemini có thể bao gồm các phần hình ảnh mà thoughttrue; đây không phải là đầu ra cuối cùng. Hãy bỏ qua các phần thought: true và lưu phần hình ảnh cuối cùng nơi inlineData tồn tại và thought không phải là true. Nếu bạn không cần đầu ra văn bản, hãy yêu cầu "responseModalities": ["IMAGE"] để giảm việc xử lý phản hồi hỗn hợp văn bản/hình ảnh.
Để biết thêm chi tiết, xem API Reference. Tài liệu chính thức: Tạo hình ảnh Nano Banana