Skip to main content
يوضح هذا الدليل كيفية استخدام نماذج صور Gemini عبر CometAPI باستخدام Google Gen AI SDK. ويغطي ما يلي:
  • إنشاء الصور من النص
  • تحرير الصور من صورة إلى صورة
  • تركيب عدة صور
  • حفظ الصور المُنشأة
  • Base URL: https://api.cometapi.com
  • ثبّت SDK: pip install google-genai (Python) أو npm install @google/genai (Node.js)

الإعداد

هيّئ العميل باستخدام Base URL الخاص بـ CometAPI:

توليد الصور من النص

أنشئ صورة من Prompt نصي واحفظها في ملف.
احفظ جزء الصورة النهائي: توجد بيانات الصورة في candidates[0].content.parts، والتي قد تحتوي على أجزاء نصية و/أو أجزاء صور. يمكن لنماذج صور Gemini أيضًا إرجاع أجزاء thought وسيطة قبل الصورة النهائية، خاصةً عند طلب كل من النصوص والصور أو عند تمكين مخرجات التفكير صراحةً. لا تحفظ أول inlineData بشكل أعمى؛ تخطَّ الأجزاء التي يكون فيها thought مساويًا لـ true، ثم احفظ آخر جزء صورة متبقٍّ. استجابة نموذجية تحتوي على الصورة النهائية فقط:
استجابة تحتوي على جزء نصي، وصورة thought وسيطة، والصورة النهائية:
استخدم قاعدة التحليل هذه لكل استجابة صورة من Gemini:

توليد صورة إلى صورة

حمّل صورة إدخال وحوّلها باستخدام Prompt نصي.
  • تقبل Python SDK كائنات PIL.Image مباشرةً — ولا حاجة إلى ترميز Base64 يدويًا.
  • لا تُضمّن البادئة data:image/jpeg;base64, عند تمرير سلاسل Base64 الخام.

تركيب صور متعددة

أنشئ صورة جديدة من عدة صور إدخال. يدعم CometAPI نهجين:

الطريقة 1: صورة كولاج واحدة

اجمع عدة صور مصدر في صورة كولاج واحدة، ثم صف المخرجات المطلوبة.
مثال على صورة الكولاج المُدخلة
المخرجات المُولَّدة

الطريقة 2: عدة صور منفصلة (حتى 14)

مرّر عدة صور مباشرة. تدعم نماذج Gemini 3 حتى 14 صورة مرجعية (عناصر + شخصيات):
نتيجة توليد صور متعددة

توليد صور 4K

حدّد image_config باستخدام aspect_ratio وimage_size للحصول على مخرجات عالية الدقة:
بالنسبة إلى الطلبات عالية الدقة، قيّم المخرجات بالاعتماد على جزء الصورة النهائي غير المصنّف كـ thought. إذا كان التكامل لديك يحفظ أول جزء inlineData، فقد يحفظ صورة thought وسيطة بدقة أقل من imageSize المطلوب.

تحرير الصور متعدد الأدوار (الدردشة)

استخدم ميزة الدردشة في SDK لتحسين الصور بشكل تكراري:

نصائح

حدّد كلمات مفتاحية للأسلوب (مثل “cyberpunk, film grain, low contrast”)، ونسبة الأبعاد، والموضوع، والخلفية، والإضاءة، ومستوى التفاصيل.
عند استخدام HTTP الخام، لا تُضمّن البادئة data:image/png;base64, — استخدم فقط سلسلة Base64 الخام. يتولى Python SDK هذا تلقائيًا باستخدام كائنات PIL.Image.
اضبط "responseModalities" على ["IMAGE"] فقط لضمان إخراج صورة من دون نص.
تحقق مما إذا كان الكود الخاص بك قد حفظ صورة تفكير وسيطة. قد تتضمن استجابات صور Gemini أجزاء صور يكون فيها thought مساويًا لـ true؛ وهذه ليست المخرجات النهائية. تخطَّ الأجزاء التي فيها thought: true واحفظ آخر جزء صورة يوجد فيه inlineData ولا يكون thought فيه مساويًا لـ true. إذا لم تكن بحاجة إلى إخراج نصي، فاطلب "responseModalities": ["IMAGE"] لتقليل التعامل مع الاستجابات المختلطة من نص/صورة.
لمزيد من التفاصيل، راجع مرجع API. الوثائق الرسمية: إنشاء الصور باستخدام Nano Banana