باختصار
- يدعم FLUX 3 Image توليد الصور من النص، وتعديلها، ودمج ما يصل إلى 10 صور مرجعية، كل ذلك عبر طلب POST واحد.
- تُعرَّف صناديق الإحاطة (bounding box) بإحداثيات [الأعلى، اليسار، الأسفل، اليمين] ضمن شبكة من 0 إلى 1000 لتحديد موقع كل عنصر.
- معامل Grounding مفعّل افتراضيًا، إذ يبحث النموذج على الويب لإنتاج الأجسام الحقيقية بدقة؛ وعند تعطيله تكون النتيجة أسرع لكنها تعتمد فقط على النص.
- يمكن اختيار الدقة بين 768sq و4k، ويجب تنزيل النتيجة عبر polling_url خلال ساعة واحدة من وصولها إلى حالة Ready.
FLUX 3 Image هو عنصر توليد وتعديل الصور ضمن عائلة FLUX 3 من Black Forest Labs، ويوفر عبر نقطة نهاية واحدة في واجهة البرمجة توليد الصور من النص، وتعديل صورة موجودة، ودمج عدة صور مرجعية، والتحكم بالتكوين عبر صناديق الإحاطة. يشرح هذا الدليل خطوة بخطوة هذه الاستخدامات الأربعة الأساسية لمن يرغب في إنتاج صور عرض معمارية وتصاميم داخلية.
ما ستتعلمه
باتباع هذا الدليل، ستتعرف على كيفية توليد واجهة خارجية أو مشهد داخلي معماري من الصفر عبر النص، وكيفية تغيير تفصيل واحد فقط في عرض موجود (مادة، إضاءة، أثاث)، وكيفية دمج صورة ميدانية مع جسم مرجعي، وكيفية تثبيت موقع كل عنصر في التكوين باستخدام صناديق الإحاطة.
المتطلبات
مفتاح واجهة برمجة تطبيقات Black Forest Labs (يُرسَل في ترويسة الطلب باسم
x-key)الوصول إلى نقطة النهاية
POST https://api.bfl.ai/v1/flux-3-image؛ المعامل الإلزامي الوحيد هوpromptلمن يرغب في استخدام مراجع: من 1 إلى 10 صور (رابط URL أو base64، بين 256×256 بكسل و16 ميجابكسل)
اختيار
aspect_ratio(نسب متعددة من 21:9 إلى 9:21 أوauto)اختيار
resolution:768sq،1k،1.5k،2kأو4kمعرفة بمعاملي
safety_tolerance(0 الأكثر صرامة، 4 الأكثر مرونة، الافتراضي 2) وgrounding(مفعّل افتراضيًا)
الاستخدام خطوة بخطوة
1. التوليد من النص إلى الصورة
لتوليد مشهد معماري من الصفر، يجب كتابة معلومات الموضوع والمكان والإضاءة والتأطير بوضوح. يُنشئ FLUX 3 Image المشهد كاملًا من نص واحد.
Contemporary single-family house exterior at golden hour, board-formed concrete facade, large glazed corner window, cantilevered wooden canopy, landscaped garden in foreground, soft warm sunlight, photorealistic architectural visualization, wide-angle framingيساعد هذا النص النموذج على بناء المشهد بانسجام لأنه يجمع بين معلومات المواد (الخرسانة، الزجاج، الخشب)، وحالة الإضاءة (غروب الشمس)، والتأطير (زاوية واسعة).
2. تعديل صورة موجودة
لتغيير تفصيل واحد فقط في عرض موجود، يجب صياغة التعليمة بحيث تسمي العنصر المراد تغييره بوضوح؛ وكل ما لم يُذكر في النص يبقى كما هو.
Change the facade cladding material from board-formed concrete to vertical timber slats, keep the window layout, lighting, and landscaping unchangedيناسب هذا الأسلوب المكاتب التي تريد اختبار متغيّر واحد فقط، مثل مادة الواجهة، مع الحفاظ على التكوين نفسه.
3. دمج صور مرجعية متعددة
يمكن تحميل ما يصل إلى 10 صور مرجعية، مع الإشارة إلى موقع كل صورة ودورها. فعلى سبيل المثال يمكن أن توفر صورة ميدانية المشهد، وتوفر صورة ثانية الأثاث المراد إضافته إلى المشهد.
Use image 1 as the existing living room interior and image 2 as the armchair reference. Place the armchair from image 2 into the corner of the room shown in image 1, matching the room's existing light and perspectiveيمكن استخدام هذه التقنية لوضع صورة أثاث من كتالوج أرسله العميل داخل صورة مكان داخلي موجودة بشكل واقعي.
4. التحكم بالتكوين عبر صناديق الإحاطة
تُضاف صناديق الإحاطة في نهاية النص لتحديد موقع كل عنصر في المشهد بإحداثيات [الأعلى، اليسار، الأسفل، اليمين] ضمن شبكة من 0 إلى 1000. يمكن استخدام الصناديق نفسها أيضًا لإعادة تلوين جزء واحد فقط من المشهد (مثل قطعة أثاث واحدة) أو نقله أو إزالته.
Open-plan office interior with a reception desk and a seating area. Reception desk at [100, 50, 400, 500]. Seating area with two armchairs at [450, 550, 850, 950]بفضل صناديق الإحاطة، يمكن للمصمم التحكم مباشرة في توزيع قريب من مخطط الموقع أثناء مرحلة توليد الصورة.
5. استخدام إعداد Grounding
معامل Grounding مفعّل افتراضيًا، ويبحث النموذج على الويب لإنتاج الأجسام الواقعية بدقة أكبر؛ وعند تعطيله (grounding: false) تُنتَج النتيجة بشكل أسرع اعتمادًا فقط على نص الطلب. إذا كانت دقة منتج أو علامة تجارية معينة مهمة، يُفضَّل إبقاء Grounding مفعّلًا، أما في التجارب المفاهيمية السريعة فيمكن تعطيله.
أخطاء شائعة
التوليد دون تحديد نسبة العرض إلى الارتفاع؛ فعند غياب المرجع يعود النموذج إلى نسبة
1:1، وهو أمر قد لا يناسب أطر الواجهات الخارجية الواسعة.عدم تحديد ما لن يتغير في نصوص التعديل؛ مما قد يدفع النموذج لتغيير عناصر أكثر من اللازم.
كتابة إحداثيات صناديق الإحاطة بوحدة بكسل بدلًا من شبكة 0-1000.
محاولة تنزيل النتيجة قبل أن تصبح حالة
statusفيpolling_urlمساوية لـReady، أو محاولة الحصول عليها بعد انتهاء مهلة التنزيل البالغة ساعة واحدة.تكديس عدد كبير من الصور المرجعية (حتى 10) في نص واحد دون الإشارة إلى كل صورة على حدة؛ إذ يجب ذكر موقع كل صورة بوضوح.
الخطوات التالية
يمكن استخدام Playground المستند إلى المتصفح للتجربة دون كتابة كود؛ ومن يرغب في تعميق فهم بنية النصوص للمشهد والأسلوب وتوليد النصوص يمكنه الرجوع إلى دليل الكتابة الرسمي (prompting guide)، ومن يريد تفصيل استخدام صناديق الإحاطة يمكنه مراجعة توثيق bounding box. كما ينبغي مراجعة مرجع API لمعرفة جميع معاملات الطلب وأكواد الأخطاء.
المصدر والترخيص
أُعِدَّ هذا الدليل استنادًا إلى معلومات المعاملات ونقاط النهاية الواردة في التوثيق الرسمي لواجهة برمجة التطبيقات الخاصة بـ Black Forest Labs (docs.bfl.ai، FLUX 3 Image Overview)، إضافة إلى الأوصاف العامة للقدرات الواردة في صفحات المنتج الرسمية (bfl.ai)؛ وقد كُتبت نصوص الأمثلة بشكل أصلي لتناسب سيناريوهات الاستخدام المعماري والداخلي.
المصادر
3 مصادرلا نعيد نشر نصوص المصادر؛ الاقتباسات القصيرة مشار إليها، وما تبقى ملخص وتعليق من إعدادنا.
بالنسبة إلى المكاتب في تركيا، الجانب الأكثر عملية في FLUX 3 Image هو إمكانية توليد الصور من الصفر وتنفيذ تعديلات مستهدفة على عرض موجود عبر النقطة نفسها؛ وهذا يتيح، عند طلبات المراجعة، تغيير مادة أو قطعة أثاث واحدة بدلًا من إعادة توليد المشهد بأكمله. كما أن التحكم عبر صناديق الإحاطة قيّم بشكل خاص للمكاتب التي تريد تكوينات مطابقة لمخطط الموقع، إذ لا يُترَك التوزيع للصدفة.
مع ذلك، هناك نقاط ينبغي مراعاتها قبل الاستخدام: عدد المعاملات (مفتاح API، وaspect_ratio، وresolution، وgrounding) يتطلب معرفة تقنية، ولم تتضح بعد سياسة التسعير وإتاحة الأوزان المفتوحة (FLUX 3 Dev). وبما أن النظام لا يزال في مرحلة وصول مبكر، ينبغي أخذ احتمال تغيّر النتائج والتكاليف مع الوقت بعين الاعتبار.
الأسئلة الشائعة
كم عدد الصور المرجعية التي يمكن استخدامها في FLUX 3 Image؟
يمكن استخدام من 1 إلى 10 صور مرجعية في الطلب الواحد؛ ويجب أن تكون كل صورة بين 256×256 بكسل و16 ميجابكسل.
كيف تُعرَّف إحداثيات صناديق الإحاطة؟
تُضاف صناديق الإحاطة في نهاية النص، ويُعرَّف كل منها بالترتيب [الأعلى، اليسار، الأسفل، اليمين] ضمن شبكة من 0 إلى 1000؛ ويمكن استخدام الصناديق نفسها أيضًا لتعديل جزء محدد فقط من المشهد.
ما وظيفة معامل Grounding؟
معامل Grounding مفعّل افتراضيًا، ويبحث النموذج على الويب لإنتاج الأجسام الحقيقية بدقة؛ وعند ضبطه على false تكون النتيجة أسرع لكنها تعتمد فقط على نص الطلب.



