باختصار
- يمكن لـ Veo 3.1 في Gemini API إنشاء فيديو مدته 8 ثوانٍ؛ وتُذكر خيارات دقة 720p و1080p و4K.
- وفقًا لدليل Gemini API، يمكن إنشاء فيديو بتحديد الإطارين الأول والأخير، وإطالة فيديو، واستخدام ما يصل إلى 3 صور مرجعية.
- في أمثلة Vertex AI، تُقدَّم الصورة كمدخل عبر URI في Cloud Storage.
- تختلف خيارات API والنماذج باختلاف المنصة المستخدمة، لذا لا ينبغي نسخ نص الطلب كما هو إلى خدمة أخرى.
ما الذي ستتعلمه في هذا الدليل؟
نتناول في هذا الدليل المراحل الأساسية لتحويل صورة معمارية إلى مقطع عرض متحرك باستخدام Veo 3.1. والهدف هو إعداد تجربة فيديو قصيرة من خلال وصف حركة الكاميرا والحركة المحيطة في صورة ثابتة لمساحة داخلية أو مبنى. ويمكن الاستفادة من الأمثلة في عروض المشاريع، أو شرح التصورات، أو تقييم البدائل خلال عملية التصيير. لا يحل المقطع الناتج محل الرسم الفني أو المشروع المعتمد؛ بل هو مسودة للعرض البصري.
يوضح دليل Gemini API إمكانية إنشاء فيديو مدته 8 ثوانٍ باستخدام Veo 3.1، وخيارات دقة 720p و1080p و4K، وإنشاء الصوت محليًا. كما يسرد ميزات إنشاء الفيديو باستخدام الإطارين الأول والأخير، وإطالة فيديو أُنشئ مسبقًا، وتوجيه الإنشاء باستخدام ما يصل إلى 3 صور مرجعية. تستند هذه المعلومات إلى وثائق Gemini API، ولا ينبغي افتراض أن جميع الخيارات متاحة بالطريقة نفسها في كل منتج.
المتطلبات: المنصة وإمكانية الوصول
ينبغي التمييز بين مساري API منفصلين:
Gemini API: يستخدم مثال Veo 3.1 الوارد في الوثائق واجهة
generateContentAPI. ويَرِد اسم النموذج في الأمثلة بصيغةveo-3.1-generate-preview. ويتطلب طلب API استخدام مفتاح Gemini API.Vertex AI: يتطلب مشروع Google Cloud، وتفعيل Agent Platform API، وإعداد المصادقة المناسبة. يستخدم مثال إنشاء الفيديو من صورة في الوثائق النموذج
gemini-omni-1.1-flash-previewوصورة URI في Cloud Storage؛ كما تسرد الصفحة نفسها معرّفات نماذج Veo 3.1.
لا يمكن استخدام أسماء هذه النماذج وبُنى الطلبات بالتبادل. حدّد أولًا واجهة API التي ستستخدمها، ثم اتبع معرّف النموذج وطلب المثال الواردين في الوثائق الحالية لتلك المنصة. عند استخدام Vertex AI، جهّز صورة يمكن الوصول إليها في Cloud Storage. وتشير الوثائق إلى أن الوصول إلى خدمات Google Cloud عبر وحدة التحكم لا يتطلب إعداد المصادقة بشكل منفصل، بينما يمكن استخدام بيانات اعتماد gcloud CLI مع أمثلة REST.
خطوة بخطوة: من صورة معمارية إلى مقطع فيديو
اختر صورة بداية مناسبة للحركة. ابدأ بإطار يتضمن زاوية رؤية رئيسية واحدة ويسهل فيه تحديد العنصر الذي تريد إبرازه. على سبيل المثال، يمكن أن يجمع تصيير داخلي بين منطقة الجلوس والنافذة وضوء النهار ضمن التكوين نفسه. بدلًا من محاولة تحريك كل شيء في الصورة في آن واحد، حدّد ما تريد أن يركز عليه المشاهد في المقطع.
صِف حركة الكاميرا كفعل واحد. اختر اتجاهًا واضحًا، مثل «حرّك الكاميرا ببطء إلى عمق المساحة». ثم اذكر العناصر التي ينبغي أن تبقى ثابتة، مثل الحفاظ على شكل الجدران والأثاث والفتحات، مع إظهار حركة خفيفة للستارة. هذه طريقة لصياغة الوصف تساعد النموذج على فهم العناصر التي ينبغي أن تظل ثابتة في الفيديو، لكنها لا تضمن نتيجة محددة.
استخدم في التجربة الأولى مطالبة نصية قصيرة ومحددة. المثال التالي مطالبة معمارية جديدة الصياغة:
A calm architectural visualization of a contemporary living room, based on the input image. The camera slowly moves forward toward the seating area. Preserve the room layout, wall openings, furniture positions, materials, and proportions. Soft daylight shifts gently across the floor; sheer curtains move slightly in a natural breeze. No people, no new objects, no sudden camera movement. Quiet, realistic atmosphere.يفصل هذا الوصف بين اتجاه الكاميرا والعناصر المكانية التي ينبغي الحفاظ عليها والحركة الطفيفة المسموح بها. إذا تغيرت الهندسة أو التكوين في النتيجة الأولى على نحو غير مرغوب فيه، فبسّط المطالبة وقلّل الحركة ثم أعد المحاولة.
أرسل مدخل الصورة وخيارات الفيديو المتوافقة مع API. في مثال Vertex AI، تُضاف الصورة إلى مدخل الطلب باستخدام URI في Cloud Storage ونوع MIME؛ كما تتضمن إعدادات إخراج الفيديو حقولًا لنسبة العرض إلى الارتفاع والدقة والمدة. وفي مثال Gemini Omni، تُحدَّد المدة بقيمة عدد صحيح بين 3 و10، ووحدة القياس هي الثواني. لا تخلط هذه الإعدادات بإعدادات Veo 3.1 في Gemini API: إذ يوضح دليل Gemini API أن مدة إخراج Veo 3.1 هي 8 ثوانٍ.
أعد الإنشاء مع تغيير متغير واحد. بعد النتيجة الأولى، بدلًا من تغيير الكاميرا والإضاءة والحركة في المشهد في الوقت نفسه، عدّل عنصرًا واحدًا فقط. في التجربة الثانية، يمكنك تقليل حركة الكاميرا؛ وفي تجربة أخرى، إزالة تغيّر الإضاءة. يساعدك ذلك على معرفة الوصف الذي يوجّه الصورة على نحو أفضل.
استخدم الميزة المناسبة إذا احتجت إلى انتقال بين الإطارات أو إلى مراجع. يذكر دليل Gemini API إنشاء الفيديو باستخدام الإطارين الأول والأخير واستخدام ما يصل إلى 3 صور مرجعية ضمن الإمكانات المدعومة. وقد تكون هذه الخيارات مفيدة في سير العمل الذي يستند إلى مظهر ابتدائي وختامي أو إلى مراجع بصرية. لكن تحقّق من الوثائق الحالية للتأكد من إتاحة هذه الإمكانات في النموذج وواجهة API المختارين.
أخطاء شائعة
دمج أمثلة من واجهات API مختلفة: طلب
interactionsفي صفحة Vertex AI ليس له مخطط الطلب نفسه المستخدم في مثال Veo 3.1 على Gemini API. احرص على اتساق معرّف النموذج والمصادقة والمعلمات مع المنصة التي اخترتها.إضفاء الحركة على كل عناصر الصورة: في العرض المعماري، وضّح صراحةً السمات المتوقع الحفاظ عليها، مثل تخطيط الغرفة ومواقع الأثاث. ويُعد حصر الحركة في العناصر التي تحددها في المطالبة تجربة أكثر ضبطًا للحفاظ على تماسك الصورة.
استخدام خيارات المدة مع نموذج غير مناسب: يتضمن مثال Gemini Omni في Vertex AI مدة تتراوح بين 3 و10 ثوانٍ، بينما يصف دليل Gemini API نموذج Veo 3.1 بأنه ينتج فيديو مدته 8 ثوانٍ. لا تنقل معلمة من واجهة API إلى أخرى.
اعتبار الإنشاء الأول صورة معتمدة للمشروع: ينشئ الفيديو تفسيرًا متحركًا انطلاقًا من الصورة المصدر. قبل استخدام النتيجة في عرض تقديمي، تحقّق من الحفاظ على قرارات التصميم والتفاصيل المكانية.
افتراض أن كل ميزة متاحة في كل مكان: قد تختلف طريقة إتاحة بعض إمكانات Veo 3.1 بين Gemini API وVertex AI والمنتجات الأخرى. راجع وثائق المنصة المختارة قبل إرسال الطلب.
مكانه في سير عمل العمارة والتصوير المعماري
قد تكون هذه الطريقة مفيدة خصوصًا للتجارب الأولية لفرق العمارة والتصميم الداخلي التي ترغب في عرض تصيير مكتمل من خلال حركة كاميرا قصيرة. ويمكن للطلاب أيضًا مقارنة أوصاف حركة مختلفة باستخدام الصورة نفسها. من جهة أخرى، يتطلب الأمر الاستعداد لإمكانية الوصول إلى API وإعداد الحساب والمشروع؛ ولأن المصادر لا تحدد سعر الاستخدام الحالي أو شروط وصول تنطبق على كل مستخدم، ينبغي التحقق مسبقًا من التكلفة وإمكانية الوصول. كذلك لا تحدد المصادر متطلبات عتاد بعينه أو شرطًا لاستخدام GPU محلي؛ إذ تصف سير العمل عبر واجهات API سحابية.
الخطوات التالية
ابدأ بتجربة واحدة باستخدام تصيير واحد وحركة كاميرا واحدة. ثم قارن النتائج من خلال تغيير عنصر واحد فقط في المشهد نفسه. إذا كنت بحاجة إلى استخدام عدة إطارات أو مراجع، فتحقّق من دعم ذلك في API والنموذج المختارين. عند العمل عبر Vertex AI، اتبع خطوات المشروع وتفعيل API وCloud Storage؛ أما عند العمل عبر Gemini API، فاتبع طلب المثال الخاص بـ Veo 3.1. وأخيرًا، قارن المقطع الناتج بصورة المشروع جنبًا إلى جنب لتقييم أي تغيّرات محتملة في الشكل والفتحات وتوزيع الأثاث.
المصدر والترخيص
أُعد هذا الدليل بالاستناد إلى المعلومات الواردة في دليل Google Cloud لإنشاء الفيديو من صورة ووثائق Veo 3.1 المنشورة على Google AI for Developers. وكلا المصدرين مرخّص بموجب CC BY 4.0. كما استُخدمت أوصاف صفحة منتج Veo لتوضيح خصائصه ضمن سياقها.
المصادر
3 مصادرلا نعيد نشر نصوص المصادر؛ الاقتباسات القصيرة مشار إليها، وما تبقى ملخص وتعليق من إعدادنا.
تكمن القيمة العملية لهذا النهج بالنسبة إلى مكاتب العمارة وفرق التصوير المعماري في إمكانية استخلاص مسودة سرد بصري متحرك قصير من تصيير موجود. وقد تساعد إضافة حركة كاميرا إلى إطار ثابت على توضيح الفكرة، ولا سيما في عروض التصورات؛ لكن ينبغي عدم التعامل مع النتيجة على أنها سجل موثّق لهندسة المشروع.
من المناسب أن تتحقق الفرق في تركيا، قبل التجربة، من إمكانية الوصول إلى API وتكلفة الاستخدام ونطاق الميزات على المنصة المختارة؛ فالمصادر لا تتضمن معلومات عن الأسعار. ولأن سير العمل موضح عبر واجهات API سحابية، لم يُذكر متطلب محدد لبطاقة رسوميات محلية. وتتمثل البداية الأكثر أمانًا في مراجعة النتائج باستخدام إطار واحد وحركة محدودة.
الأسئلة الشائعة
ما مدة الفيديو ودقته عند إنشائه باستخدام Veo 3.1؟
تشير وثائق Gemini API إلى فيديو مدته 8 ثوانٍ باستخدام Veo 3.1، مع خيارات دقة 720p أو 1080p أو 4K.
هل يمكن لـ Veo 3.1 إنشاء فيديو من صور معمارية؟
يتضمن دليل Gemini API ميزات التوجيه بالصور، والإنشاء باستخدام الإطارين الأول والأخير، واستخدام ما يصل إلى 3 صور مرجعية. ينبغي التحقق من الخيارات المتاحة بحسب API والنموذج المختارين.
هل أحتاج إلى مشروع Google Cloud لاستخدام Veo 3.1؟
يتطلب مثال Vertex AI مشروع Google Cloud وتفعيل Agent Platform API. أما Gemini API فهو مسار منفصل للوصول إلى API.



