Dernières actualités
Utiliser les blocs dans Rhino 8 : gérer efficacement les éléments répétésCréer des vidéos d’architecture avec Gemini Omni Flash : guide de promptsCréer des coupes et des transitions de caméra dans Sequencer d’Unreal EngineGestion des couleurs dans Blender : AgX, flux linéaire et exportUtiliser V-Ray Enmesh dans 3ds Max : créer des motifs de surface répétitifsGuide pour modifier rapidement les objets d’une scène avec la console Python de BlenderBlender Geometry Nodes : Boolean et Extrude, guide de modélisation architecturaleGuide Unreal Engine Level Snapshots : gérez vos variantes de scène en toute sécuritéTransformer une image d’architecture en vidéo : guide pas à pas pour Gemini OmniVisualisation architecturale avec Unreal Engine 5.0 : Lumen, Nanite et ombres
TutorielsGemini Omni FlashGoogleVeo 3.1

Créer des vidéos d’architecture avec Gemini Omni Flash : guide de prompts

Gemini API propose Gemini Omni Flash pour générer de courtes vidéos et les retoucher par conversation, ainsi que Veo 3.1 pour prolonger une vidéo, générer à partir d’images spécifiques et produire de l’audio natif. Ce guide explique comment préparer des prompts adaptés aux scénarios de visualisation architecturale.

Scène vidéo d’architecture dans un intérieur contemporain baigné de lumière naturelleImage IA
Image d’illustration générée par IA.Image : 3dsınıfı / FCA AI

En bref

  1. Gemini Omni Flash est conçu pour générer de courtes vidéos à partir de texte et d’images, puis retoucher les résultats en plusieurs échanges.
  2. Veo 3.1 propose l’audio natif, le prolongement vidéo, la génération à partir d’images spécifiques et le guidage par image.
  3. Une tâche claire, des contraintes explicites et le format de sortie souhaité comptent parmi les éléments essentiels à la conception d’un prompt.
  4. Le guide de Google recommande d’ajouter des exemples et d’améliorer les prompts de manière itérative, en fonction des résultats.

Ce que vous allez apprendre

Nous verrons comment structurer un prompt pour transformer une scène architecturale en idée de courte vidéo, choisir entre Gemini Omni Flash et Veo 3.1 en fonction de votre flux de travail, puis affiner votre description après un premier résultat. Les exemples portent sur des scénarios de visualisation architecturale, comme la mise en valeur d’un intérieur à la lumière du jour, un mouvement de caméra le long d’une façade ou la préservation de la perception des matériaux.

Les prompts présentés ici ne sont pas des copies des exemples des sources : ce sont des propositions originales, rédigées à partir des principes documentés de consignes explicites, de contraintes, de types d’entrée et d’itération. La qualité du résultat dépendant du modèle, des entrées et des essais, considérez ces prompts comme des points de départ, et non comme une garantie de résultat.

Prérequis et choix du modèle

Ce flux de travail s’appuie sur les modèles de génération vidéo de Gemini API. Les sources présentent Gemini Omni Flash et Veo 3.1 comme des options répondant à des besoins différents. Gemini Omni Flash est recommandé comme modèle de départ général pour générer de courtes vidéos à partir de texte et d’images, ainsi que pour les retoucher par conversation en plusieurs échanges. Les sources indiquent également qu’il prend en charge simultanément les entrées image, audio et vidéo, et soulignent ses atouts en matière de cohérence des scènes et de continuité des personnages.

Envisagez Veo 3.1 lorsque vous avez besoin de prolonger une scène, de générer à partir d’une image spécifique ou d’ajouter de l’audio natif. Le modèle propose le guidage par image et la génération à partir d’images spécifiques via l’API generateContent. Pour Gemini Omni Flash, la retouche en plusieurs échanges est présentée via l’Interactions API. Ce guide ne fournit pas d’informations sur l’activation de l’accès à l’API, la tarification, les besoins matériels ou les conditions liées aux comptes ; vérifiez ces éléments dans les sources à jour correspondantes avant de commencer.

Avant de commencer, définissez la scène que vous souhaitez générer. Si vous disposez d’une image à utiliser, rédigez votre consigne de manière à ce qu’elle serve d’entrée vidéo. Si vous ne fournissez pas d’image, décrivez clairement dans le texte l’espace, la lumière, le mouvement de caméra et le résultat attendu. Les sources prennent en charge ces entrées, mais ne précisent aucune durée, résolution ou fréquence d’images ; n’ajoutez donc pas au prompt de valeurs techniques non documentées.

Préparer un prompt étape par étape

  1. Commencez par une seule tâche principale. Indiquez dès la première phrase ce que vous souhaitez que le modèle génère. Au lieu d’une demande générale comme « crée une vidéo d’intérieur », précisez l’espace à montrer et l’objectif de la vidéo. Ajoutez ensuite les détails de la scène.

Prompt
Aydınlık bir konut mutfağını gösteren kısa bir mimari görselleştirme videosu oluştur. Kamera, mutfak adasının yanından yavaşça ilerleyerek mekânın tamamını ortaya çıkarsın. Sakin bir sabah atmosferi kur; kadrajda insan gösterme.

Dans cette proposition, la tâche, l’espace, le mouvement de caméra et la contrainte de scène sont exprimés séparément. Au lieu de laisser le modèle prendre les décisions à votre place, indiquez clairement les aspects importants de la scène.

  1. Précisez quoi faire de l’image d’entrée. Si vous ajoutez une image de référence, expliquez son rôle dans le prompt : faut-il préserver l’agencement de l’espace, ou seulement s’inspirer des matériaux et de l’ambiance lumineuse ? Les sources indiquent que Gemini Omni Flash peut utiliser des images comme entrées pour la génération vidéo et que Veo 3.1 propose également le guidage par image. La proposition ci-dessous est rédigée pour un flux de travail avec image jointe.

Prompt
Eklediğim iç mekân görselini sahnenin mekânsal düzeni için referans al. Kamera oturma alanından pencereye doğru yavaşça ilerlesin. Görseldeki mobilya yerleşimini ve malzeme karakterini koru; ışık yumuşak ve doğal olsun.

Ne partez pas du principe que chaque détail d’une image sera conservé à l’identique. Examinez le premier résultat ; si l’agencement ou la perception des matériaux s’éloigne de vos attentes, indiquez clairement au tour suivant l’élément à corriger.

  1. Décrivez le mouvement de façon concrète. Pour le mouvement de caméra, précisez sa direction ainsi que le point de départ et le point d’arrivée dans la scène. Au lieu de vous limiter à des adjectifs sujets à interprétation comme « cinématographique », décrivez ce que le spectateur doit voir tout au long du cadrage.

Prompt
Bir çağdaş müze girişini dışarıdan gösteren mimari video üret. Kamera girişe doğru yavaşça yaklaşsın ve cam cephe boyunca sağa kayarak fuaye içini görünür kılsın. Yapının kütlesi kadrajda okunaklı kalsın; hareket sakin ve kesintisiz olsun.

Cet exemple définit à la fois le mouvement de caméra et l’élément architectural à rendre visible. Si le résultat interprète le mouvement différemment, corrigez uniquement la partie concernée dans la nouvelle consigne ; vous pourrez ainsi évaluer plus facilement l’effet de la modification sur la scène.

  1. Ajoutez les contraintes et le format de sortie. Préciser les éléments que vous ne souhaitez pas voir et décrire le résultat dans un format donné figurent parmi les stratégies de prompt essentielles du guide source. Pour une présentation architecturale, vous pouvez par exemple demander de ne pas ajouter de personnes dans le cadre, de ne pas modifier la forme du bâtiment ou de limiter la vidéo à une scène précise.

Prompt
Eklediğim cephe görselinden hareketli bir mimari sunum videosu oluştur. Kamera cephe boyunca yavaşça ilerlesin. Yapının ana formunu ve pencere düzenini değiştirme; yeni kat, tabela veya insan ekleme. Odak cephe malzemesi ve gün ışığının yüzeydeki etkisi olsun.

Énoncez les contraintes par ordre de priorité. Évitez les consignes contradictoires : demander à la fois une caméra fixe et un mouvement de rapprochement, par exemple, peut rendre l’objectif du modèle ambigu.

  1. Évaluez le résultat et corrigez-le au tour suivant. Gemini Omni Flash prend en charge la retouche conversationnelle en plusieurs échanges via l’Interactions API. Repérez le problème dans le premier résultat, puis décrivez clairement l’élément à corriger au lieu de réécrire tout le prompt.

Prompt
Önceki videoda kamera hareketi uygun, ancak pencere düzeni referans görselden farklılaştı. Kamera hareketini koru ve yeni üretimde pencere aralıklarını görseldeki gibi tutmaya odaklan.

Ce type de consigne de suivi distingue les caractéristiques à préserver de celles à modifier. Le guide de Google sur la conception des prompts présente le prompting comme un processus itératif et recommande d’examiner les résultats puis d’affiner les descriptions en fonction de l’usage visé.

Erreurs fréquentes

Se contenter d’adjectifs vagues : des mots comme « beau », « saisissant » ou « réaliste » ne remplacent pas une description de la scène. Précisez également l’espace, les conditions d’éclairage, le mouvement et le point focal.

Tout condenser en une seule phrase : séparez clairement la tâche, le rôle de l’image, le mouvement de caméra et les contraintes. Un prompt long ne garantit pas à lui seul un meilleur résultat ; l’essentiel est que la consigne soit claire et cohérente.

Considérer le premier résultat comme définitif : examinez le résultat du modèle et notez les problèmes séparément. Corriger un seul élément au tour suivant facilite le suivi de l’effet de chaque consigne.

Ne pas choisir le modèle en fonction du besoin : Gemini Omni Flash peut être envisagé pour la retouche en plusieurs échanges et la génération vidéo générale ; Veo 3.1, pour des besoins comme le prolongement, la génération à partir d’images spécifiques ou l’audio natif. Ne confondez pas leurs fonctionnalités et consultez la documentation actuelle de l’API avant de faire votre choix.

Étapes suivantes dans un flux de travail d’architecture et de visualisation

Pour les agences d’architecture, cette approche peut être utile pour transformer une idée d’espace ou de façade en une courte proposition de présentation animée. Les architectes d’intérieur peuvent décrire séparément la perception des matériaux et de la lumière, tandis que les artistes en visualisation peuvent préciser le mouvement de caméra et la continuité de la scène. Les étudiants peuvent comparer différentes descriptions de mouvement ou d’atmosphère à partir d’une même image de référence.

Toutefois, les sources ne fournissent aucune information sur une connexion directe à un logiciel 3D donné, le transfert de fichiers de projet, la résolution de sortie ou les prix. Ne considérez donc pas la génération vidéo comme une suite automatisée de votre processus de modélisation et de rendu actuel. Vérifiez séparément l’API à utiliser, les conditions de licence et de coût, le droit d’utilisation des images de référence ainsi que la conformité des résultats avec vos choix de conception. La génération vidéo peut offrir une autre option de présentation, mais ne remplace ni les dimensions architecturales, ni les détails d’exécution, ni la validation technique.

Sources et licence

Ce guide est une adaptation en turc réalisée à partir de la documentation de Google sur la génération vidéo avec Gemini API et de son guide sur la conception des prompts. Les deux sources sont sous licence CC BY 4.0. Les exemples de prompts architecturaux ont été rédigés spécialement à partir des techniques décrites dans ces documents.

Sources

2 sources
A(
ai.google.dev (CC BY 4.0)ai.google.dev/gemini-api/docs/video
Résumé
A(
ai.google.dev (CC BY 4.0)ai.google.dev/gemini-api/docs/prompting-strategies
Résumé

Les textes sources ne sont pas republiés ; les courtes citations sont signalées, le reste est notre propre résumé et commentaire.

L’avis de 3dsınıfı
3dL’analyse de la rédaction

Pour les agences d’architecture et les équipes de visualisation en Turquie, l’intérêt pratique de cette approche tient à la possibilité de tester rapidement une idée de présentation courte à partir de texte et d’images. Les équipes qui souhaitent évaluer différentes options de mouvement de caméra ou d’atmosphère peuvent comparer les résultats en modifiant les prompts par petites étapes.

Toutefois, les sources ne précisent ni le coût, ni l’accès à l’API, ni les conditions de sortie ; ces éléments doivent être clarifiés avant toute intégration dans un flux de travail régulier. Les sources ne donnent pas non plus d’informations sur les besoins matériels. Il est préférable de considérer les vidéos générées comme des propositions de présentation à vérifier, et non comme une preuve de l’exactitude d’une conception, et de tester séparément leur compatibilité avec les processus logiciels existants.

Questions fréquentes

Faut-il utiliser Gemini Omni Flash ou Veo 3.1 pour générer des vidéos d’architecture ?

Gemini Omni Flash est recommandé pour la génération vidéo générale et la retouche en plusieurs échanges. Veo 3.1 peut être envisagé pour prolonger une scène, générer à partir d’images spécifiques ou produire de l’audio natif.

Peut-on générer une vidéo avec Gemini Omni Flash à partir d’une image ?

Oui. Les sources indiquent que Gemini Omni Flash peut générer de courtes vidéos à partir de texte et d’images.

Quelles fonctionnalités vidéo Veo 3.1 prend-il en charge ?

Veo 3.1 propose l’audio natif, le prolongement vidéo, la génération à partir d’images spécifiques et le guidage par image.

Les commentaires et le forum sont en turc.Rejoindre la discussion
+

À lire aussi