Dernières actualités
Rhino 8 : créer des coupes et des dessins 2D avec ClippingPlaneUtiliser Blender Asset Browser : créer et organiser une bibliothèque d’assetsComment créer un prompt vidéo d’architecture avec Gemini Omni Flash et Veo ?Revit 2024 : guide pas à pas des étiquettes de matériau et des keynotesÉclairage intérieur avec les sondes lumineuses d’Eevee dans Blender : guide pratiqueCréer des courbes de section avec Contour et Section dans Rhino 8 : guideCréer des visuels d’architecture avec Nano Banana 2.1 : 5 prompts et étapesBaker une simulation physique dans Blender : cache et renduWorkflow de rendu avec V-Ray App SDK : chargement, aperçu et exportGuide pour gérer les problèmes de plugins et l’exécution de fichiers dans Grasshopper
TutorielsVeoGoogleGemini Omni Flash

Comment créer un prompt vidéo d’architecture avec Gemini Omni Flash et Veo ?

Gemini Omni Flash et Veo proposent différents flux de travail pour transformer des scènes architecturales en vidéos à partir de texte et d’images. Ce guide explique comment créer des prompts décrivant le sujet, la scène, la caméra et le mouvement.

Une bibliothèque contemporaine dotée d’un auvent en bois, sur une place urbaine baignée par la lumière du matinImage IA
Image d’illustration générée par IA.Image : 3dsınıfı / FCA AI

En bref

  1. Gemini Omni Flash est recommandé pour générer de courtes vidéos à partir de texte et d’images et les modifier par instructions conversationnelles.
  2. Veo 3.1 propose des options telles que l’audio natif, le prolongement vidéo et la génération à partir d’images clés.
  3. Un bon prompt peut décrire séparément le sujet, l’action, le lieu et les choix de caméra.
  4. Selon le guide de Google, les résultats et la fiabilité des angles de caméra avancés peuvent varier.

Ce que vous apprendrez dans ce guide

Transformer une scène architecturale en vidéo ne consiste pas simplement à demander « montre une maison moderne ». Décrire clairement le lieu, les changements qui se produisent dans la scène, l’heure de la journée et le déplacement de la caméra permet de partir sur des bases plus maîtrisées. Ce guide présente la création de prompts axés sur l’architecture et les intérieurs pour Gemini Omni Flash et Veo, les différences d’usage entre ces deux options mentionnées dans les sources, ainsi que les erreurs courantes à éviter.

Dans sa documentation, Google met en avant Gemini Omni Flash pour générer de courtes vidéos à partir de texte et d’images, ainsi que pour les modifier en plusieurs étapes. Veo 3.1 est décrit à travers des fonctionnalités comme l’audio natif, le prolongement vidéo et la génération à partir d’images clés. Commencez donc par définir votre besoin : évaluez Omni Flash pour créer une nouvelle scène et poursuivre les ajustements par instructions conversationnelles, et Veo 3.1 pour les besoins mentionnés comme le prolongement ou le guidage par images clés.

Prérequis et choix de l’outil

Les documents sources présentent Gemini API et Vertex AI Agent Platform pour la génération vidéo. Du côté d’Omni Flash, ils mentionnent l’Interactions API ; pour Veo 3.1, ils citent l’API generateContent. Ils ne précisent pas de version logicielle locale, de type de compte, de tarif ni de conditions d’accès. Vérifiez ces éléments dans la documentation à jour du service concerné avant de commencer.

Avant de vous lancer, clarifiez votre objectif à l’aide de trois questions :

  • S’agit-il de générer une nouvelle vidéo d’architecture ou d’analyser une vidéo existante ? Les sources traitent de la génération vidéo ; pour l’analyse d’une vidéo existante, elles renvoient à un guide distinct consacré à la compréhension vidéo.

  • Le contenu fourni est-il du texte, une image ou une combinaison de plusieurs types de données ? Gemini Omni Flash est décrit comme un modèle multimodal prenant en charge ensemble les entrées textuelles, visuelles, audio et vidéo. Veo 3.1 est présenté comme prenant en charge le guidage par image.

  • Quel changement est important dans le résultat ? Choisissez un objectif, par exemple présenter un lieu, décrire un mouvement de caméra ou prolonger une scène.

Vous pouvez construire un prompt à partir des éléments suivants : sujet (élément central de l’image), action (ce qui se passe), scène et contexte (lieu, moment, atmosphère), angle de caméra et mouvement de caméra. Il n’est pas nécessaire d’utiliser tous ces éléments dans chaque prompt : choisissez ceux qui répondent à votre besoin.

Prompts vidéo d’architecture, étape par étape

1. Commencez par décrire le lieu et le sujet principal

Le sujet est le bâtiment ou l’élément intérieur au centre de la vidéo. Plutôt que de rester vague, précisez des caractéristiques visibles comme les matériaux, la forme et les relations spatiales. L’exemple ci-dessous sert à créer une nouvelle scène extérieure :

Prompt
A contemporary public library with a broad timber canopy and a glazed ground floor, set in a quiet urban plaza at early morning. Soft overcast daylight reveals the timber grain and the reflections in the glass. Wide establishing shot, calm architectural visualization.

Cet exemple décrit conjointement le bâtiment, les matériaux, l’environnement, le moment de la journée et le cadrage général. Pour une vidéo de concept, choisissez l’aspect du projet que vous souhaitez mettre en avant : le rythme de la façade, le vide de l’entrée ou la relation du bâtiment avec la place, par exemple. Plutôt que d’ajouter des caractéristiques techniques invisibles ou des dimensions exactes, indiquez les qualités que vous souhaitez visualiser dans la vidéo.

2. Définissez l’action dans la scène

L’action décrit ce qui distingue la vidéo d’une image fixe. Pour une visualisation architecturale, vous pouvez vous appuyer sur des éléments observables tels que le déplacement des personnes, les changements de lumière dans l’environnement ou le mouvement des feuilles au vent :

Prompt
A small group of visitors walks slowly through a contemporary museum atrium, pausing beneath a large skylight. Sunlight shifts gently across the stone floor while a few leaves outside move in a light breeze. Medium-wide shot, restrained and realistic movement.

Ici, les actions restent brèves et cohérentes entre elles. Décrire plusieurs transformations ou événements dans un même clip peut rendre moins évident le mouvement à privilégier. Commencez par une action principale, puis ajoutez si nécessaire un léger mouvement d’ambiance.

3. Ajoutez l’angle et le mouvement de caméra

L’angle de caméra indique le point de vue à partir duquel le spectateur découvre le lieu ; le mouvement décrit la progression du plan. Le guide de Google donne comme exemples des plans larges, des vues aériennes, des vues à hauteur d’œil et des gros plans, ainsi que des mouvements de panoramique, d’inclinaison, de travelling avant, de travelling latéral, de zoom et de grue. Il précise également que les résultats peuvent varier avec les angles avancés.

Prompt
A double-height residential living room with a sculptural staircase and a large window facing a garden. Begin with a wide eye-level view, then make a slow dolly in toward the staircase. Soft late-afternoon light, stable camera, natural material detail.

Ce prompt précise clairement le cadrage de départ et un seul mouvement de caméra. « Dolly in » décrit un rapprochement physique de la caméra vers le sujet ; le guide le distingue du zoom. Plutôt que d’accumuler plusieurs consignes de caméra dans un même plan, commencez avec un seul mouvement pour évaluer le résultat.

4. Reliez la lumière et l’atmosphère au lieu

Le contexte de la scène englobe des éléments comme le lieu, l’heure, la météo et l’atmosphère. Utilisez la description de la lumière pour faciliter la lecture du projet. Par exemple, si vous souhaitez rendre visibles les surfaces des matériaux, précisez d’où vient la lumière et l’atmosphère qu’elle crée :

Prompt
A quiet boutique hotel lobby with pale stone walls, a dark timber reception desk, and a shallow reflecting pool. Early morning light enters from the side and creates soft reflections on the stone. Static wide shot, subtle water movement, calm atmosphere.

Ici, le choix d’une caméra fixe met en valeur le hall et ses matériaux, tandis que le mouvement de l’eau apporte une légère dynamique à la scène. Veillez à ce que les descriptions de la lumière, de la caméra et de l’action servent le même objectif visuel. Par exemple, demander une ambiance nocturne dramatique tout en décrivant le lieu sous une lumière vive de midi peut produire des résultats contradictoires.

5. Considérez l’image de référence comme un élément de guidage

Si vous disposez d’une image de référence, vous pouvez envisager un flux de travail avec entrée visuelle. La source indique qu’Omni Flash peut traiter du texte et des images, et que Veo 3.1 prend en charge le guidage par image. Elle ne garantit toutefois pas que chaque détail de l’image sera conservé à l’identique. Précisez donc aussi dans le prompt les caractéristiques importantes :

Prompt
Use the provided architectural image as visual direction for a compact courtyard house. Show a slow truck right across the courtyard, revealing the relationship between the timber screen, planted edge, and interior glazing. Gentle daylight, restrained movement, wide shot.

Cet exemple précise ce que vous souhaitez voir dans le cadrage tout en utilisant l’image comme guide. Si le résultat modifie les matériaux ou les relations spatiales, révisez le prompt et simplifiez le sujet principal. Les sources mentionnent la possibilité d’utiliser une image comme guide, mais ne décrivent pas d’étape précise de chargement ni de parcours dans l’interface.

Erreurs courantes

Rester trop vague : des formulations comme « une belle vidéo de maison » ne définissent ni le sujet ni l’atmosphère. Décrivez le type de bâtiment, le lieu et la caractéristique à mettre en avant.

Confondre action et mouvement de caméra : une formulation comme « la façade pivote pendant que la caméra s’approche » peut rendre le mouvement prioritaire moins évident. Décrivez d’abord l’action de la scène, puis le mouvement de caméra dans une phrase distincte.

Demander des atmosphères incompatibles : décrire des heures et des conditions lumineuses différentes dans un même prompt affaiblit le contexte de la scène. Choisissez une heure et une atmosphère uniques.

Supposer que tous les angles de caméra sont aussi fiables : Google indique que les résultats et la fiabilité peuvent varier avec certains angles de caméra avancés. Si le cadrage obtenu est inattendu, réessayez avec un angle plus simple.

Confondre génération et analyse : les documents API de ce guide portent sur la génération vidéo. Pour analyser une vidéo existante, consultez la documentation sur la compréhension vidéo mentionnée dans la source.

Utilisation dans un flux de travail d’architecture et de visualisation

Cette approche peut aider les architectes, les architectes d’intérieur et les équipes de visualisation à transformer des scènes conceptuelles, l’atmosphère d’un intérieur ou la relation d’un bâtiment avec son environnement en courtes séquences animées. Séparer le sujet, l’action et les choix de caméra dans le prompt facilite la comparaison de différentes idées de présentation. Les sources ne garantissent toutefois pas que la vidéo produite préservera fidèlement la géométrie ou les matériaux du projet ; considérez donc le résultat comme un essai de communication visuelle, et non comme un substitut à la validation de conception.

Lors du choix d’un outil, il faut vérifier non seulement l’objectif d’utilisation, mais aussi la licence, les conditions d’accès au service et son coût. Les textes sources ne précisent ni les tarifs ni les exigences liées au compte. Avant d’utiliser des images de projets réels, les équipes doivent examiner les conditions du service concerné et leur politique interne en matière de données ; elles doivent également vérifier que le flux d’API choisi est compatible avec leur processus de production actuel. Pour une présentation importante, mieux vaut examiner les descriptions de caméra et de scène au moyen de courts essais plutôt que de se fier à un seul prompt.

Étapes suivantes

Commencez par réaliser plusieurs essais d’une même scène en ne changeant que le mouvement de caméra ; modifiez ensuite un seul élément, comme la lumière ou l’action. Vous pourrez ainsi mieux repérer les descriptions qui influencent le résultat. La documentation indique qu’avec Gemini Omni Flash, les modifications peuvent être effectuées en plusieurs étapes ; dans ce cas, précisez clairement le changement souhaité à chaque tour. Pour Veo 3.1, faites correspondre l’outil aux besoins décrits dans la source, comme le prolongement vidéo ou la génération à partir d’images clés. Dans les deux cas, évaluez les résultats au regard de l’objectif de présentation architecturale défini.

Sources et licence

Ce tutoriel a été adapté en turc à partir du document « Video generation in the Gemini API » de Google AI for Developers et du guide « Video generation prompt guide » de Google Cloud. Les deux sources sont sous licence CC BY 4.0.

Sources

2 sources
A(
ai.google.dev (CC BY 4.0)ai.google.dev/gemini-api/docs/video
Résumé
C(
cloud.google.com (CC BY 4.0)cloud.google.com/vertex-ai/generative-ai/docs/video/video-gen-prompt-guide
Résumé

Les textes sources ne sont pas republiés ; les courtes citations sont signalées, le reste est notre propre résumé et commentaire.

L’avis de 3dsınıfı
3dL’analyse de la rédaction

Pour les équipes d’architecture, l’intérêt pratique de cette approche réside dans sa capacité à transformer une idée de lieu en courtes séquences animées et à tester des options de caméra avant une présentation. Pour illustrer un concept ou une ambiance, de petits essais reposant sur des descriptions claires peuvent notamment contribuer au flux de travail.

En Turquie, les bureaux et les étudiants devraient vérifier séparément le coût du service, les conditions d’accès et les règles relatives à l’utilisation des images de projet avant de décider de l’utiliser. Les sources ne précisent ni les tarifs ni les exigences liées au compte ; elles n’indiquent pas non plus que les vidéos générées préserveront les détails de conception à l’identique. Il est donc préférable de considérer le résultat comme un outil d’aide à la communication visuelle, et non comme un outil de validation de conception.

Questions fréquentes

Quelle est la différence entre Gemini Omni Flash et Veo 3.1 ?

Google met en avant Gemini Omni Flash pour générer de courtes vidéos à partir de texte et d’images et les modifier en plusieurs étapes. Veo 3.1 propose des fonctionnalités comme l’audio natif, le prolongement vidéo et la génération à partir d’images clés.

Quelles informations inclure dans un prompt vidéo d’architecture ?

Le sujet, l’action, le contexte de la scène, l’angle de caméra et le mouvement de caméra peuvent aider à structurer le prompt. Il n’est pas nécessaire d’utiliser tous ces éléments dans chaque prompt.

Combien coûtent Veo 3.1 et Gemini Omni Flash ?

Les sources fournies n’indiquent aucun tarif. Avant toute utilisation, vérifiez les prix et les conditions d’accès à jour du service concerné.

Les commentaires et le forum sont en turc.Rejoindre la discussion
+

À lire aussi