Dernières actualités
Named Attribute dans Blender Geometry Nodes : guide pas à pasGuide pour rédiger des prompts vidéo d’architecture avec Gemini Omni Flash et Veo 3.1Unreal Engine GPU Lightmass et Lightmap UV : guide pour les scènes d’architectureLe campus Shixia de Hongling Middle School publié sur ArchDailyPolyReduce et Remesh dans Houdini : guide pratique pour les modèles architecturauxArchicad 27 : workflow pratique pour des vues et mises en page cohérentesRevit, Autodesk Assistant et MCP : interroger le modèle et créer des feuillesImporter un nuage de points dans Blender : guide Point Cloud I/OCréer un rendu architectural panoramique dans Blender et enregistrer l’animation en toute sécuritéCouches Landscape dans Unreal Engine : guide de création et de peinture des matériaux
TutorielsVeoGemini Omni FlashVeo 3.1

Guide pour rédiger des prompts vidéo d’architecture avec Gemini Omni Flash et Veo 3.1

Gemini Omni Flash et Veo 3.1 proposent différents workflows pour générer des vidéos à partir de prompts textuels. Ce guide combine les descriptions du sujet, de l’action, du contexte et de la caméra pour créer des scènes d’architecture et d’intérieur.

Maison contemporaine avec cour et bassin réfléchissant, baignée par la lumière de l’heure doréeImage IA
Image d’illustration générée par IA.Image : 3dsınıfı / FCA AI

En bref

  1. Gemini Omni Flash est présenté pour générer de courtes vidéos et modifier les résultats au fil de plusieurs itérations.
  2. Veo 3.1 propose la génération audio native, l’extension vidéo, la génération à partir d’images clés et le guidage par image.
  3. Un prompt vidéo peut être découpé en plusieurs éléments : sujet, action, scène ou contexte, angle de caméra et mouvement de caméra.
  4. Les sources ne précisent ni les tarifs, ni les conditions liées au compte, ni les limites de génération.

Ce que vous apprendrez dans ce guide

Pour transformer une image d’architecture en scène animée, vous pouvez décrire séparément ce qui apparaît à l’écran et le comportement de la caméra, plutôt que de vous limiter à une formule générale comme « une vidéo de maison moderne ». Le guide de Google sur les prompts vidéo considère le sujet, l’action, la scène ou le contexte, l’angle de caméra et le mouvement de caméra comme les principaux éléments d’un prompt. Ils ne sont pas tous obligatoires à chaque fois ; toutefois, savoir ce que chacun décrit aide à exprimer plus clairement l’intention.

Les exemples de ce tutoriel ont été conçus spécifiquement pour la visualisation architecturale et la présentation d’intérieurs. Ils ne garantissent pas un résultat précis ni le bon fonctionnement d’un contrôle de caméra particulier. Selon le guide, certains angles de caméra avancés ne sont pas officiellement pris en charge et la fiabilité des résultats peut varier selon le cas d’usage.

Prérequis et choix du modèle

Pour générer des vidéos, vous pouvez utiliser les options de modèles décrites dans la documentation de Google sur les prompts vidéo pour l’API Gemini ou Vertex AI. Les sources ne détaillent ni la création d’un compte, ni les tarifs, les quotas ou les exigences d’abonnement ; consultez la documentation des produits concernés pour vérifier les conditions d’accès.

Dans sa documentation sur l’API Gemini, Google recommande Gemini Omni Flash pour les workflows de génération de courtes vidéos à partir de textes et d’images, ainsi que pour la modification des résultats au fil de plusieurs itérations. La documentation mentionne l’API Interactions pour ces retouches successives. Veo 3.1, quant à lui, est associé à des besoins tels que la génération vidéo avec audio natif, l’extension vidéo, la génération à partir d’images clés et le guidage par image ; la documentation indique l’API generateContent pour ces fonctionnalités. Il est important de choisir le modèle en fonction du besoin : Omni Flash peut être envisagé si vous souhaitez améliorer le résultat précédent au fil de la conversation ; Veo 3.1 peut être évalué si vous avez besoin d’étendre une vidéo ou de générer à partir d’images clés.

Préparer un prompt d’architecture étape par étape

  1. Définissez clairement le sujet principal. Décrivez l’élément architectural central de la scène : par exemple, une maison de plain-pied, un petit café ou un musée avec cour intérieure. Ajoutez à la description du sujet les caractéristiques souhaitées, comme les matériaux ou les formes. Au lieu d’une formule vague comme « un intérieur », précisez le type d’espace à représenter.

  2. Déterminez l’action. La vidéo montrera-t-elle un espace immobile ou racontera-t-elle une transformation ? Le guide définit l’action comme comprenant les mouvements, les interactions et les changements qui surviennent au fil du temps. Pour une présentation architecturale, vous pouvez décrire, par exemple, la lumière du jour qui traverse une pièce ou la caméra qui avance dans un couloir. Le guide indique également qu’il faut tenir compte de la durée du clip lorsqu’on décrit un processus qui s’étend sur une longue période dans une seule vidéo.

  3. Décrivez l’espace et l’atmosphère. Précisez où se déroule la scène, à l’intérieur ou à l’extérieur, à quel moment de la journée et quelle ambiance s’en dégage. Des éléments comme « un séjour spacieux avec de grandes baies vitrées, une lumière matinale et de doux reflets au sol » rendent le contexte plus concret. Si votre prompt accumule les détails inutiles, supprimez ceux qui ne servent pas l’idée principale.

  4. Choisissez l’angle et le mouvement de caméra. Un grand-angle permet de présenter l’espace avec son environnement ; un plan à hauteur des yeux offre un point de vue plus neutre. Précisez aussi le mouvement : par exemple, un plan fixe, un panoramique lent ou un travelling avant. Le panoramique fait pivoter la caméra horizontalement ; l’inclinaison la fait pivoter verticalement ; le travelling rapproche ou éloigne physiquement la caméra. Ce sont des mouvements différents. Pour commencer, une indication claire comme « la caméra s’approche » est plus facile à interpréter que plusieurs mouvements superposés.

Exemple 1 : présenter une maison en plan large

Prompt
Wide establishing shot of a compact courtyard house at golden hour. Warm sunlight falls across pale stone walls and a shaded terrace. The camera makes a slow, steady dolly in toward the entrance.

Dans cet exemple, le sujet est une maison avec cour intérieure ; le contexte comprend l’heure dorée et la lumière du soleil ; l’angle est un plan large ; le mouvement est un lent travelling avant. Pour commencer, combinez ces éléments et évaluez le résultat ; ensuite, si nécessaire, ne modifiez qu’un seul élément à la fois.

Exemple 2 : mettre en valeur les matériaux d’un intérieur

Prompt
A calm contemporary living room with oak cabinetry, a light stone floor, and a large window. Soft morning light moves across the room. Static eye-level shot, with subtle reflections on the floor.

Ici, l’action est le déplacement de la lumière dans l’espace, tandis que la caméra reste fixe. Le guide définit le plan statique comme un type de prise de vue où la caméra ne bouge pas. Un cadrage fixe est un bon point de départ pour les essais qui cherchent à mettre en valeur les matériaux et les effets de lumière.

Exemple 3 : avancer dans un couloir de galerie

Prompt
A quiet art gallery corridor with white walls, a polished concrete floor, and evenly spaced framed works. A slow tracking shot moves forward through the corridor, keeping the architecture in view.

Ce prompt décrit l’espace et le mouvement de la caméra vers l’avant. Si vous souhaitez remplacer l’expression « tracking shot » par une formulation plus explicite faisant appel à l’un des termes de mouvement expliqués dans la source, essayez de préciser que la caméra avance dans la scène en travelling. Le résultat peut varier ; il est donc nécessaire d’ajuster le prompt de manière méthodique.

Exemple 4 : montrer une cour en plongée

Prompt
Bird's-eye view of a small landscaped courtyard between low-rise buildings. A narrow path curves around a shallow reflecting pool, with planting beds along the edges. The camera slowly cranes upward to reveal the full layout.

Dans cet exemple, « bird’s-eye view » désigne un angle où la caméra regarde directement vers le bas ; le mouvement de grue vise à révéler toute la cour en élevant le cadre. Le guide avertit que la prise en charge officielle de certains angles avancés et leur fiabilité peuvent varier. Vérifiez donc le résultat si vous souhaitez une vue plongeante et, si nécessaire, réessayez avec un plan large plus simple.

Erreurs fréquentes

  • Rester trop vague : « une vidéo d’un bâtiment élégant » donne peu d’indications sur le sujet, le contexte et la caméra. Commencez par préciser l’espace et ce qui s’y passe.

  • Mélanger plusieurs mouvements : le panoramique, l’inclinaison, le travelling et le zoom sont des mouvements de caméra différents. Plutôt que d’en énumérer plusieurs dans un seul prompt, commencez par en choisir un et évaluez le résultat.

  • Décrire une longue transformation dans un clip : le guide recommande de tenir compte de la durée du clip lorsqu’on décrit un processus long. Réduisez l’événement à une action brève et compréhensible.

  • Ajouter tous les éléments à chaque prompt : il n’est pas obligatoire de combiner sujet, action, contexte, angle et mouvement. N’ajoutez pas les éléments dont vous n’avez pas besoin.

  • Considérer le résultat comme garanti : l’angle ou le mouvement de caméra indiqué dans le prompt ne garantit pas un résultat identique à chaque essai. Vérifiez les rendus, en particulier avec des angles avancés.

  • Ignorer les filtres de sécurité : Google indique que des filtres de sécurité s’appliquent à Gemini Omni Flash et Veo. Les prompts qui enfreignent les règles relatives aux contenus inappropriés peuvent être bloqués.

Conséquences pour les workflows d’architecture et de visualisation

Cette approche aide les équipes de visualisation, les architectes d’intérieur et les étudiants qui souhaitent compléter une présentation architecturale statique par une courte scène animée à structurer leurs prompts plus méthodiquement. En réfléchissant séparément à l’espace, aux actions comme la lumière ou le mouvement, et aux indications de caméra, il peut être plus facile de comparer différentes variantes. Toutefois, les sources ne décrivent aucun workflow d’importation depuis un logiciel 3D précis, de compatibilité avec des fichiers de modèles ou de conversion d’un rendu existant en vidéo.

Le choix du modèle doit dépendre de la fonctionnalité vidéo nécessaire ; les besoins d’édition en plusieurs étapes et d’extension de scène doivent être distingués. Avant de lancer la génération, vérifiez l’API à utiliser et les conditions d’accès ; notez que les sources ne fournissent pas d’informations sur le budget ni sur les exigences matérielles. Si les mouvements de caméra et les vidéos générées sont destinés à des présentations de projets réels, vérifiez également qu’ils reflètent fidèlement les choix de conception de l’espace.

Étapes suivantes

Pour votre premier essai, rédigez un prompt court et choisissez un seul mouvement de caméra principal. Ensuite, créez une nouvelle variante en ne modifiant qu’un élément : décrivez, par exemple, le même espace avec un panoramique lent plutôt qu’un plan fixe. Consultez la documentation des API concernées pour étudier le workflow d’édition en plusieurs étapes d’Omni Flash, ainsi que les besoins d’extension ou de génération à partir d’images clés cités pour Veo 3.1. Si le résultat ne correspond pas à vos attentes, réexaminez séparément le sujet, l’action, la scène et les éléments liés à la caméra pour repérer les éventuelles ambiguïtés.

Sources et licence

Ce tutoriel a été adapté en turc à partir des descriptions de modèles et des éléments de prompt présentés dans les documents de Google « Video generation in the Gemini API » et « Video generation prompt guide ». Les deux sources sont sous licence CC BY 4.0.

Sources

2 sources
A(
ai.google.dev (CC BY 4.0)ai.google.dev/gemini-api/docs/video
Résumé
C(
cloud.google.com (CC BY 4.0)cloud.google.com/vertex-ai/generative-ai/docs/video/video-gen-prompt-guide
Résumé

Les textes sources ne sont pas republiés ; les courtes citations sont signalées, le reste est notre propre résumé et commentaire.

L’avis de 3dsınıfı
3dL’analyse de la rédaction

Pour les cabinets d’architecture et les équipes de visualisation en Turquie, réfléchir séparément au sujet, à l’espace et aux indications de caméra peut aider à mieux planifier les essais de courtes vidéos de présentation. Les étudiants qui souhaitent enrichir des images statiques d’un récit animé peuvent également s’appuyer sur cette approche pour commencer.

Cependant, les sources ne précisent ni les tarifs, ni les besoins matériels, ni les conditions d’accès aux API ; vérifiez donc la documentation des services concernés et leurs coûts avant de lancer la production. Il convient également d’évaluer les rendus pour vérifier la cohérence des mouvements de caméra et la fidélité avec laquelle le projet est représenté.

Questions fréquentes

Quelle est la différence entre Gemini Omni Flash et Veo 3.1 ?

Gemini Omni Flash est mis en avant pour la génération de courtes vidéos et les workflows d’édition en plusieurs étapes. Veo 3.1 propose l’audio natif, l’extension vidéo, la génération à partir d’images clés et le guidage par image.

Que faut-il inclure dans un prompt vidéo d’architecture ?

Le sujet, l’action, la scène ou le contexte, l’angle de caméra et le mouvement de caméra sont autant d’éléments que vous pouvez utiliser pour construire un prompt. Il n’est pas nécessaire de tous les inclure dans chaque prompt.

Combien coûtent Gemini Omni Flash et Veo 3.1 ?

Les sources ne fournissent pas d’informations sur les tarifs. Consultez la documentation des produits concernés pour connaître les prix et les conditions d’accès.

Les commentaires et le forum sont en turc.Rejoindre la discussion
+

À lire aussi