En bref
- Gemini Omni Flash et Veo prennent en charge la génération vidéo à partir de prompts textuels.
- Un prompt peut être structuré autour du sujet, du mouvement, de la scène ou du contexte, et de la caméra.
- Gemini Omni Flash est conçu pour générer de courtes vidéos à partir de textes et d’images, et pour les retoucher au fil de plusieurs échanges.
- Veo 3.1 propose l’audio natif, l’extension vidéo, la génération à partir d’images clés et le guidage par image.
Ce que vous apprendrez dans ce guide
Dans un prompt vidéo d’architecture, se contenter d’écrire « une maison moderne » ne suffit pas forcément à préciser l’apparence de la scène ni le comportement de la caméra. Le guide de Google sur la génération vidéo recommande de décomposer l’idée en éléments tels que le sujet, l’action, la scène ou le contexte, et la caméra. Nous allons adapter cette approche à la visualisation d’espaces intérieurs et extérieurs.
L’objectif n’est pas de trouver une formule magique qui garantisse un résultat précis, mais de rendre la description de la scène claire et contrôlable. Les exemples de prompts en anglais ci-dessous ont été rédigés spécialement pour ce guide. Chacun peut être testé séparément : choisissez celui qui convient à votre scène et adaptez-le à votre projet.
Prérequis et choix du modèle
La documentation de l’API Gemini de Google répertorie Gemini Omni Flash et Veo pour la génération vidéo. Selon cette documentation, Gemini Omni Flash se distingue par la création de courtes vidéos à partir de textes et d’images, ainsi que par la retouche conversationnelle en plusieurs étapes. Modifier un élément de la scène ou ajuster la perspective sont des exemples de ce processus itératif.
Veo 3.1 est présenté comme offrant la génération audio native, l’extension vidéo, la génération à partir d’images clés et le guidage par image. Le guide indique qu’on peut privilégier Veo 3.1 lorsque des besoins spécifiques l’exigent, tout en recommandant Gemini Omni Flash comme option par défaut pour la génération vidéo. Le choix dépend du flux de travail souhaité.
Les sources ne précisent ni le type d’abonnement requis, ni le coût d’utilisation, ni le matériel informatique, ni les conditions de création d’un compte. Avant de commencer un projet, vérifiez donc séparément les informations à jour sur l’accès au service et ses tarifs. Les exemples ci-dessous portent sur la rédaction de prompts ; ils ne décrivent ni un menu d’interface particulier ni un appel API.
Comment rédiger un prompt vidéo d’architecture ?
Rédigez votre prompt en réfléchissant aux éléments suivants. Il n’est pas nécessaire de tous les utiliser à chaque fois : choisissez ceux qui sont utiles pour la scène.
Sujet : Définissez l’espace ou l’objet au cœur de la vidéo. Au lieu d’écrire « un intérieur », ajoutez des caractéristiques distinctives, comme « un séjour avec cuisine ouverte et plafond en bois ».
Action : Qu’est-ce qui change ou bouge dans la vidéo ? Choisissez un mouvement simple et clair, comme la lumière qui progresse le long d’un mur ou la caméra qui avance lentement dans un couloir.
Scène et contexte : Décrivez l’intérieur ou l’extérieur, l’heure de la journée, la météo et l’atmosphère. La lumière du matin, un sol mouillé après la pluie ou une cour ensoleillée peuvent, par exemple, donner un caractère distinctif à la scène.
Angle et mouvement de caméra : Précisez un point de vue, comme un grand-angle, une vue à hauteur des yeux ou une vue plongeante, ainsi qu’un mouvement de caméra, comme un plan fixe, un panoramique horizontal ou un travelling. Le guide indique que certains angles de caméra avancés ne sont pas officiellement pris en charge et que les résultats peuvent varier.
Pour évaluer plus facilement le résultat de votre première tentative, choisissez un mouvement principal plutôt que d’en accumuler plusieurs dans le même prompt. Les exemples suivants sont des points de départ.
1. Plan large fixe en intérieur
Wide establishing shot of a calm contemporary living room with a timber ceiling, pale stone floor, and a large window. Soft morning light falls across the room. Static camera, realistic architectural visualization, no people.Dans ce prompt, le sujet est un séjour bien défini, le contexte est la lumière du matin, et la caméra est fixe en plan large. Les matériaux et la lumière caractérisent visuellement la scène ; sans mouvement de caméra, l’accent reste mis sur l’aspect général de la pièce.
2. Travelling lent dans un couloir
A long gallery corridor in a contemporary art museum, with warm limestone walls and a polished concrete floor. The camera slowly dollies forward at eye level toward a bright courtyard. Soft daylight, quiet atmosphere.Ici, « dollies forward » décrit une caméra qui avance physiquement. La hauteur des yeux et le regard dirigé vers la cour indiquent clairement la direction du mouvement. Un seul travelling est utilisé, plutôt que plusieurs mouvements de caméra le long du couloir.
3. Panoramique horizontal sur une façade
A small contemporary house beside a green garden on an overcast afternoon. Slow pan right across the facade, revealing timber cladding, deep window frames, and the entrance. Wide shot, gentle wind moving the garden plants.Dans cet exemple, la façade est le sujet, tandis que le jardin et le temps couvert constituent le contexte. Le panoramique horizontal indique que le cadre se déplace vers la droite. Le mouvement des plantes dans le vent apporte une action discrète à la scène ; la direction de la caméra et le mouvement des éléments de la scène sont décrits séparément.
4. Vue plongeante sur l’aménagement d’une cour
Bird's-eye view of a compact residential courtyard with a rectangular reflecting pool, stone paving, planted beds, and a timber pergola. Slow, steady camera movement above the courtyard in clear afternoon light.La vue plongeante décrit un angle qui permet de montrer les positions relatives des éléments de la cour. Le guide source prend cet angle en exemple ; gardez toutefois à l’esprit que le résultat peut dépendre du prompt et du cas d’utilisation.
5. Approche d’un détail de matériau
Close-up of a pale stone wall meeting a dark timber door frame in a quiet interior. Slow dolly in toward the junction, soft side light revealing the surface texture, realistic architectural detail.Cet exemple met en avant non pas tout l’espace, mais la jonction entre le mur et le cadre de porte. Le gros plan et le travelling avant lent servent à rendre visible la relation entre les matériaux. Dans un projet réel, il faut aussi vérifier la conformité du détail avec le design.
Erreurs fréquentes
Laisser le sujet et le mouvement dans le flou : des consignes générales comme « crée une vidéo impressionnante » ne donnent pas assez de détails pour définir la scène. Nommez l’espace et indiquez clairement ce qui doit se passer dans la vidéo.
Donner des consignes de caméra contradictoires : demander simultanément un plan fixe, un panoramique rapide et un travelling avant peut rendre le comportement de la caméra ambigu. Commencez par un seul mouvement ; si nécessaire, demandez une modification au tour suivant.
Décrire une scène trop complexe : plutôt que d’ajouter de nombreux objets, événements et détails d’ambiance, sélectionnez les éléments prioritaires. Gardez aussi à l’esprit que des transformations s’étendant sur une longue durée peuvent ne pas correspondre à la durée du clip.
Supposer que tous les angles de caméra sont aussi fiables : selon le guide, certains angles avancés ne sont pas officiellement pris en charge et la fiabilité des résultats peut varier. Pour commencer, utilisez des consignes simples et explicites : plan large, hauteur des yeux, caméra fixe ou panoramique simple.
Comment l’évaluer dans un flux de travail d’architecture et de visualisation ?
Les architectes d’intérieur, les agences d’architecture et les artistes 3D peuvent utiliser cette approche pour transformer une idée d’espace en ébauches de présentation animées. Il peut être utile de distinguer les descriptions du sujet, de l’action et de la caméra, notamment lorsqu’on veut montrer les relations spatiales par un mouvement de caméra plutôt que par une image unique. Toutefois, les sources ne garantissent pas que le résultat du modèle correspondra directement aux plans du projet ou aux décisions de conception. Considérez les images générées comme des ébauches visuelles à vérifier, et non comme une preuve de l’exactitude du design.
Pour choisir un modèle, faites également correspondre vos besoins à ses fonctionnalités : examinez Gemini Omni Flash pour générer de courtes vidéos à partir de textes et d’images ou effectuer des retouches en plusieurs étapes ; et Veo 3.1 si vous avez besoin d’étendre une vidéo, de générer à partir d’images clés, de guider la génération par image ou de produire de l’audio natif. Les sources ne détaillent ni les licences, ni les tarifs, ni la configuration matérielle requise, ni la compatibilité avec un pipeline existant. Pour une utilisation en agence, vérifiez ces éléments dans les conditions actuelles du service avant de définir votre flux de travail.
Étapes suivantes
Choisissez une scène de projet et commencez par en décrire le sujet et le contexte. Ajoutez ensuite un seul angle de caméra et un seul mouvement pour créer votre première version. En évaluant le résultat, identifiez précisément ce que vous souhaitez changer : le cadrage, la lumière ou un élément de l’espace ? Gemini Omni Flash est présenté comme permettant ce type de requêtes progressives grâce à son approche de retouche en plusieurs étapes. Pour des besoins plus spécifiques, comme l’extension vidéo ou le guidage à partir d’images clés, examinez les fonctionnalités documentées de Veo 3.1.
Sources et licence
Ce guide est une adaptation en turc de la page « Video generation prompt guide » de Google Cloud et de la documentation de l’API Gemini intitulée « Video generation in the Gemini API ». Les deux sources sont sous licence CC BY 4.0. Les exemples de prompts d’architecture sont originaux et ont été rédigés pour ce guide.
Sources
2 sourcesLes textes sources ne sont pas republiés ; les courtes citations sont signalées, le reste est notre propre résumé et commentaire.
Pour les agences d’architecture et les équipes de visualisation, l’intérêt pratique de cette approche tient à sa façon de décomposer une scène en petites décisions contrôlables. Tester un même espace avec différentes descriptions de caméra peut faciliter les échanges autour d’une idée de présentation ; il ne faut toutefois pas supposer que les résultats respecteront parfaitement le design.
Les agences et les étudiants en Turquie doivent vérifier, avant de commencer, le coût d’utilisation, les conditions d’accès et la compatibilité avec leur flux de travail actuel. Les sources ne précisent ni les besoins matériels ni les tarifs ; il n’est donc pas possible de recommander un investissement informatique ou un modèle de licence particulier. L’approche la plus prudente consiste à considérer les vidéos générées comme des ébauches à contrôler, et non comme des livrables définitifs du projet.
Questions fréquentes
Quelle est la différence entre Gemini Omni Flash et Veo 3.1 ?
Google met en avant Gemini Omni Flash pour la génération de courtes vidéos et les retouches en plusieurs étapes. Veo 3.1 est présenté avec des fonctionnalités d’audio natif, d’extension vidéo, de génération à partir d’images clés et de guidage par image.
Quelles informations doit contenir un prompt vidéo d’architecture ?
Le sujet, l’action, la scène ou le contexte, et la caméra en sont les éléments de base. Il n’est pas obligatoire de tous les utiliser dans chaque prompt.
Quelles fonctionnalités vidéo Veo 3.1 prend-il en charge ?
Selon la documentation, Veo 3.1 propose l’audio natif, l’extension vidéo, la génération à partir d’images clés et le guidage par image.



