Dernières actualités
Guide du rendu intérieur avec Blender Cycles : bruit et duréeAnalyse d’images architecturales avec l’API Gemini : 5 promptsCréer une nomenclature de matériaux dans Revit : guide étape par étapeCréer des visuels d’architecture avec Nano Banana 2.1 : guide de prompts pas à pasRépartir des plantes et des objets sur des surfaces avec Blender Geometry NodesCréer des vidéos d’architecture avec Gemini : choisir modèle et promptPlacer des textures dans Blender avec UV Project et UV WarpRhino 8 : réglages du mesh et ShrinkWrap, guide pour créer un maillage propreCréer des visuels d’architecture avec Nano Banana 2.1 : guide des prompts et retouchesTexture baking dans Blender Cycles : guide étape par étape, des UV aux lightmaps
TutorielsGoogleGemini Omni FlashVeo 3.1

Créer des vidéos d’architecture avec Gemini : choisir modèle et prompt

Dans l’API Gemini, Gemini Omni Flash et Veo 3.1 répondent à différents besoins de création vidéo architecturale. Ce guide vous aide à choisir un modèle, à décrire vos scènes avec précision et à améliorer vos prompts étape par étape.

Cour contemporaine au sol de pierre et à l’écran de bois, baignée par la lumière du matinImage IA
Image d’illustration générée par IA.Image : 3dsınıfı / FCA AI

En bref

  1. Gemini Omni Flash se distingue par la création de courtes vidéos à partir de texte et d’images, ainsi que par la retouche en plusieurs échanges.
  2. Veo 3.1 prend en charge l’audio natif, l’extension vidéo, la génération à partir de certaines images et le guidage par image.
  3. Des consignes claires et précises, assorties de contraintes sur le résultat, aident le modèle à se rapprocher de la scène souhaitée.
  4. Le guide de Google recommande d’améliorer les prompts de façon itérative, en fonction des résultats observés après un premier essai.

Ce que vous apprendrez dans ce guide

Pour transformer une idée architecturale en récit visuel animé, il faut d’abord choisir le bon flux de production, puis décrire la scène clairement. La documentation de l’API Gemini met en avant deux options pour la création vidéo : Gemini Omni Flash et Veo 3.1. Ce guide présente les usages adaptés à chaque modèle, la façon de rédiger les instructions d’une scène architecturale et les pistes pour améliorer le premier résultat.

Gemini Omni Flash se concentre sur la création de courtes vidéos à partir de texte et d’images, ainsi que sur la retouche conversationnelle en plusieurs échanges. Veo 3.1 propose, de son côté, des fonctions telles que la génération audio native, l’extension vidéo, la génération à partir de certaines images et le guidage par image. Cela ne signifie pas que les deux modèles s’utilisent de la même manière dans tous les projets : le choix dépend du flux de production nécessaire.

Prérequis : logiciel, version et compte

Ce guide porte sur la création vidéo via l’API Gemini. La documentation de Google présente Gemini Omni Flash et Veo 3.1 pour les flux de production vidéo. Les sources ne précisent pas le type de compte requis, les tarifs, les exigences matérielles locales ni les versions de logiciels supplémentaires nécessaires. Avant de commencer, vérifiez donc l’accès à l’API et les conditions en vigueur dans la documentation du service concerné ; ne partez pas du principe qu’un compte ou un matériel non mentionné ici est nécessaire.

Pour commencer, décomposez la scène à produire en quelques éléments concrets : type d’espace, matériaux visibles, lumière, éléments importants dans le cadre et objectif de la vidéo. Préparez également une image de référence si vous comptez en utiliser une. Gemini Omni Flash permet de créer des vidéos à partir de texte et d’images ; pour Veo 3.1, la documentation décrit le guidage par image via l’API generateContent.

Créer un prompt vidéo d’architecture étape par étape

1. Définissez d’abord le rôle du modèle

Si vous souhaitez créer une courte vidéo à partir de texte ou d’une image, puis la retoucher en plusieurs échanges, envisagez Gemini Omni Flash. Outre la génération vidéo, ce modèle permet une retouche conversationnelle en plusieurs tours. Si vous avez besoin d’étendre une vidéo, de travailler sur des images spécifiques ou de générer de l’audio natif, consultez les fonctions documentées de Veo 3.1. Le choix du modèle doit dépendre des fonctions requises dans le flux de production plutôt que du caractère architectural de la scène.

2. Décrivez la scène clairement et avec précision

Le guide de Google sur la conception des prompts recommande de donner des consignes claires et précises, et d’inclure des contraintes concernant la forme et les limites de la réponse. En visualisation architecturale, plutôt que de demander simplement « crée une vidéo d’une maison moderne », précisez les éléments qui doivent apparaître dans la scène et les changements à éviter. Pour le premier essai, sélectionnez les objectifs visuels essentiels au lieu de chercher à tout détailler.

Voici un exemple conçu pour demander à Gemini Omni Flash une courte vidéo d’architecture à partir de texte :

Prompt
Create a short architectural video of a quiet contemporary courtyard. Show pale stone paving, a timber screen, and a single olive tree. Keep the building geometry and material palette consistent throughout. Use soft morning light. Avoid adding people, signage, or extra structures.

Le prompt en anglais énumère clairement les éléments principaux de la cour, les conditions d’éclairage et la cohérence visuelle à préserver. Le terme « short » correspond à l’usage décrit de Gemini Omni Flash pour la création de courtes vidéos. Évaluez le premier résultat, notez les éléments manquants ou modifiés, puis formulez une nouvelle consigne qui se concentre uniquement sur ces points.

3. Utilisez une image de référence pour guider le modèle

Si vous disposez d’une image d’intérieur ou de façade, vous pouvez essayer de l’associer à une instruction textuelle. Gemini Omni Flash prend en charge la création de courtes vidéos à partir de texte et d’images ; Veo 3.1 prend également en charge le guidage par image. Préciser dans le prompt les caractéristiques importantes de l’image de référence rend la demande plus claire. Ne supposez pas que chaque détail de l’image sera fidèlement conservé : vérifiez le résultat.

Prompt
Use the supplied interior image as visual direction for a short video. Preserve the room's visible layout, warm wood surfaces, and large window. Show a calm transition in the daylight across the space. Do not introduce new furniture, change the room layout, or add text.

Cet exemple explique, par des instructions écrites, quelles caractéristiques de l’image de référence doivent être reprises. Si la disposition ou le langage des matériaux change dans le résultat, précisez concrètement les éléments concernés lors du tour suivant et réessayez.

4. Améliorez le premier résultat par des retouches successives

Gemini Omni Flash prend en charge la retouche vidéo conversationnelle en plusieurs échanges ; la documentation illustre notamment le remplacement d’éléments et le changement de perspective. Vous pouvez donc cibler un point précis de la première vidéo, plutôt que de tout décrire à nouveau. Le texte suivant peut servir d’instruction de suivi pour le résultat précédent :

Prompt
Revise the previous video by changing the viewing perspective to show more of the timber screen. Keep the courtyard layout, stone paving, olive tree, and morning light consistent. Do not add new objects.

Ce prompt de suivi demande un changement de perspective tout en rappelant les éléments de la scène à préserver. Plutôt que de demander plusieurs changements importants à la fois, évaluez le résultat et indiquez la correction prioritaire dans un tour distinct.

5. Évaluez vos besoins en images, en extension vidéo ou en audio avec Veo 3.1

Si vous choisissez Veo 3.1, adaptez votre demande aux fonctions décrites dans la documentation. Le modèle prend en charge l’extension vidéo, la génération à partir d’images spécifiques, le guidage par image et l’audio natif. Le prompt ci-dessous donne un exemple de scène architecturale avec audio :

Prompt
Generate an architectural video of a small gallery courtyard with natural ambient sound. Keep the stone surfaces and surrounding walls visually consistent. Let the sound remain subtle and suited to a quiet outdoor space; do not include speech or music.

Ce prompt illustre l’utilisation de la prise en charge de l’audio natif de Veo 3.1 ; il ne garantit pas la génération d’un son précis. Si vous avez besoin d’une génération à partir d’images spécifiques ou d’étendre une vidéo, formulez votre demande en fonction de la fonction voulue et suivez la documentation du flux API utilisé. N’inventez pas de paramètres ni d’étapes dans les menus qui ne figurent pas dans les sources.

Erreurs fréquentes

Donner des indications vagues : une demande générale comme « une vidéo d’intérieur impressionnante » ne précise pas les éléments importants. Indiquez clairement le type d’espace, les matériaux à préserver et le changement visuel souhaité.

Multiplier les objectifs dans un seul prompt : demander en même temps de grands changements dans la scène, les matériaux, la perspective et l’ambiance peut rendre le résultat difficile à évaluer. Commencez par définir la scène principale, puis corrigez séparément les défauts observés au tour suivant.

Considérer le premier résultat comme définitif : le guide de Google décrit la conception des prompts comme un processus itératif. Vérifiez le résultat, conservez les éléments efficaces et essayez des consignes plus précises pour les points problématiques.

Supposer que les deux modèles proposent les mêmes fonctions : Gemini Omni Flash et Veo 3.1 se distinguent par leurs principales fonctions. Par exemple, la retouche en plusieurs échanges fait partie des points forts d’Omni Flash, tandis que l’audio natif et l’extension vidéo figurent parmi les fonctions indiquées dans la documentation de Veo 3.1. Identifiez la fonction nécessaire avant de choisir un modèle.

Supposer qu’une image de référence verrouille tous les détails : le guidage par image aide le modèle à traiter la scène, mais les sources ne garantissent pas que tous les détails resteront inchangés. Comparez le résultat à la référence et formulez les corrections nécessaires.

Étapes suivantes

Commencez par rédiger un prompt de base, bref et clair, pour une même scène. Évaluez ensuite le résultat et transformez un seul changement en instruction de suivi. Consigner les différentes versions du prompt et le modèle utilisé rend l’évaluation visuelle au sein de l’équipe plus méthodique. Cette démarche correspond à l’approche recommandée par Google : expérimenter et affiner les consignes en fonction des réponses observées.

Pour les équipes d’architecture et de design d’intérieur, ce flux de travail peut servir à transformer une idée d’espace en récit animé pour une présentation de concept, ou à utiliser une image existante comme référence pour guider une vidéo. Toutefois, les sources ne précisent ni le coût de production, ni les exigences matérielles, ni les conditions de licence, ni la compatibilité avec un logiciel de conception particulier. Avant la livraison d’un projet réel, vérifiez séparément les conditions d’accès, d’utilisation et de compatibilité du flux de travail ; considérez la vidéo générée comme un outil de communication visuelle, et non comme un substitut aux décisions de conception.

Sources et licence

Ce guide est adapté de la documentation de Google sur la création vidéo avec l’API Gemini et sur la conception des prompts. Sauf indication contraire, le contenu de ces deux pages est sous licence CC BY 4.0. Les exemples de prompts ont été rédigés spécifiquement pour des usages architecturaux à partir des recommandations techniques des sources.

Sources

2 sources
A(
ai.google.dev (CC BY 4.0)ai.google.dev/gemini-api/docs/video
Résumé
A(
ai.google.dev (CC BY 4.0)ai.google.dev/gemini-api/docs/prompting-strategies
Résumé

Les textes sources ne sont pas republiés ; les courtes citations sont signalées, le reste est notre propre résumé et commentaire.

L’avis de 3dsınıfı
3dL’analyse de la rédaction

Pour les équipes d’architecture et de visualisation, cette approche peut transformer une idée visuelle fixe en court récit animé et faciliter l’évaluation rapide de plusieurs variantes. Le travail à partir d’images de référence et la retouche en plusieurs échanges peuvent notamment rendre les essais au stade du concept plus faciles à gérer.

Pour les bureaux et les étudiants en Turquie, il convient de vérifier les conditions d’accès à l’API, les coûts d’utilisation et les licences avant de prendre une décision ; les sources ne détaillent pas ces aspects. Les exigences matérielles locales n’étant pas non plus précisées, il est préférable de tester à petite échelle l’adéquation de la génération avec le flux de travail existant et les attentes de livraison. Les résultats doivent être considérés comme des supports de communication visuelle, et non comme des données de conception définitives.

Questions fréquentes

Faut-il utiliser Gemini Omni Flash ou Veo 3.1 pour créer une vidéo d’architecture ?

Gemini Omni Flash peut convenir à la création de courtes vidéos à partir de texte ou d’images et à leur retouche en plusieurs échanges. Si vous avez besoin d’audio natif, d’étendre une vidéo ou de générer à partir d’images spécifiques, consultez les fonctions documentées de Veo 3.1.

Comment rédiger un prompt vidéo d’architecture avec l’API Gemini ?

Décrivez clairement l’espace, les éléments à préserver et le changement visuel souhaité. Vérifiez le résultat, puis concentrez le tour suivant sur une correction précise.

Veo 3.1 prend-il en charge le guidage par image et l’audio ?

Selon la documentation de Google, Veo 3.1 prend en charge le guidage par image et la génération audio native. Le guidage par image est décrit via l’API generateContent.

Les commentaires et le forum sont en turc.Rejoindre la discussion
+

À lire aussi