En bref
- Gemini Omni Flash est recommandé pour générer de courtes vidéos à partir de texte et d’images, ainsi que pour les retouches en plusieurs tours.
- Veo 3.1 propose des fonctions telles que le prolongement de scène, le ciblage de certaines images et la génération audio intégrée.
- Des prompts précisant clairement la tâche, les contraintes et le résultat attendu peuvent rendre le processus de génération plus contrôlable.
- La documentation vidéo de l’API Gemini de Google explique le choix du modèle, tandis que le guide de conception des prompts présente les méthodes pour formuler les instructions.
Ce que vous apprendrez dans ce guide
Transformer une image d’architecture en courte vidéo ou demander une modification d’une scène générée ne consiste pas seulement à décrire un espace impressionnant. Le prompt doit préciser ce qui se passe dans la scène, le comportement de la caméra, les éléments à préserver et l’apparence attendue du résultat. Dans ce guide, nous associerons les modèles vidéo décrits dans la documentation de l’API Gemini aux besoins de la visualisation architecturale, préparerons des exemples de prompts pratiques et présenterons une méthode pour améliorer les résultats par étapes.
Dans la documentation de Google, Gemini Omni Flash est présenté comme un choix général pour générer de courtes vidéos à partir de texte et d’images, ainsi que pour les retoucher en plusieurs tours. Veo 3.1 se distingue pour des besoins tels que le prolongement de scène, le contrôle de l’image finale ou l’intégration à d’anciens flux de travail. Ces descriptions des capacités des modèles proviennent de la documentation de l’éditeur ; elles ne signifient pas que les résultats seront identiques pour toutes les scènes.
Prérequis et choix du modèle
Ce guide s’appuie sur Gemini Omni Flash et Veo 3.1, cités dans la documentation de génération vidéo de l’API Gemini. Omni Flash permet de créer de courtes vidéos à partir de texte et d’images ; le modèle prend également en charge la retouche conversationnelle en plusieurs tours via l’Interactions API. Veo 3.1 est présenté avec des fonctions de génération vidéo via l’API generateContent, d’audio intégré, de prolongement de scène, de génération ciblée sur certaines images et de guidage par image.
La documentation ne fournit pas de détails sur la création d’un compte, la facturation, les conditions d’accès ou le matériel requis. Avant de commencer, vérifiez donc séparément les conditions d’accès actuelles à l’API et les informations tarifaires ; ce guide ne suppose aucun abonnement ni besoin de matériel local particulier. Comme la documentation vidéo décrit l’utilisation de l’API, les exemples reposent sur un flux de travail par API. Les étapes de navigation dans les menus et les paramètres n’étant pas indiqués, ce guide ne décrit pas de parcours précis dans une interface.
Choisissez le modèle en fonction de vos besoins :
Pour créer un court clip à partir de texte ou d’images, puis le retoucher au fil de conversations, envisagez Omni Flash.
Si vous devez prolonger une scène, orienter la génération d’images spécifiques ou utiliser l’audio intégré, envisagez Veo 3.1.
Si vous devez analyser une vidéo existante plutôt que d’en générer une, consultez le guide distinct « Video understanding » recommandé dans la documentation.
Étape par étape : prompts vidéo pour l’architecture
Le guide de conception des prompts de Google recommande des instructions claires et précises, qui indiquent la tâche, les contraintes et le format de sortie attendu. Il souligne également que l’amélioration des prompts exige des essais et des ajustements. Les exemples ci-dessous ont été rédigés spécialement pour des usages architecturaux ; ils ne sont pas copiés des exemples de prompts des sources.
1. Commencez par décrire la scène et le mouvement
Dans le premier prompt, précisez ensemble le type de projet, l’espace représenté, la lumière et le mouvement de caméra souhaité. Plutôt que d’accumuler des adjectifs vagues, concentrez-vous sur des éléments observables dans la vidéo.
Create a short architectural video of a calm contemporary living room with pale oak flooring, a limestone feature wall, and soft morning light entering through tall windows. Show the room from the doorway as the camera slowly moves toward the seating area. Keep the furniture layout stable and the atmosphere quiet and natural.Cette description distingue clairement les caractéristiques de la pièce, les conditions d’éclairage et le mouvement de caméra. Pour évaluer le premier résultat, vérifiez par exemple si l’agencement de la pièce est préservé, si la caméra avance dans la direction souhaitée et si la description de la lumière a été comprise. Lors de l’essai suivant, au lieu de tout réécrire, précisez l’instruction qui vous semble poser problème.
2. Utilisez une image de référence comme entrée de guidage
Omni Flash peut traiter du texte et des images ; Veo 3.1 prend lui aussi en charge le guidage par image. Ajoutez une image adaptée comme entrée et précisez dans le texte les éléments visuels que vous souhaitez conserver. Cet exemple est conçu pour utiliser une image de rendu comme entrée vidéo.
Use the provided architectural image as the visual reference for the room. Create a short video that preserves its material palette, window positions, and furniture arrangement. Show a gentle camera move from the dining area toward the kitchen, with consistent daylight and no new furniture.Les consignes de préservation portent ici sur les principales décisions de conception visibles dans l’image. Le modèle peut interpréter différemment des détails qui ne figurent pas dans l’image de référence ; il est donc utile de nommer également dans le texte les matériaux et les choix d’agencement essentiels. Les sources ne garantissent pas que le modèle préservera parfaitement chaque détail.
3. Améliorez le premier résultat en un tour de retouche
La prise en charge de la retouche conversationnelle en plusieurs tours par Omni Flash permet de demander une modification précise après la première génération. Décrire une seule modification majeure par tour rend plus claire la nature du changement attendu.
In the current video, replace the dark coffee table with a low, light-oak table. Keep the room layout, camera movement, window light, and all other furniture unchanged.Cet exemple demande uniquement de remplacer la table basse et de conserver les autres éléments. Si d’autres éléments changent également dans le résultat, précisez plus clairement au tour suivant ceux qui doivent rester inchangés. La retouche en plusieurs tours est bien documentée pour Omni Flash, mais son succès n’est pas garanti pour chaque scène.
4. Définissez séparément le besoin de prolonger une scène
Si vous devez générer la suite d’un clip, envisagez la fonction de prolongement de scène documentée pour Veo 3.1. Les sources présentent cette fonction, mais ne détaillent ni les étapes à suivre dans l’interface ni les paramètres ; le prompt ci-dessous porte donc sur le contenu de la suite.
Extend the architectural scene with a slow continuation into the adjoining courtyard. Maintain the same stone surfaces, soft daylight, and restrained visual mood. Let the view reveal the courtyard gradually, without changing the established architectural style.Cet exemple décrit le langage visuel à maintenir dans la suite de la scène. Pour la mise en œuvre technique du prolongement, suivez les instructions à jour de la documentation Veo ; ne supposez pas l’existence d’un nom de commande ou d’un paramètre d’API qui n’est pas mentionné ici.
Erreurs fréquentes
Des mouvements décrits de façon vague : au lieu d’utiliser des expressions ouvertes à l’interprétation, comme « rendre la scène plus cinématographique », indiquez la position de départ de la caméra et la direction qu’elle doit prendre.
Demander trop de changements dans un même prompt : modifier la caméra, les matériaux, la lumière et le mobilier en un seul tour complique l’évaluation du résultat. Commencez par établir la scène de base, puis demandez les changements précis lors de tours distincts.
Ne pas préciser les éléments à préserver : fournir une image en entrée ne garantit pas que chaque décision de conception sera automatiquement conservée. Indiquez également dans le texte les caractéristiques importantes des matériaux, de l’agencement et de la lumière.
Choisir le modèle sans tenir compte des besoins : la documentation distingue Omni Flash pour les courtes vidéos et la retouche conversationnelle, et Veo 3.1 pour les besoins de prolongement de scène, de génération ciblée sur certaines images ou d’audio intégré. Un choix inadapté peut entraîner des essais inutiles.
Attendre un résultat parfait dès le premier essai : la conception de prompts est un processus itératif. Examinez le résultat généré, identifiez ce qui manque ou ce qui ne convient pas, puis modifiez les instructions de manière ciblée.
Étapes suivantes dans un flux de travail d’architecture et de visualisation
Les agences d’architecture et les étudiants peuvent explorer, à des fins de présentation, l’atmosphère d’un intérieur, l’association des matériaux ou la sensation de circulation dans un volume grâce à de courts mouvements de caméra. Le travail à partir d’une image peut permettre d’expérimenter des mouvements à partir d’un rendu existant ; toutefois, les sources ne garantissent pas que le modèle conservera à l’identique la géométrie du projet et tous les détails visuels. Il vaut donc mieux considérer le résultat comme un essai de narration visuelle plutôt que comme un dessin technique ou un document de projet définitif.
Avant de l’intégrer à un flux de travail d’équipe, il convient de vérifier l’accès à l’API, les conditions actuelles de licence et de coût, ainsi que la compatibilité avec le processus de production existant. La documentation ne fournit aucune information sur les tarifs, les besoins en matériel local ou la compatibilité avec certains logiciels de conception. Commencer par une petite scène test et noter, à chaque tour de prompt, les décisions de conception qui sont préservées ou modifiées permet une évaluation plus mesurée.
Sources et licence
Ce guide a été adapté en turc à partir de la documentation de Google sur la génération vidéo avec l’API Gemini et les stratégies de conception des prompts. Les deux sources sont publiées sous licence CC BY 4.0. Les exemples de prompts architecturaux ont été rédigés spécialement pour ce guide ; les exemples de prompts des sources n’ont pas été copiés.
Sources
2 sourcesLes textes sources ne sont pas republiés ; les courtes citations sont signalées, le reste est notre propre résumé et commentaire.
Pour les agences d’architecture et les étudiants en Turquie, cette approche peut s’avérer pratique pour créer de courtes vidéos de présentation à partir de rendus existants et tester différentes mises en scène. Préciser clairement dès le départ les éléments de l’image à préserver facilite notamment le suivi de l’intention de conception.
Toutefois, les sources ne précisent ni les conditions d’accès à l’API, ni les coûts et les licences, ni la compatibilité avec certains logiciels de conception. Il est donc conseillé de tester la méthode sur une petite scène et de vérifier les conditions à jour avant de l’intégrer directement au flux de production. Mieux vaut considérer les résultats comme des propositions de narration visuelle, et non comme une garantie d’exactitude technique.
Questions fréquentes
À quoi peut servir Gemini Omni Flash pour la génération de vidéos d’architecture ?
Selon la documentation de Google, il peut créer de courtes vidéos à partir de texte et d’images et prendre en charge la retouche en plusieurs tours via l’Interactions API.
Quelle est la différence entre Gemini Omni Flash et Veo 3.1 ?
Omni Flash est recommandé pour la génération vidéo générale et la retouche conversationnelle. Veo 3.1 est présenté avec des fonctions telles que le prolongement de scène, la génération ciblée sur certaines images et l’audio intégré.
Quel matériel faut-il pour générer des vidéos avec l’API Gemini ?
La documentation source ne précise pas le matériel requis. Consultez la documentation actuelle de l’API Gemini pour connaître les conditions d’accès et les coûts.



