Dernières actualités
Transformer un rendu architectural en vidéo : guide pas à pas pour Gemini OmniRendu architectural avec Unreal Engine Path Tracer : guide pas à pasCréer des visuels architecturaux avec Nano Banana : guide des prompts et retouchesMechaPaint 2.0 ajoute la peinture PBR et des outils de géométrie à partir de photosVeras 5.2 est disponible : un modèle 3D modifiable à partir de référencesBlender sur Android : la version 5.3 présentée sur une tablette WacomDesign Museum Gent rénové : une extension en briques blanches issues de déchetsCinema 4D 2026.4 intègre un serveur MCP et des autorisations d’outilsGemini 4 Argon annoncé : 1 million de tokens en sortie et un accès progressifChaos Vantage 3.4 est disponible : OpenPBR, Chaos Scans et DLSS 4.5
TutorielsVeoGoogleGemini Omni 1.1 Flash Preview

Transformer un rendu architectural en vidéo : guide pas à pas pour Gemini Omni

Les guides publiés par Google pour Gemini Omni et Veo expliquent comment utiliser une image comme première image d’une vidéo et structurer le prompt en précisant la scène, le mouvement et la caméra. Voici un flux de travail concret pour les visuels architecturaux.

Un intérieur contemporain paisible, baigné de lumière naturelle, avec des rideaux qui bougent légèrementImage IA
Image d’illustration générée par IA.Image : 3dsınıfı / FCA AI

En bref

  1. Gemini Omni et certains modèles Veo peuvent utiliser une image existante comme première image d’une vidéo.
  2. Pour Gemini Omni 1.1 Flash Preview, la durée vidéo peut être réglée entre 3 et 10 secondes.
  3. Dans une requête API, le format peut être défini sur 16:9 ou 9:16 ; si aucune résolution n’est précisée, la valeur par défaut est 720p.
  4. Le prompt peut être structuré en décrivant le sujet, le mouvement, la scène et la caméra.

Ce que vous apprendrez dans ce guide

Vous apprendrez à utiliser un rendu d’intérieur ou un visuel architectural comme première image d’une courte vidéo, puis à décrire par écrit ce qui doit changer dans la séquence. Selon la documentation de Google, Gemini Omni et Veo prennent en charge la génération de vidéos à partir d’une image existante. Le flux de travail présenté ici s’adresse aux architectes, architectes d’intérieur et artistes 3D qui souhaitent animer directement un visuel.

La distinction essentielle est la suivante : au lieu de rédiger uniquement un prompt vidéo, vous fournissez une image existante comme première image, puis décrivez séparément le mouvement. Le prompt peut préciser ce qui est visible, ce que cela fait, où et quand se déroule la scène, ainsi que le comportement de la caméra. Il n’est pas nécessaire d’utiliser toutes ces rubriques dans chaque prompt ; toutefois, les envisager séparément aide à exprimer plus clairement ce que vous souhaitez voir changer.

Prérequis et choix du modèle

Vous devez vous connecter à un compte Google Cloud et sélectionner ou créer un projet Google Cloud. Pour utiliser l’API, il faut également activer Agent Platform API et configurer l’authentification pour votre environnement. La documentation indique qu’aucune configuration d’authentification supplémentaire n’est nécessaire dans la console ; pour les exemples REST, vous pouvez utiliser les identifiants de Google Cloud CLI.

La génération de vidéos à partir d’une image est accessible via Gemini Enterprise Agent Platform Media Studio ou l’API de génération vidéo. Dans ce guide, nous utilisons gemini-omni-1.1-flash-preview, dont le nom de modèle est explicitement indiqué. Parmi les autres modèles répertoriés dans la documentation comme prenant en charge cette fonctionnalité figurent Veo 3.1 Lite, Veo 3.1, Veo 3.1 Fast, Veo 3.0 et Veo 3.0 Fast. Pour les détails non précisés ici concernant l’accès aux modèles, les conditions du compte et les frais d’utilisation, consultez les informations produit à jour sur Google Cloud.

Dans l’exemple d’API, l’image d’entrée est fournie sous forme d’adresse Cloud Storage, avec le type MIME image/png. Pour Gemini Omni 1.1 Flash Preview, les résolutions proposées sont 360p, 720p, 1080p et 4K ; les formats disponibles sont 16:9 et 9:16. Si aucune résolution n’est renseignée, la valeur par défaut est 720p. La durée de la vidéo peut être définie en secondes entières, entre 3 et 10. Il s’agit des paramètres d’API décrits dans la documentation ; ne supposez pas que les mêmes options sont disponibles avec d’autres modèles ou interfaces.

Générer une vidéo à partir d’un visuel architectural, étape par étape

  1. Choisissez l’image de départ. Sélectionnez le visuel architectural que vous souhaitez utiliser : par exemple, une perspective d’intérieur ou une visualisation de façade. Il servira de première image à la vidéo générée. Notez au préalable les éléments que vous souhaitez voir bouger : arbres, rideaux, surface de l’eau ou caméra.

  2. Choisissez la méthode de génération. Utilisez Media Studio si vous passez par une interface ; optez pour l’API si vous souhaitez mettre en place un flux de travail programmatique. Avec l’API, vous devez sélectionner un projet et activer Agent Platform API. L’authentification doit également être configurée pour l’utilisation de REST. Dans l’exemple d’API de génération vidéo à partir d’une image, la requête est envoyée avec la tâche image_to_video.

  3. Structurez le prompt en plusieurs éléments. Le guide de Google consacré aux prompts aborde des éléments tels que le sujet, l’action, la scène ou le contexte, l’angle de caméra et le mouvement de caméra. Dans une scène architecturale, le « sujet » peut être l’espace ou le bâtiment ; l’« action » décrit le mouvement attendu dans l’image. Ajoutez ensuite des précisions sur la scène, comme la lumière du jour, la météo et l’environnement, puis décrivez la caméra — plan fixe ou mouvement lent, par exemple.

  4. Utilisez l’exemple ci-dessous comme prompt de départ. Essayez chaque prompt séparément pour évaluer lequel s’accorde le mieux avec votre visuel.

Prompt
A calm architectural interior, sheer curtains moving gently in a light breeze, soft morning daylight shifting across the timber floor, wide shot, static camera, preserve the original room layout and material palette

Dans cet exemple, l’espace est le sujet, le mouvement des rideaux constitue l’action, la lumière matinale décrit la scène, et le plan large ainsi que la caméra fixe précisent le cadrage. Le prompt vise en particulier à ajouter un mouvement léger et maîtrisé à une présentation architecturale statique.

  1. Limitez les mouvements pour les scènes extérieures. Décrire le mouvement de l’environnement plutôt que celui du bâtiment permet de préciser quels éléments de la scène doivent s’animer.

Prompt
A contemporary house in a landscaped garden, leaves and tall grasses moving gently in the wind, late afternoon light, a slow dolly in toward the entrance, wide establishing shot

Ici, le mouvement des plantes, la lumière et le rapprochement de la caméra vers le bâtiment sont décrits séparément. « Dolly in » désigne le déplacement physique de la caméra vers le sujet ; il ne faut pas le confondre avec un zoom, qui correspond uniquement à un rapprochement optique.

  1. Réglez les paramètres de l’API en fonction du résultat souhaité. La requête comprend l’identifiant du modèle, le prompt textuel et l’image d’entrée ; le type de sortie est défini sur vidéo et la tâche choisie est image_to_video. Pour une présentation horizontale, vous pouvez utiliser le format 16:9 indiqué dans la documentation ; pour une publication verticale, choisissez 9:16. Définissez une durée comprise entre 3 et 10 secondes. Si vous ne précisez pas la résolution de sortie, l’exemple d’API utilise 720p par défaut.

  2. Suivez la génération et vérifiez le résultat. Google indique que la génération d’une vidéo peut prendre plus d’une minute. Avec une requête synchrone, la vidéo peut être téléchargée une fois prête ; avec une requête asynchrone, un paramètre d’arrière-plan est utilisé et le résultat peut être interrogé ultérieurement au moyen de l’identifiant de l’interaction. Les requêtes asynchrones sont conservées jusqu’à 14 jours. Avant d’utiliser la vidéo dans une présentation, vérifiez que les formes architecturales, les matériaux et les mouvements restent cohérents avec l’image de départ.

Erreurs fréquentes

Réduire le prompt à une phrase vague : une demande générale comme « crée une belle vidéo architecturale » ne distingue pas le sujet, le mouvement, l’environnement et les choix de caméra. Indiquez plutôt clairement quel élément doit bouger et si la caméra doit rester fixe ou se déplacer.

Associer des consignes de caméra contradictoires : demander dans le même prompt que la caméra reste fixe et s’approche du bâtiment peut créer une contradiction. Commencez par choisir un seul comportement de caméra ; essayez-en un autre après avoir examiné le résultat.

Oublier la durée et le format : la durée dans l’API se règle entre 3 et 10 secondes ; si le format n’est pas précisé, la documentation indique qu’il peut être déduit du prompt. Néanmoins, pour obtenir un rendu horizontal ou vertical, indiquer explicitement le format permet de mieux contrôler l’essai.

Considérer le résultat comme identique au visuel source : la documentation explique que l’image sert de première image et que le prompt guide la génération ; elle ne garantit pas que la géométrie architecturale ou les matériaux seront préservés en toutes circonstances. Examinez donc attentivement la vidéo générée avant une présentation importante ou une livraison client.

Étapes suivantes : quelle place dans un flux de travail architectural ?

Cette méthode peut être testée par les équipes d’architecture et d’architecture d’intérieur qui souhaitent préparer d’autres formats de présentation en ajoutant de légers mouvements d’ambiance à une image fixe. Elle permet notamment d’explorer différentes consignes pour le mouvement de caméra, les variations de lumière ou les éléments de scène tels que les plantes et les rideaux. Il faut toutefois vérifier que l’image source et la vidéo respectent la géométrie du projet ; ne considérez pas le résultat comme un dessin technique, un document coté ou une représentation de conception définitive.

Les étudiants et les artistes 3D peuvent tester différents mouvements et cadrages à partir de la même image initiale. Dans les agences, il convient d’évaluer à l’avance le compte et le service qui traiteront les visuels du projet, les conditions d’accès et les éventuels frais d’utilisation. Comme les sources ne précisent pas les tarifs, consultez les conditions actuelles du produit pour établir votre budget. Avec l’API, il faut également intégrer au flux de travail les étapes de sélection du projet, d’activation de l’API et d’authentification.

Sources et licence

Ce guide est une adaptation en turc des pages « Video generation prompt guide » et « Generate videos from an image » de Google Cloud. Les deux sources sont publiées sous licence CC BY 4.0.

Sources

2 sources
C(
cloud.google.com (CC BY 4.0)cloud.google.com/vertex-ai/generative-ai/docs/video/video-gen-prompt-guide
Résumé
C(
cloud.google.com (CC BY 4.0)cloud.google.com/vertex-ai/generative-ai/docs/video/generate-videos-from-an-image
Résumé

Les textes sources ne sont pas republiés ; les courtes citations sont signalées, le reste est notre propre résumé et commentaire.

L’avis de 3dsınıfı
3dL’analyse de la rédaction

Pour les agences d’architecture et d’architecture d’intérieur, l’intérêt pratique de cette approche est de pouvoir créer de courtes variantes de présentation à partir d’un rendu existant. Décrire le mouvement de la caméra et de l’environnement dans le prompt peut être utile aux équipes qui souhaitent essayer une autre forme de narration à partir d’une image fixe. Il ne faut toutefois pas supposer que le résultat préservera à l’identique la géométrie du projet et les choix de matériaux ; une vérification avant livraison est indispensable.

En Turquie, les agences et les étudiants devraient clarifier l’accès à Google Cloud, les étapes de configuration de l’API et les frais d’utilisation en vigueur avant de commencer leurs essais. Les sources ne donnent pas d’informations sur les prix. Par ailleurs, la disponibilité de l’option 4K ne signifie pas qu’elle soit nécessaire dans tous les flux de travail ; la résolution et la durée de sortie doivent être choisies en fonction de l’usage prévu.

Questions fréquentes

Peut-on générer une vidéo à partir d’une image avec Gemini Omni ?

Oui. Selon la documentation de Google, Gemini Omni permet de générer une vidéo à partir d’une image existante utilisée comme première image. Cette fonctionnalité est accessible via Media Studio ou l’API.

Quelle peut être la durée d’une vidéo générée avec Gemini Omni 1.1 Flash Preview ?

Dans la documentation de l’API, la durée peut être définie en secondes entières entre 3 et 10 secondes.

Quelles résolutions sont proposées pour la génération vidéo à partir d’une image ?

Pour Gemini Omni 1.1 Flash Preview, les options répertoriées sont 360p, 720p, 1080p et 4K. Si aucune résolution n’est précisée, la valeur par défaut est 720p.

Les commentaires et le forum sont en turc.Rejoindre la discussion
+

À lire aussi