En bref
- Gemini Omni et Veo peuvent utiliser une image comme première image d’une vidéo.
- La documentation indique des durées de 3 à 10 secondes pour Gemini Omni 1.1 Flash Preview.
- Le prompt peut être structuré en descriptions du sujet, du mouvement, du lieu et de la caméra pour mieux maîtriser le résultat.
- L’utilisation de l’API REST nécessite un projet Google Cloud, l’Agent Platform API et une authentification.
Ce que vous allez apprendre dans ce guide
Lorsqu’on transforme une image d’architecture en courte vidéo, l’objectif n’est pas seulement d’ajouter du mouvement à la scène, mais aussi de préserver la lisibilité du projet. Ce guide explique comment utiliser une image existante comme première image, décrire les mouvements avec des instructions brèves et précises, définir le comportement de la caméra et comprendre les principaux paramètres de l’exemple d’API. Les exemples sont conçus pour des visualisations d’intérieurs résidentiels, de façades et de paysages.
D’après la documentation de Google, Gemini Omni et Veo peuvent générer une vidéo à partir d’une image existante. Cette fonctionnalité est proposée via Media Studio de Gemini Enterprise Agent Platform ou par l’intermédiaire de l’API de génération vidéo. Comme le résultat peut varier d’un prompt à l’autre, il est préférable de commencer par des essais courts centrés sur une seule idée de mouvement.
Prérequis : compte, modèle et image
Pour utiliser Media Studio ou l’API, vous avez besoin d’un compte Google Cloud et d’un projet Google Cloud sélectionné ou créé. Si vous optez pour l’API, l’Agent Platform API doit être activée et les requêtes doivent être authentifiées. La documentation précise également que les utilisateurs de l’exemple REST dans un environnement de développement local doivent installer Google Cloud CLI et s’y authentifier. Elle indique qu’aucune configuration d’authentification supplémentaire n’est nécessaire pour accéder à la console.
Parmi les modèles documentés pour la génération de vidéos à partir d’images figurent gemini-omni-1.1-flash-preview ainsi que plusieurs modèles Veo 3.0 et Veo 3.1. Les étapes ci-dessous s’appuient sur l’exemple d’API Gemini Omni, qui décrit explicitement l’image d’entrée et les paramètres. Dans la requête API, l’image d’entrée est indiquée par un URI Cloud Storage ; l’exemple utilise le type MIME image/png. Avant de commencer, vérifiez donc que l’image choisie est accessible dans le projet et que son emplacement est correctement renseigné dans la requête.
L’exemple d’API propose des durées entières de 3 à 10 secondes et les formats d’image 16:9 ou 9:16. Si aucune résolution n’est précisée, la sortie est réglée par défaut sur 720p ; la documentation répertorie les résolutions 360p, 720p, 1080p et 4K pour gemini-omni-1.1-flash-preview. Si vous utilisez un autre modèle, vérifiez séparément les paramètres qu’il prend en charge. Les sources ne fournissent aucune information sur les prix.
Étape par étape : préparer un prompt vidéo pour une image d’architecture
Définissez un seul objectif. Choisissez la caractéristique de l’image que vous souhaitez animer : par exemple, la lumière du jour qui évolue dans un intérieur, un lent déplacement de caméra le long d’une façade ou le léger mouvement des feuilles dans une cour. Plutôt que de décrire plusieurs événements importants dans le même prompt, limitez-vous à une action principale.
Nommez le sujet et le contexte. Le guide de prompting décrit le sujet, l’action et le contexte de la scène comme des éléments distincts. Dans un projet d’architecture, le sujet peut être une pièce, une façade, un escalier ou une cour. Pour établir le contexte, indiquez brièvement les matériaux, le moment de la journée et la qualité de la lumière. Demander l’ajout de nouveaux éléments architecturaux absents de l’image peut aller à l’encontre de l’objectif de préserver le projet.
Décrivez les mouvements avec mesure. Pour le premier essai, demandez un mouvement subtil : la lumière qui glisse lentement sur un mur, ou des rideaux et des plantes qui bougent légèrement, par exemple. Le guide source souligne que l’action décrit ce qui se passe dans la vidéo. Précisez donc ce qui bouge et comment, plutôt que de vous limiter à des formulations générales comme « donnez un rendu cinématographique ».
Choisissez le comportement de la caméra. Vous pouvez indiquer une caméra fixe, un lent panoramique horizontal ou un mouvement de travelling. Le mouvement de caméra influe sur la perception de l’espace ; évitez donc d’en combiner plusieurs dans un même prompt. Google précise que la prise en charge de certains mouvements de caméra avancés n’est pas officiellement garantie et que la fiabilité des résultats peut varier.
Les exemples ci-dessous ont été conçus pour des usages architecturaux dans le cadre de ce guide ; ils ne sont pas repris mot pour mot de la source.
A calm architectural interior visualization of a contemporary living room, soft morning daylight slowly moving across the pale stone floor, sheer curtains gently shifting in a light breeze, preserve the room layout and materials, static wide shot, subtle natural motionDans ce prompt, le principal changement est la lumière du jour qui progresse sur le sol ; le mouvement des rideaux reste secondaire et léger. Le plan large fixe met en valeur l’agencement général de l’intérieur.
A contemporary timber house seen from the garden, leaves on nearby trees moving gently in the breeze, soft overcast daylight, preserve the façade design and proportions, slow truck right along the garden edge, restrained architectural visualizationDans cet exemple consacré à une façade, la caméra se déplace lentement vers la droite tandis que les feuilles des arbres bougent légèrement. Demander de préserver les proportions de la façade souligne le rôle de l’image dans la présentation du projet ; le résultat doit néanmoins être vérifié.
A quiet courtyard in a contemporary residential project at golden hour, subtle movement in ornamental grasses, warm light changing gently on the paving, preserve the original landscape composition, static wide shot, realistic restrained motionLe prompt préparé pour une cour décrit un mouvement limité du paysage et une variation de la lumière. Une caméra fixe peut être testée pour les présentations où la composition doit rester plus importante que le mouvement.
Envoyez l’image et les paramètres ensemble. Dans l’exemple d’API, la requête comprend le prompt textuel ainsi que l’image d’entrée, et la tâche est indiquée comme
image_to_video. Vous pouvez également ajouter à la requête le format d’image, la résolution et la durée. Pour un essai rapide, un format 16:9 et une durée courte peuvent convenir ; il s’agit toutefois de paramètres donnés à titre d’exemple, et non de choix adaptés à tous les projets.Attendez la fin du traitement et examinez le résultat. La documentation indique que la génération vidéo peut prendre plus d’une minute. Une requête synchrone renvoie le résultat une fois terminée ; pour les requêtes asynchrones exécutées en arrière-plan, le résultat est récupéré ultérieurement à l’aide de l’identifiant d’interaction. Les requêtes asynchrones sont conservées pendant 14 jours au maximum.
Erreurs fréquentes
Demander trop de mouvements : décrire simultanément un changement de lumière, un mouvement de caméra, des personnages en mouvement et des phénomènes météorologiques peut compliquer l’évaluation du résultat. Commencez par une version avec un seul mouvement ; si elle fonctionne, ajoutez un autre élément lors du deuxième essai.
Ne pas préciser le mouvement de caméra : au lieu de demander de « faire bouger la caméra », choisissez un mouvement précis, comme un plan fixe, un panoramique ou un travelling. Les mouvements de caméra avancés ne sont pas nécessairement aussi fiables dans tous les cas.
Ne pas vérifier la durée et la résolution : l’exemple d’API indique une durée comprise entre 3 et 10 secondes. Avant d’envoyer la requête, vérifiez les résolutions et les formats d’image acceptés par le modèle ; la documentation précise que la résolution par défaut est de 720p si aucune n’est spécifiée.
Considérer le résultat comme un document de conception : la génération vidéo anime l’image, mais les sources ne garantissent ni la fidélité architecturale ni la préservation à l’identique des éléments de conception dans chaque image. Évaluez la vidéo générée comme une ébauche de narration visuelle plutôt que comme un dessin technique ou un relevé exact du projet.
Utilisation dans un workflow d’architecture et de visualisation
Cette méthode peut être testée par les agences d’architecture, les architectes d’intérieur et les artistes 3D qui souhaitent créer une courte vidéo de présentation à partir d’une image fixe d’intérieur ou de façade. Un brouillon animé peut aider à exprimer la lumière, l’atmosphère ou la sensation d’espace lors des échanges autour d’un projet. Toutefois, les sources disponibles ne garantissent ni le niveau de fidélité du résultat pour une présentation professionnelle ni la préservation des détails architecturaux dans toutes les scènes. Il convient donc de comparer le résultat aux visuels du projet et de le générer à nouveau si nécessaire.
Deux aspects pratiques sont à prendre en compte dans le workflow : les prérequis de configuration, comme le projet cloud et l’accès à l’API, et les paramètres de durée, de résolution et de format pris en charge par le modèle. Les sources ne précisent ni les prix ni les exigences en matière de matériel local ; plutôt que de faire des suppositions, vérifiez les conditions de service et les paramètres du projet à jour avant la génération. L’exemple d’API, qui envoie l’image d’entrée via Cloud Storage, montre que l’emplacement du fichier fait aussi partie du processus.
Étapes suivantes
Pour le premier essai, conservez la même image et les mêmes paramètres, et modifiez uniquement la description du mouvement dans le prompt. Vous pourrez ainsi comparer l’influence respective du mouvement de caméra et de la description de la lumière. Testez ensuite la version qui vous convient avec d’autres paramètres de durée ou de format. Si vous utilisez REST, gardez à l’esprit qu’une requête synchrone renvoie immédiatement le résultat, tandis qu’une requête asynchrone nécessite de rechercher ultérieurement l’identifiant d’interaction.
Sources et licence
Ce tutoriel a été adapté en turc à partir des guides officiels de Google Cloud intitulés « Video generation prompt guide » et « Generate videos from an image ». Les deux sources sont publiées sous licence CC BY 4.0. Les exemples de prompts architecturaux ont été créés spécialement pour cet article.
Sources
2 sourcesLes textes sources ne sont pas republiés ; les courtes citations sont signalées, le reste est notre propre résumé et commentaire.
La transformation d’une image d’architecture en courte vidéo offre une piste pratique pour exprimer une atmosphère, notamment lors de présentations de concepts. Cependant, les sources ne garantissent pas que les décisions de conception de l’image seront préservées à l’identique dans chaque image ; il est donc préférable de considérer le résultat comme une ébauche de narration maîtrisée, et non comme une validation du projet.
Pour les agences et les étudiants en Turquie, il faut tenir compte avant de commencer de prérequis tels que le projet Google Cloud, l’accès à l’API et le stockage de l’image dans le cloud. Les sources ne précisant ni les prix ni les exigences en matière de matériel local, évitez toute estimation des coûts et vérifiez les conditions de service avant la génération.
Questions fréquentes
Peut-on générer une vidéo à partir d’une image d’architecture avec Gemini Omni ?
Oui. D’après la documentation Google Cloud, Gemini Omni et Veo peuvent utiliser une image existante comme première image d’une vidéo.
Quelles durées Gemini Omni prend-il en charge pour la génération vidéo à partir d’une image ?
L’exemple d’API indique une durée exprimée en secondes entières, comprise entre 3 et 10 secondes.
De quoi a-t-on besoin pour générer une vidéo avec l’API Gemini Omni ?
Il faut un compte et un projet Google Cloud, l’Agent Platform API activée et une authentification. La requête d’exemple transmet l’image à l’aide d’un URI Cloud Storage.



