En bref
- Avec Veo 3.1 dans Gemini API, il est possible de générer des vidéos de 8 secondes ; les résolutions 720p, 1080p et 4K sont indiquées.
- Selon le guide Gemini API, il est possible de générer une vidéo en précisant la première et la dernière image, de prolonger une vidéo et d’utiliser jusqu’à trois images de référence.
- Dans les exemples Vertex AI, l’image est fournie en entrée via un URI Cloud Storage.
- Les API et les modèles variant selon la plateforme utilisée, le corps d’une requête ne doit pas être copié directement vers un autre service.
Ce que vous apprendrez dans ce guide
Ce guide aborde les principales étapes pour transformer une image d’architecture en un clip de présentation animé avec Veo 3.1. L’objectif est de préparer un court essai vidéo en décrivant la caméra et les mouvements environnants dans une image fixe d’intérieur ou de bâtiment. Ces exemples peuvent servir à présenter un projet, à expliquer un concept ou à évaluer des pistes au cours du processus de visualisation. Le clip généré ne remplace ni un dessin technique ni un projet approuvé : il constitue une ébauche destinée à la narration visuelle.
Le guide Gemini API décrit la génération de vidéos de 8 secondes avec Veo 3.1, les résolutions 720p, 1080p et 4K, ainsi que la génération audio native. Il répertorie également la génération à partir de la première et de la dernière image, la prolongation d’une vidéo déjà générée et le guidage à l’aide de trois images de référence maximum. Il s’agit d’informations issues de la documentation Gemini API ; il ne faut pas supposer que toutes ces options sont proposées de la même manière dans chaque produit.
Prérequis : plateforme et accès
Il faut distinguer deux parcours API :
Gemini API : l’exemple Veo 3.1 de la documentation utilise l’API
generateContent. Le nom de modèle indiqué dans les exemples estveo-3.1-generate-preview. Une clé API Gemini est nécessaire pour envoyer une requête.Vertex AI : il faut disposer d’un projet Google Cloud, activer l’API Agent Platform et utiliser une méthode d’authentification appropriée. L’exemple de la documentation consacré à la génération vidéo à partir d’une image utilise le modèle
gemini-omni-1.1-flash-previewet l’URI d’une image stockée dans Cloud Storage ; les identifiants de modèle Veo 3.1 sont également répertoriés sur la même page.
Ces noms de modèles et ces structures de requête ne sont pas interchangeables. Commencez par choisir l’API à utiliser, puis suivez l’identifiant de modèle et l’exemple de requête indiqués dans la documentation à jour de cette plateforme. Pour Vertex AI, préparez une image accessible dans Cloud Storage. La documentation précise qu’aucune configuration d’authentification supplémentaire n’est nécessaire pour accéder aux services Google Cloud depuis la console ; pour les exemples REST, les identifiants gcloud CLI peuvent être utilisés.
Pas à pas : de l’image d’architecture au clip
Choisissez une image de départ adaptée au mouvement. Commencez par une vue avec un point de vue principal unique et un sujet clairement identifiable. Par exemple, un rendu d’intérieur peut montrer dans la même composition un espace salon, une fenêtre et la lumière du jour. Plutôt que d’essayer de tout animer en même temps, déterminez ce que le spectateur doit regarder dans le clip.
Décrivez le mouvement de caméra comme une action unique. Choisissez une direction simple, par exemple : « La caméra avance lentement dans la pièce. » Indiquez ensuite les éléments qui doivent rester inchangés : la forme des murs, du mobilier et des ouvertures doit être conservée ; les rideaux peuvent bouger légèrement, par exemple. Cette méthode aide à préciser au modèle les éléments qui doivent rester fixes dans la vidéo ; elle ne garantit pas un résultat particulier.
Utilisez un prompt court et ciblé pour le premier essai. L’exemple ci-dessous est un prompt architectural rédigé pour ce guide :
A calm architectural visualization of a contemporary living room, based on the input image. The camera slowly moves forward toward the seating area. Preserve the room layout, wall openings, furniture positions, materials, and proportions. Soft daylight shifts gently across the floor; sheer curtains move slightly in a natural breeze. No people, no new objects, no sudden camera movement. Quiet, realistic atmosphere.Dans cette description, la direction de la caméra, les éléments spatiaux à préserver et les légers mouvements autorisés sont précisés séparément. Si la géométrie ou la composition change de façon indésirable dans le premier résultat, simplifiez le prompt et réduisez le mouvement avant de réessayer.
Envoyez une image et des options vidéo adaptées à l’API. Dans l’exemple Vertex AI, l’image est ajoutée à la requête avec un URI Cloud Storage et un type MIME ; les paramètres de la vidéo de sortie comprennent le format d’image, la résolution et la durée. Dans l’exemple Gemini Omni, la durée est définie par une valeur entière comprise entre 3 et 10, exprimée en secondes. Ne confondez pas ces réglages avec ceux de Veo 3.1 dans Gemini API : le guide Gemini API décrit la sortie Veo 3.1 comme une vidéo de 8 secondes.
Relancez la génération en ne modifiant qu’une variable. Après le premier résultat, modifiez un seul élément à la fois au lieu de changer simultanément la caméra, la lumière et les mouvements de la scène. Lors d’un deuxième essai, réduire le mouvement de caméra ; lors d’un autre, supprimer les changements de lumière : ces approches facilitent l’évaluation du prompt qui oriente le mieux l’image.
Si vous avez besoin d’une transition entre des images ou de références, évaluez les fonctionnalités correspondantes. Le guide Gemini API indique que la génération à partir de la première et de la dernière image, ainsi que l’utilisation de trois images de référence maximum, font partie des fonctionnalités prises en charge. Ces options peuvent être utiles dans les workflows qui s’appuient sur une vue de départ et une vue d’arrivée, ou sur des références visuelles. Vérifiez toutefois dans la documentation à jour que ces possibilités sont disponibles avec le modèle et l’API choisis.
Erreurs fréquentes
Combiner des exemples issus de différentes API : la requête
interactionsde la page Vertex AI et l’exemple Veo 3.1 de Gemini API ne reposent pas sur le même schéma. Utilisez des identifiants de modèle, une authentification et des paramètres cohérents avec la plateforme choisie.Animer chaque élément de l’image : dans une narration architecturale, précisez les caractéristiques qui doivent être préservées, comme l’agencement de la pièce et la position du mobilier. Limiter les éléments en mouvement dans le prompt permet de faire un essai plus contrôlé, afin de préserver la cohérence visuelle.
Transposer les options de durée d’un modèle à un autre : l’exemple Gemini Omni sur Vertex AI prévoit une durée de 3 à 10 secondes, tandis que le guide Gemini API décrit Veo 3.1 comme un modèle vidéo de 8 secondes. Ne transférez pas le paramètre d’une API à l’autre.
Considérer la première génération comme une image de projet approuvée : la vidéo générée est une interprétation animée de l’image source. Avant de l’utiliser dans une présentation, vérifiez que les choix de conception et les détails spatiaux ont été préservés.
Supposer que toutes les fonctionnalités sont disponibles partout : certaines fonctionnalités de Veo 3.1 peuvent être proposées différemment dans Gemini API, Vertex AI et d’autres produits. Consultez la documentation de la plateforme choisie avant d’envoyer une requête.
Quelle place dans un workflow d’architecture et de visualisation ?
Cette méthode peut être intéressante pour les premiers essais des équipes d’architecture et de design d’intérieur qui souhaitent présenter un rendu final avec un court mouvement de caméra. Les étudiants peuvent également comparer différentes descriptions de mouvement à partir de la même image. Il faut toutefois préparer l’accès à l’API, le compte et la configuration du projet ; les sources ne précisant ni les tarifs d’utilisation actuels ni les conditions d’accès applicables à tous les utilisateurs, le coût et l’accès doivent être vérifiés au préalable. Les sources ne mentionnent pas non plus de configuration matérielle spécifique ni d’exigence de GPU local : le workflow présenté s’appuie sur des API cloud.
Étapes suivantes
Commencez par un seul rendu et un seul mouvement de caméra. Comparez ensuite les résultats en ne changeant qu’un élément à la fois dans la même scène. Si vous devez utiliser plusieurs images ou références, vérifiez que cette fonctionnalité est prise en charge par l’API et le modèle choisis. Avec Vertex AI, suivez les étapes relatives au projet, à l’activation de l’API et à Cloud Storage ; avec Gemini API, utilisez l’exemple de requête propre à Veo 3.1. Enfin, comparez le clip généré à l’image du projet pour repérer d’éventuels écarts de forme, d’ouvertures ou d’agencement du mobilier.
Sources et licence
Ce tutoriel a été adapté en turc à partir des informations du guide Google Cloud sur la génération vidéo à partir d’images et de la documentation Veo 3.1 de Google AI for Developers. Les deux sources sont sous licence CC BY 4.0. Les descriptions de la page produit Veo ont également été utilisées pour contextualiser les fonctionnalités.
Sources
3 sourcesLes textes sources ne sont pas republiés ; les courtes citations sont signalées, le reste est notre propre résumé et commentaire.
Pour les agences d’architecture et les équipes de visualisation, l’intérêt pratique de cette approche tient à la possibilité de créer une ébauche narrative animée à partir d’un rendu existant. Dans les présentations de concepts notamment, ajouter un mouvement de caméra à une image fixe peut rendre l’idée plus facile à comprendre ; le résultat généré ne doit toutefois pas être considéré comme un relevé vérifié de la géométrie du projet.
Il est conseillé aux équipes en Turquie de vérifier également l’accès à l’API, le coût d’utilisation et les fonctionnalités disponibles sur la plateforme choisie avant de faire un essai ; les sources ne fournissent pas d’informations tarifaires. Comme le workflow repose sur des API cloud, aucune exigence spécifique en matière de carte graphique locale n’est indiquée. Le plus sûr est de commencer par une seule image et un mouvement limité, puis d’examiner les résultats.
Questions fréquentes
Quelle est la durée et la résolution des vidéos générées avec Veo 3.1 ?
La documentation Gemini API indique que Veo 3.1 produit des vidéos de 8 secondes et propose les résolutions 720p, 1080p ou 4K.
Veo 3.1 peut-il générer des vidéos à partir d’images d’architecture ?
Le guide Gemini API mentionne le guidage par image, la génération à partir de la première et de la dernière image, ainsi que l’utilisation de trois images de référence maximum. Les options disponibles doivent être vérifiées pour l’API et le modèle choisis.
Faut-il un projet Google Cloud pour utiliser Veo 3.1 ?
L’exemple Vertex AI nécessite un projet Google Cloud et l’activation de l’API Agent Platform. Gemini API constitue une voie d’accès distincte.



