Dernières actualités
Dupliquer des éléments architecturaux avec Geometry Nodes dans BlenderÉchantillonner le long d’une courbe avec Blender Geometry Nodes : guide Sample CurveGuide Movie Render Queue d’Unreal Engine : réglages de rendu architecturalGuide de Blender Asset Browser : créer une bibliothèque d’assets pour l’architectureAnalyser des vidéos d’architecture avec l’API Gemini : guide pas à pasSe préparer à la connexion Archicad-Autodesk Forma : guide de transfert fluide des données BIM4 réglages pour corriger les erreurs de jonction des murs dans ArchicadGestion des Phases (Phasing) dans Revit : Guide Étape par Étape pour les Projets de RénovationGuide de création de Dynamic Component dans SketchUp : composants intelligents avec formulesGuide 3ds Max : préparer une scène de présentation avec Shell, caméra et MassFX Rigid Body
TutorielsGoogleGemini Omni FlashVeo 3.1

Analyser des vidéos d’architecture avec l’API Gemini : guide pas à pas

L’API Gemini permet de résumer des vidéos, de répondre à des questions sur leur contenu et de demander des informations en fonction d’horodatages. Ce guide explique comment traiter des vidéos d’architecture et d’intérieur selon leur taille, puis vérifier les résultats.

Visite d’un intérieur contemporain baigné de lumière naturelle, illustrant le thème de l’analyse vidéoImage IA
Image d’illustration générée par IA.Image : 3dsınıfı / FCA AI

En bref

  1. Les modèles Gemini peuvent décrire des vidéos, répondre à des questions sur leur contenu et faire référence à des horodatages précis.
  2. Google recommande l’API Files pour les fichiers de 100 Mo ou plus, ainsi que pour les vidéos qui seront réutilisées.
  3. La documentation mentionne à la fois une limite de moins de 100 Mo pour les vidéos intégrées et une limite de moins de 20 Mo pour la requête totale ; par prudence, mieux vaut appliquer la limite la plus basse indiquée dans les instructions d’implémentation.
  4. Gemini Omni Flash et Veo 3.1 sont des options de génération vidéo ; l’exemple de ce guide sur l’analyse de vidéos existantes utilise le modèle gemini-3.8-flash.

Ce que vous allez apprendre dans ce guide

Ce tutoriel explique comment mettre en place un flux de travail de base pour analyser, avec l’API Gemini, une vidéo de présentation architecturale, un enregistrement de chantier, une visite d’intérieur ou une vidéo du processus de conception. Il ne s’agit pas de générer une nouvelle vidéo, mais de fournir au modèle une vidéo existante et de lui demander un résumé, des réponses sur des scènes précises ou une transcription de son contenu. La documentation de Google sur la compréhension vidéo indique que les modèles peuvent décrire une vidéo, la segmenter et en extraire des informations, répondre à des questions sur son contenu et se référer à des horodatages.

Les exemples incluent des requêtes textuelles à envoyer à l’API. Elles ne garantissent pas un résultat donné : elles servent à préciser le type d’informations recherché dans la vidéo. Avant d’utiliser la réponse pour prendre une décision de projet, effectuer un relevé ou valider un aspect technique, comparez-la aux images sources.

Prérequis et choix du fichier

Ce flux de travail nécessite un accès à l’API Gemini et une intégration capable d’envoyer la vidéo. Les exemples officiels utilisent Python, JavaScript, Java, Go et REST ; les étapes ci-dessous ne dépendent d’aucun langage de programmation particulier. L’exemple REST utilise une clé appelée GEMINI_API_KEY. Les documents vidéo utilisés ici ne détaillent pas les conditions d’accès à l’API ni celles liées au compte.

L’exemple de requête à l’API indique le nom de modèle gemini-3.8-flash. Il s’agit du modèle utilisé dans l’exemple de compréhension vidéo. La génération vidéo fait l’objet d’un guide distinct : Google cite Gemini Omni Flash pour la génération vidéo générale et l’édition avec dialogue, et Veo 3.1 pour des besoins tels que l’extension de scène ou le contrôle de la dernière image. Ne confondez pas ces deux cas d’usage.

Avant l’envoi, vérifiez la taille du fichier et si vous comptez le réutiliser :

  • Google recommande l’API Files pour les vidéos de plus de 100 Mo ou de longue durée, ainsi que pour les fichiers qui seront réutilisés. Le tableau de la documentation indique une limite de 2 Go pour l’API Files en accès gratuit et de 20 Go en accès payant.

  • L’option Cloud Storage Registration prévoit une limite de 2 Go par fichier ; la documentation précise qu’il n’y a pas de limite supplémentaire pour le stockage.

  • L’envoi par URL YouTube est indiqué pour les vidéos YouTube publiques.

  • Les données intégrées conviennent aux petits fichiers utilisés ponctuellement. Le tableau de la documentation associe cette méthode aux vidéos de moins de 100 Mo et de courte durée ; la section consacrée à l’implémentation précise également que la requête totale doit rester sous les 20 Mo. Comme ces deux critères diffèrent, respecter la limite inférieure de 20 Mo pour la requête totale est l’approche la plus prudente lors d’un envoi de données intégrées.

Flux d’analyse pas à pas

  1. Définissez la question à laquelle la vidéo doit répondre. Plutôt qu’une demande générale comme « analyse la vidéo », précisez les informations recherchées. Pour une visite d’intérieur, par exemple, vous pouvez distinguer l’agencement des espaces, les matériaux visibles et les zones traversées par la caméra. Ne partez pas du principe que le modèle saura déterminer des dimensions invisibles ou des couches de construction cachées.

  2. Envoyez le fichier par la méthode adaptée. Pour un fichier volumineux ou destiné à être réutilisé, privilégiez l’API Files. Dans le flux officiel, la vidéo est téléversée, son traitement est attendu, puis sa référence est envoyée avec la requête textuelle lorsque son état passe à ACTIVE. Si le traitement échoue, l’exemple de la documentation considère l’état FAILED comme une erreur. Les données intégrées peuvent être utilisées pour les petites vidéos ; vérifiez la taille du fichier par rapport à la limite applicable à la requête totale.

  3. Envoyez la requête avec le contenu vidéo. La requête contient la vidéo et la demande d’analyse sous forme de texte. Dans l’exemple Python, le fichier est téléversé via l’API Files ; un exemple pour un contenu plus petit transmet les octets de la vidéo sous forme de données intégrées. Quelle que soit l’intégration choisie, le type MIME de la vidéo et la référence du fichier doivent être transmis correctement.

  4. Commencez par demander un résultat ciblé. Vous pouvez ajouter séparément les exemples ci-dessous à la partie textuelle de votre requête. Chacun correspond à un objectif d’analyse architecturale différent.

Prompt
Bu mimari iç mekân videosunu sahne sırasına göre özetle. Görüntüde açıkça görülen mekânları, malzeme izlenimlerini ve kamera hareketlerini ayrı maddeler hâlinde belirt. Görüntüde olmayan bilgileri tahmin etme; belirsiz noktaları açıkça işaretle.

Cette demande distingue les espaces, les matériaux et les mouvements de caméra dans le résumé général. Considérez les descriptions des matériaux comme des impressions visuelles tirées de la vidéo, et non comme des définitions techniques certaines.

Prompt
Videoda girişten ana yaşam alanına geçişin görüldüğü bölümü bul. İlgili zaman damgasını belirt ve o anda kadrajda görünen mekânsal ilişkileri kısaca açıkla. Bölüm net değilse bunu söyle; zaman veya plan bilgisi uydurma.

Ce texte pose une question sur une scène à partir de son horodatage. Ouvrez la vidéo à l’heure indiquée dans la réponse et vérifiez-la : la documentation indique que le modèle peut faire référence à des horodatages, mais ne garantit pas une correspondance parfaite pour chaque requête.

Prompt
Bu şantiye videosunda tamamlanmış görünen imalatları ve hâlen devam ettiği açıkça anlaşılan işleri ayır. Her bulguyu videoda görülen sahneyle ilişkilendir; yapısal güvenlik, ölçü veya mevzuat uygunluğu hakkında çıkarım yapma.

Cet exemple demande une classification qui peut faciliter l’organisation de l’enregistrement visuel ; il ne fournit toutefois aucune validation de sécurité ou de conformité à partir de la vidéo. Comparez les réponses aux comptes rendus de l’équipe de chantier.

  1. Examinez la réponse et affinez la demande. Si le résumé général ne suffit pas, posez une nouvelle question en décrivant un espace, une scène ou une période précise de la vidéo. Les capacités de compréhension vidéo de Gemini incluent la possibilité de poser des questions sur le contenu et de faire référence à des horodatages. Vérifiez dans la vidéo les informations importantes avant de les utiliser.

Erreurs fréquentes

Ne pas vérifier la méthode en fonction de la taille du fichier : l’API Files est recommandée pour les fichiers volumineux ou réutilisés. Même si les données intégrées sont envisagées pour les petits fichiers, la documentation indique également une limite de 20 Mo pour la requête totale ; vérifier uniquement la taille du fichier vidéo peut donc ne pas suffire.

Demander une analyse avant la fin du traitement : l’exemple de l’API Files attend que le fichier passe à l’état ACTIVE après son téléversement. Utiliser la référence du fichier avant de vérifier l’état du traitement ne correspond pas au flux présenté dans l’exemple.

Confondre l’analyse vidéo et la génération vidéo : pour examiner un enregistrement existant, utilisez le guide de compréhension vidéo. La documentation présente Gemini Omni Flash et Veo 3.1 dans des flux distincts consacrés à la génération et à l’édition vidéo.

Tirer des conclusions techniques certaines à partir des images : demandez au modèle de décrire les éléments visibles ; ne présentez pas comme des informations vérifiées des dimensions absentes des images, des propriétés de matériaux ou une conformité d’exécution. Vérifiez également la correspondance entre horodatages et scènes à partir de la vidéo source.

Conséquences pour les flux de travail en architecture et en aménagement intérieur

Cette méthode peut servir de point de départ aux cabinets d’architecture, aux architectes d’intérieur et aux étudiants qui souhaitent retrouver des scènes dans de longues vidéos de présentation, structurer une visite d’intérieur ou extraire les travaux visibles d’un enregistrement de chantier. L’approche par l’API Files est pratique en particulier pour les fichiers volumineux destinés à être réutilisés ; l’envoi de données intégrées est une solution de remplacement pour les essais ponctuels sur de petits fichiers. Cependant, la source ne précise ni le coût d’utilisation ni les exigences matérielles. Les conditions de coût et de compatibilité doivent donc être examinées séparément avant l’implémentation ; la réponse du modèle ne remplace pas une validation technique.

Étapes suivantes

Commencez par obtenir un résumé général d’un enregistrement court et représentatif, puis affinez le résultat à l’aide de questions ciblant des scènes ou des horodatages. Si vous envoyez plusieurs requêtes pour la même vidéo, envisagez l’API Files, recommandée par Google. Si vous devez aussi générer des vidéos via l’API, consultez séparément les documents sur Gemini Omni Flash et Veo 3.1, sans les confondre avec le flux de compréhension vidéo.

Sources et licence

Ce guide a été adapté en turc à partir des documents de Google sur la compréhension vidéo et la génération vidéo avec l’API Gemini. Les deux sources sont sous licence CC BY 4.0.

Sources

2 sources
A(
ai.google.dev (CC BY 4.0)ai.google.dev/gemini-api/docs/video-understanding
Résumé
A(
ai.google.dev (CC BY 4.0)ai.google.dev/gemini-api/docs/video
Résumé

Les textes sources ne sont pas republiés ; les courtes citations sont signalées, le reste est notre propre résumé et commentaire.

L’avis de 3dsınıfı
3dL’analyse de la rédaction

Pour les cabinets d’architecture et les étudiants, l’usage le plus intéressant consiste à retrouver des scènes dans de longues vidéos et à en accélérer la première synthèse. La réponse du modèle reste toutefois une interprétation tirée des images ; elle ne remplace pas une vérification des dimensions, des spécifications de matériaux ou de la conformité d’un chantier.

Les équipes en Turquie gagneront à commencer avec une courte vidéo d’exemple et des questions ciblées. Les documents ne précisant ni les prix ni les exigences matérielles, il convient de vérifier séparément les coûts et les conditions d’accès à l’API. La taille du fichier et la fréquence de réutilisation détermineront également le choix entre l’API Files et l’envoi de données intégrées.

Questions fréquentes

L’API Gemini peut-elle analyser des vidéos d’architecture ?

Les modèles Gemini peuvent décrire une vidéo, répondre à des questions sur son contenu et faire référence à des horodatages précis. Les conclusions techniques doivent être vérifiées à partir des images sources.

Comment envoyer de grandes vidéos à l’API Gemini ?

Google recommande l’API Files pour les fichiers de 100 Mo ou plus, ainsi que pour ceux qui seront réutilisés. La documentation indique une limite de 2 Go pour l’API Files en accès gratuit et de 20 Go en accès payant.

Quel modèle est utilisé dans l’exemple de compréhension vidéo ?

L’exemple de la documentation de Google sur la compréhension vidéo utilise le modèle `gemini-3.8-flash`. Gemini Omni Flash et Veo 3.1 sont présentés séparément dans la documentation consacrée à la génération vidéo.

Les commentaires et le forum sont en turc.Rejoindre la discussion
+

À lire aussi