Dernières actualités
Modélisation architecturale dans SketchUp : sections, déplacements précis et mise à l’échelleGuide Movie Render Queue d’Unreal Engine : configurer un rendu architecturalGuide pour créer des lignes architecturales avec Line Art dans Blender Grease PencilGuide du rendu intérieur avec Blender Cycles : bruit et duréeAnalyse d’images architecturales avec l’API Gemini : 5 promptsCréer une nomenclature de matériaux dans Revit : guide étape par étapeCréer des visuels d’architecture avec Nano Banana 2.1 : guide de prompts pas à pasRépartir des plantes et des objets sur des surfaces avec Blender Geometry NodesCréer des vidéos d’architecture avec Gemini : choisir modèle et promptPlacer des textures dans Blender avec UV Project et UV Warp
TutorielsGemini APIGemini 3.8 Flash

Analyse d’images architecturales avec l’API Gemini : 5 prompts

L’API Gemini permet d’envoyer des images au modèle avec du texte pour les décrire, les classer ou répondre à des questions visuelles. Ce guide présente cinq prompts adaptés aux images architecturales et les principales méthodes d’envoi.

Studio de design lumineux avec un rendu architectural et des échantillons de matériauxImage IA
Image d’illustration générée par IA.Image : 3dsınıfı / FCA AI

En bref

  1. Les images peuvent être envoyées à l’API Gemini via une URL, en données intégrées ou avec la Files API.
  2. La taille totale d’une requête contenant des données d’image intégrées est limitée à 20 MB.
  3. La Files API est recommandée pour les fichiers volumineux ou les images réutilisées.
  4. Des consignes claires et précises permettent de définir le format et le périmètre de la réponse souhaitée.

Ce que vous allez apprendre

Vous pouvez envoyer au modèle une photo d’architecture ou un rendu afin qu’il décrive les éléments visibles, classe ce qu’il observe ou réponde à des questions ciblées pour évaluer un design. Ce guide explique, étape par étape, comment transmettre une image à l’API Gemini et rédiger des prompts à essayer dans les domaines de l’architecture, de l’architecture d’intérieur et de la visualisation.

La documentation Gemini couvre des tâches multimodales telles que la description d’images, leur classification et les questions-réponses visuelles. Les exemples architecturaux ci-dessous sont des suggestions de prompts inspirées de ces tâches ; les sources ne garantissent ni la validité de chaque usage particulier présenté ici, ni son adéquation à un flux de travail donné. Une réponse du modèle ne remplace pas un dessin de projet ou une vérification technique. Considérez-la plutôt comme un point de départ pour organiser les informations visibles et faciliter les évaluations au sein de l’équipe.

Prérequis et préparation de l’image

Les exemples utilisent le modèle gemini-3.8-flash dans l’API Gemini. Les exemples de code du document source montrent comment créer des requêtes avec Python, JavaScript, Java, Go et REST, mais aucune version précise du SDK n’est indiquée ici. Dans l’exemple REST, la clé API est utilisée via la variable GEMINI_API_KEY. Vérifiez séparément les détails d’installation et d’accès en fonction de votre environnement de développement.

Commencez par sélectionner une seule image à analyser : il peut s’agir d’un rendu d’intérieur, d’une image de façade, d’une photo de plan masse ou d’échantillons de matériaux. Indiquez clairement dans le prompt ce que vous attendez du modèle. Vous pouvez, par exemple, lui demander de lister uniquement les éléments visibles, de se concentrer sur une caractéristique visuelle précise ou de signaler les points incertains.

Vous pouvez transmettre l’image à l’API de trois façons : via une adresse d’image accessible, sous forme de données intégrées (encodées en base64) ou avec la Files API. Avec les données intégrées, la taille totale de la requête, prompts textuels et autres contenus compris, ne doit pas dépasser 20 MB. La Files API est recommandée pour les fichiers volumineux ou lorsque le même fichier doit être utilisé dans plusieurs requêtes.

Pas à pas : cinq prompts pour l’analyse d’images

1. Lister objectivement les éléments visibles dans un rendu. Envoyez l’image à l’API avec du texte, puis ajoutez le prompt ci-dessous. Pour une première analyse, se concentrer sur les éléments observables plutôt que sur leur interprétation peut produire un résultat plus organisé pour les évaluations suivantes.

Prompt
Examine cette image architecturale. Indique uniquement les éléments visibles : le type d’espace, les principales surfaces, le mobilier, l’éclairage et les plantes. Si une information ne peut pas être déterminée à partir de l’image, précise-le clairement. Présente la réponse sous forme de liste concise avec des titres.

Ce prompt demande une description limitée aux éléments observables. Au besoin, adaptez les rubriques au contenu de l’image du projet ; ne demandez pas au modèle de compléter les informations qui n’y figurent pas.

2. Se concentrer sur un seul critère de conception. Les questions-réponses visuelles peuvent être plus ciblées qu’une demande de description générale. Limitez la question à la décision de conception que vous souhaitez évaluer et ne demandez pas au modèle de déduire des informations absentes de l’image.

Prompt
Décris les zones de cet intérieur qui sont atteintes par la lumière du jour. Base-toi uniquement sur la répartition de la lumière et des ombres visibles sur l’image. Si l’orientation des fenêtres ou l’heure de la journée ne peut pas être déterminée avec certitude, ne fais pas de suppositions ; indique l’incertitude.

Cet exemple porte sur un seul sujet pouvant être observé dans l’image, comme la répartition de la lumière et des ombres. Il précise également que les informations d’orientation ou d’heure qui ne sont pas établies par l’image doivent être exclues de la réponse.

3. Classer les surfaces visibles sur l’image. La documentation Gemini couvre les tâches de classification. Définissez les catégories et la structure de la réponse dans le prompt. Ici, il s’agit de regrouper les surfaces observées sur l’image, et non de vérifier leur conformité à des normes techniques.

Prompt
Classe les surfaces visibles dans l’image selon les catégories suivantes : murs, sol, plafond et mobilier fixe. Pour chaque catégorie, décris la couleur et la texture de la surface telles qu’elles apparaissent sur l’image. Si tu ne peux pas déterminer le type de matériau avec certitude, ne propose pas de matériau possible ; écris « impossible à déterminer à partir de l’image ».

La définition préalable des catégories peut faciliter l’examen des résultats. Il n’est toutefois pas toujours possible d’identifier avec certitude le type de matériau à partir d’une image ; préciser cette incertitude dans le prompt permet de délimiter clairement la réponse.

4. Faire décrire les relations entre les éléments de l’image. La source ne montre pas comment comparer plusieurs images dans une même requête. L’exemple ci-dessous se concentre donc sur les relations visibles dans une seule image.

Prompt
Décris la position du mobilier et des espaces de circulation dans le cadrage de cette image d’intérieur. Base-toi uniquement sur les relations visibles ; n’invente pas de dimensions, de largeur de passage ou d’autres informations absentes du plan. Indique séparément les points dont tu n’es pas sûr.

Ce prompt ne demande pas au modèle de déduire un plan ou des dimensions ; il lui demande seulement de décrire les relations visibles dans le cadrage. Considérez cette description comme une note d’observation fondée sur l’image, et non comme une décision de conception.

5. Préparer une courte description de l’image. Si vous avez besoin d’un texte bref pour une planche de présentation, une archive visuelle ou un partage au sein de l’équipe, précisez une limite de mots et le format attendu plutôt que de demander une longue analyse. Avant toute utilisation, vérifiez la réponse en la comparant à l’image.

Prompt
Rédige en turc une description objective de cette image architecturale, en deux phrases maximum. Décris l’usage de l’espace, les éléments de conception qui ressortent dans le cadrage et les conditions d’éclairage visibles. N’ajoute aucune information sur le projet, son emplacement ou le nom du concepteur qui ne puisse être vérifiée à partir de l’image.

Ce prompt définit un format de description bref et objectif. Demander d’exclure les informations sur le projet qui ne peuvent pas être vérifiées à partir de l’image peut également éviter que le texte soit utilisé par erreur comme fiche de projet.

Erreurs fréquentes et vérifications

Une consigne vague comme « Analyse cette image » laisse au modèle le choix de ce qu’il doit examiner et de la manière de structurer sa réponse. Définissez clairement la tâche, les critères d’observation et le format attendu. Demander une courte liste ou des rubriques précises peut faciliter l’examen de la réponse.

Demander des informations absentes de l’image comme si elles étaient certaines peut aussi conduire à des résultats trompeurs. Un rendu ne montre pas toujours les détails de construction ou les références commerciales des matériaux. Dans le prompt, ajoutez une restriction telle que « indique-le si tu ne peux pas le déterminer à partir de l’image » et comparez les observations importantes à l’image d’origine. N’utilisez pas la réponse du modèle à la place d’un dessin de projet, d’un cahier des charges technique ou d’une inspection sur site.

Choisissez la méthode d’envoi en fonction de la taille du fichier et de la nécessité de le réutiliser. Les données d’image intégrées sont soumises à une limite de 20 MB pour la requête totale. Pour les fichiers volumineux ou les images à réutiliser, envisagez la Files API. Vérifiez que le prompt et l’image sont envoyés ensemble et que le type MIME correspond à l’image ; les exemples de la source indiquent également le type du contenu visuel dans la requête.

Plutôt que de considérer la première réponse comme définitive, améliorez le prompt. Vous pouvez réduire le périmètre demandé, préciser le format de la réponse ou indiquer comment exprimer les incertitudes. La conception de prompts est un processus itératif ; il est recommandé d’examiner les résultats de différents essais en fonction de l’usage prévu.

Place dans un flux de travail d’architecture et de visualisation

Cette approche peut être utile aux équipes qui doivent décrire des rendus, classer les éléments d’une image ou organiser leurs observations avant une réunion de conception. Les étudiants peuvent également générer des brouillons de descriptions pour leurs visuels de présentation, puis vérifier qu’ils se limitent bien à ce qui apparaît réellement sur l’image.

Toutefois, les documents sources ne fournissent aucune information sur l’intégration directe avec des logiciels d’architecture, les exigences matérielles locales, le prix de l’API ou les conditions de conservation des données du projet. Avant d’intégrer cette approche au flux de travail, vérifiez séparément le coût et les conditions d’accès à l’API utilisée, les règles du bureau ainsi que les politiques relatives au partage des images. Avant d’envoyer des images sensibles pour un client ou un projet, vérifiez les autorisations internes.

Étapes suivantes

Commencez par faire un essai avec une seule image non critique. Testez séparément les prompts de description, de classification et de questions-réponses sur la même image, puis évaluez le format de réponse qui correspond aux besoins de l’équipe. Pour des analyses répétées, vous pouvez envisager la Files API ; pour des requêtes ponctuelles et légères, évaluez la méthode d’envoi appropriée.

Si les réponses manquent de cohérence, rendez le prompt plus concret : indiquez les éléments à examiner, les limites de l’observation et le format de sortie souhaité. Comparez les résultats à l’image elle-même ; ne considérez pas comme des données de projet les informations que le modèle ne peut pas voir ou que l’image ne permet pas de vérifier.

Sources et licence

Ce tutoriel est une adaptation en turc de la documentation de Google sur la compréhension des images avec l’API Gemini et la conception de prompts. Les deux sources sont sous licence CC BY 4.0. Les exemples de prompts destinés aux images architecturales ont été rédigés spécialement pour ce guide.

Sources

2 sources
A(
ai.google.dev (CC BY 4.0)ai.google.dev/gemini-api/docs/image-understanding
Résumé
A(
ai.google.dev (CC BY 4.0)ai.google.dev/gemini-api/docs/prompting-strategies
Résumé

Les textes sources ne sont pas republiés ; les courtes citations sont signalées, le reste est notre propre résumé et commentaire.

L’avis de 3dsınıfı
3dL’analyse de la rédaction

Pour les cabinets d’architecture et les équipes de visualisation, l’usage le plus pratique pourrait être de décrire des images individuelles et de structurer les observations lors des évaluations de conception. Cette approche peut faciliter la préparation des présentations, mais les réponses du modèle ne remplacent ni la validation d’un projet ni une décision technique.

Pour les bureaux en Turquie, il est important de vérifier le coût d’accès à l’API, la politique de partage des images et les conditions d’utilisation des données client avant tout essai. Les sources ne précisent ni les prix, ni les besoins matériels, ni les modalités de conservation des données. Il est donc préférable de ne pas commencer avec des images sensibles et de comparer les résultats à l’image d’origine.

Questions fréquentes

Comment envoyer une image architecturale à l’API Gemini ?

L’image peut être envoyée via une adresse accessible, sous forme de données encodées intégrées ou avec la Files API. Cette dernière est recommandée pour les fichiers volumineux ou les images réutilisées.

Quelle est la limite de taille des données d’image intégrées dans l’API Gemini ?

La taille totale de la requête, prompts textuels et autres contenus compris, ne doit pas dépasser 20 MB. La Files API peut être utilisée pour les requêtes plus volumineuses.

Pour quelles tâches visuelles peut-on utiliser Gemini avec des rendus architecturaux ?

La documentation Gemini couvre la description d’images, la classification et les questions-réponses visuelles. Les réponses doivent être comparées à ce qui est réellement visible sur l’image.

Les commentaires et le forum sont en turc.Rejoindre la discussion
+

À lire aussi