Kurz gesagt
- Bilder lassen sich über eine URL, als Inline-Daten oder über die Files API an die Gemini API übermitteln.
- Bei der Übertragung von Bilddaten als Inline-Daten ist die gesamte Anfrage auf 20 MB begrenzt.
- Für große Dateien oder Bilder, die wiederverwendet werden sollen, wird die Files API empfohlen.
- Klare und konkrete Anweisungen helfen dabei, das gewünschte Antwortformat und den Umfang festzulegen.
Was erfahren Sie in diesem Leitfaden?
Sie können ein Architekturfoto oder einen Render an das Modell übermitteln und sichtbare Elemente beschreiben, erkennbare Merkmale klassifizieren oder gezielte Fragen zur Designbewertung stellen lassen. Dieser Leitfaden zeigt Schritt für Schritt, wie Sie ein einzelnes Bild über die Gemini API an ein Modell übermitteln und Prompts für Architektur, Innenarchitektur und Visualisierung formulieren können.
Die Gemini-Dokumentation behandelt multimodale Aufgaben wie Bildbeschreibung, Klassifizierung und visuelle Frage-Antwort. Die folgenden Architekturbeispiele sind Prompt-Vorschläge, die auf diesen Aufgaben basieren. Die Quellen garantieren weder die Richtigkeit sämtlicher hier aufgeführter konkreter Anwendungsfälle noch deren Eignung für einen bestimmten Workflow. Die Antwort des Modells ersetzt keine Projektzeichnung oder technische Prüfung. Betrachten Sie sie als Ausgangspunkt, um Informationen aus einem Bild zu strukturieren und die interne Bewertung im Team zu unterstützen.
Voraussetzungen und Bildvorbereitung
Die Beispiele verwenden in der Gemini API das Modell gemini-3.8-flash. Die Codebeispiele in der Quelldokumentation zeigen, wie Anfragen mit Python, JavaScript, Java, Go und REST erstellt werden. Eine bestimmte SDK-Version wird hier jedoch nicht angegeben. Im REST-Beispiel wird der API-Schlüssel über die Variable GEMINI_API_KEY verwendet. Prüfen Sie die Installations- und Zugriffsinformationen zusätzlich für die jeweilige Entwicklungsumgebung.
Wählen Sie zunächst ein einzelnes Bild aus, das Sie analysieren möchten. Das kann ein Innenraum-Render, eine Fassadenansicht, ein Foto eines Lageplans oder eine Materialprobe sein. Beschreiben Sie im Prompt klar, was das Modell tun soll. Bitten Sie es beispielsweise, nur sichtbare Elemente aufzulisten, sich auf ein bestimmtes visuelles Merkmal zu konzentrieren oder Unsicherheiten zu kennzeichnen.
Sie können das Bild auf drei Wegen an die API übermitteln: über eine zugängliche Bildadresse, als Inline-Daten (base64-kodierte Bilddaten) oder über die Files API. Bei Inline-Daten darf die Gesamtgröße der Anfrage einschließlich Text-Prompts und weiterer Inhalte 20 MB nicht überschreiten. Für große Dateien oder wenn dieselbe Datei in mehreren Anfragen verwendet wird, wird die Files API empfohlen.
Schritt für Schritt: fünf Prompts zur Bildanalyse
1. Lassen Sie sichtbare Elemente im Render neutral auflisten. Übermitteln Sie das Bild zusammen mit Text an die API und fügen Sie den folgenden Prompt hinzu. Wenn Sie sich bei der ersten Prüfung auf beobachtbare Elemente statt auf Interpretationen konzentrieren, erhalten Sie möglicherweise eine besser strukturierte Grundlage für die weitere Bewertung.
Bu mimari görselini incele. Yalnızca görüntüde seçilebilen öğeleri belirt: mekân türü, ana yüzeyler, mobilyalar, aydınlatma ve bitkiler. Bilgi görüntüden anlaşılamıyorsa bunu açıkça söyle. Yanıtı kısa, başlıklı maddeler hâlinde ver.Dieser Prompt verlangt eine Beschreibung, die sich auf beobachtbare Elemente beschränkt. Passen Sie die aufgeführten Kategorien bei Bedarf an den Inhalt des Projektbildes an und bitten Sie das Modell nicht, Informationen zu ergänzen, die im Bild nicht zu sehen sind.
2. Konzentrieren Sie sich auf ein einzelnes Gestaltungskriterium. Eine visuelle Frage-Antwort kann gezielter sein als eine allgemeine Beschreibung. Grenzen Sie die Frage auf die zu bewertende Designentscheidung ein und fordern Sie das Modell nicht auf, Informationen abzuleiten, die im Bild nicht zu erkennen sind.
Bu iç mekân görselinde gün ışığının hangi bölgelere ulaştığını tarif et. Sadece görüntüde görülebilen ışık ve gölge dağılımına dayan. Pencere yönü veya günün saati görüntüden kesin olarak anlaşılamıyorsa tahmin yürütme; belirsizliği belirt.Dieses Beispiel konzentriert sich auf ein einzelnes Thema, das sich im Bild untersuchen lässt, etwa die Verteilung von Licht und Schatten. Es weist außerdem ausdrücklich darauf hin, Angaben zur Ausrichtung oder Tageszeit wegzulassen, wenn das Bild sie nicht belegt.
3. Klassifizieren Sie erkennbare Oberflächen im Bild. Die Gemini-Dokumentation behandelt Klassifizierungsaufgaben. Legen Sie die Kategorien und das Ausgabeformat im Prompt fest. In diesem Beispiel geht es darum, im Bild beobachtete Oberflächen zu gruppieren, nicht technische Standards zu überprüfen.
Görselde seçilebilen yüzeyleri şu gruplara ayır: duvar, zemin, tavan ve sabit mobilya. Her grupta görülen yüzeyin rengini ve dokusunu yalnızca görseldeki izlenime göre tarif et. Malzeme türünü kesin olarak belirleyemiyorsan olası malzeme adı verme; “görselden belirlenemiyor” yaz.Vorab festgelegte Kategorien können die Prüfung der Ergebnisse erleichtern. Trotzdem lässt sich die genaue Materialart nicht immer aus dem Bild ableiten. Wenn Sie diese Unsicherheit im Prompt ansprechen, bleiben die Grenzen der Antwort klar.
4. Lassen Sie die räumlichen Beziehungen im Bild beschreiben. Ein Vergleich mehrerer Bilder in derselben Anfrage wird in der Quelle nicht gezeigt. Das folgende Beispiel konzentriert sich daher auf räumliche Beziehungen, die in einem einzelnen Bild zu erkennen sind.
Bu iç mekân görselinde mobilyaların ve dolaşım alanlarının kadraj içinde nasıl konumlandığını tarif et. Yalnızca görüntüde seçilebilen ilişkilere dayan; ölçü, geçiş genişliği veya planda görünmeyen başka bilgiler üretme. Emin olmadığın noktaları ayrıca belirt.Dieser Prompt fordert das Modell nicht auf, einen Grundriss oder Maße abzuleiten, sondern lediglich, sichtbare Beziehungen im Bild zu beschreiben. Betrachten Sie eine solche Beschreibung als Beobachtungsnotiz auf Grundlage des Bildes, nicht als Designentscheidung.
5. Lassen Sie eine kurze Bildbeschreibung erstellen. Wenn Sie einen kurzen Text für ein Präsentationslayout, ein Bildarchiv oder den Austausch im Team benötigen, geben Sie statt einer ausführlichen Analyse eine Wortbegrenzung und ein gewünschtes Format vor. Prüfen Sie die Antwort vor der Verwendung anhand des Bildes.
Bu mimari render için Türkçe, en fazla iki cümlelik tarafsız bir görsel açıklaması yaz. Mekânın kullanımını, kadrajda öne çıkan tasarım öğelerini ve görünen ışık koşullarını aktar. Görselde doğrulanamayan proje bilgisi, konum veya tasarımcı adı ekleme.Dieser Prompt legt ein kurzes und neutrales Beschreibungsformat fest. Die Aufforderung, nicht durch das Bild belegte Projektangaben wegzulassen, kann außerdem dabei helfen, zu verhindern, dass der Text versehentlich wie ein Projektdatenblatt verwendet wird.
Häufige Fehler und Prüfschritte
Eine vage Anweisung wie „Analysiere dieses Bild“ überlässt dem Modell, was untersucht und wie die Antwort strukturiert wird. Legen Sie die Aufgabe, die Beobachtungskriterien und das Ausgabeformat klar fest. Eine kurze Liste oder bestimmte Überschriften können die Prüfung der Antwort erleichtern.
Auch die Aufforderung, nicht sichtbare Informationen als Fakten auszugeben, kann zu irreführenden Ergebnissen führen. Ein Render zeigt nicht immer Konstruktionsdetails oder konkrete Produktnamen von Materialien. Verwenden Sie im Prompt eine Einschränkung wie „Wenn es sich aus dem Bild nicht erkennen lässt, weise darauf hin“ und vergleichen Sie wichtige Beobachtungen mit dem Originalbild. Verwenden Sie die Modellantwort nicht als Ersatz für Projektzeichnungen, technische Spezifikationen oder eine Prüfung vor Ort.
Wählen Sie die Übertragungsmethode je nach Dateigröße und Bedarf an Wiederverwendung. Für Inline-Bilddaten gilt eine Grenze von 20 MB für die gesamte Anfrage. Bei großen Dateien oder wenn Sie ein Bild wiederverwenden möchten, sollten Sie die Files API in Betracht ziehen. Prüfen Sie, ob Prompt und Bild gemeinsam übermittelt werden und ob der verwendete MIME-Typ zum Bild passt. Die Beispiele in der Quelle geben auch den Typ des Bildinhalts in der Anfrage an.
Betrachten Sie die erste Antwort nicht als endgültig, sondern verbessern Sie den Prompt. Sie können den Umfang einschränken, das Ausgabeformat präzisieren oder festlegen, wie Unsicherheiten ausgedrückt werden sollen. Prompt-Design ist ein iterativer Prozess; es wird empfohlen, die Ergebnisse verschiedener Versuche im Hinblick auf den jeweiligen Einsatzzweck zu prüfen.
Einsatz in Architektur- und Visualisierungs-Workflows
Dieser Ansatz kann für Teams nützlich sein, die Render beschreiben, Elemente in einzelnen Bildern klassifizieren oder Beobachtungen vor einer Designbesprechung strukturiert festhalten möchten. Auch Studierende können Beschreibungsentwürfe für Präsentationsbilder erstellen lassen und anschließend prüfen, ob diese tatsächlich auf das im Bild Sichtbare beschränkt sind.
Die Quelldokumentation enthält jedoch keine Informationen zur direkten Integration mit Architektursoftware, zu lokalen Hardwareanforderungen, API-Preisen oder zur Speicherung von Projektdaten. Prüfen Sie daher vor der Einführung in Ihren Workflow die Kosten und Bedingungen des API-Zugangs, die Richtlinien Ihres Büros und die Regeln für die Weitergabe von Bildern. Klären Sie interne Genehmigungen, bevor Sie Bilder mit sensiblen Kunden- oder Projektdaten übermitteln.
Nächste Schritte
Testen Sie den Ablauf zunächst mit einem einzelnen, unkritischen Bild. Probieren Sie an demselben Bild getrennte Prompts für Beschreibung, Klassifizierung und Frage-Antwort aus und prüfen Sie, welches Antwortformat den Anforderungen Ihres Teams entspricht. Für wiederholte Analysen können Sie die Files API in Betracht ziehen; für einmalige und kleine Anfragen eine geeignete Übertragungsmethode.
Wenn die Antworten nicht konsistent sind, formulieren Sie den Prompt konkreter: Nennen Sie die zu untersuchenden Elemente, die Grenzen der Beobachtung und das gewünschte Ausgabeformat. Vergleichen Sie die Ergebnisse mit dem Bild selbst und übernehmen Sie keine Informationen als Projektdaten, die das Modell nicht sehen kann oder die durch das Bild nicht belegt sind.
Quelle und Lizenz
Diese Anleitung wurde anhand der Dokumentation von Google zu Bildverständnis und Prompt-Design für die Gemini API ins Türkische übertragen. Beide Quellen stehen unter der Lizenz CC BY 4.0. Die Prompt-Beispiele für Architekturbilder wurden eigens für diesen Leitfaden erstellt.
Quellen
2 QuellenQuelltexte werden nicht neu veröffentlicht; kurze Zitate sind gekennzeichnet, der Rest ist eigene Zusammenfassung und Einordnung.
Für Architekturbüros und Visualisierungsteams könnte der praktischste Einsatz darin bestehen, einzelne Bilder zu beschreiben und Beobachtungen bei Designbewertungen in eine gemeinsame Form zu bringen. Dieser Ansatz kann die Vorbereitung von Präsentationen unterstützen, ersetzt aber weder die Projektprüfung noch technische Entscheidungen.
Für Büros in der Türkei ist es wichtig, vor einem Test die Kosten des API-Zugangs, die Richtlinien zur Weitergabe von Bildern und die Bedingungen für die Verwendung von Kundendaten zu prüfen. Die Quellen enthalten keine Angaben zu Preisen, Hardwarebedarf oder Datenspeicherung. Daher empfiehlt es sich, nicht mit sensiblen Bildern zu beginnen und die Ergebnisse mit dem Originalbild abzugleichen.
Häufige Fragen
Wie übermittelt man ein Architekturbild an die Gemini API?
Das Bild kann über eine zugängliche Adresse, als Inline-kodierte Daten oder über die Files API übermittelt werden. Für große Dateien oder Bilder, die wiederverwendet werden sollen, wird die Files API empfohlen.
Wie groß dürfen Inline-Bilddaten bei der Gemini API sein?
Die gesamte Anfrage einschließlich Text-Prompts und weiterer Inhalte darf 20 MB nicht überschreiten. Für größere Anfragen kann die Files API verwendet werden.
Für welche Bildaufgaben kann Gemini bei Architektur-Renderings eingesetzt werden?
Die Gemini-Dokumentation behandelt Bildbeschreibung, Klassifizierung und visuelle Frage-Antwort. Die Antworten sollten mit dem abgeglichen werden, was im Bild tatsächlich zu sehen ist.



