Neueste Meldungen
Rhino 8 ShrinkWrap: Anleitung zur Mesh-Erstellung und PrüfungArchitekturelemente mit Blender Geometry Nodes auf Punkten und in Reihen vervielfältigenBlender Geometry Nodes: Entlang einer Kurve sampeln – Sample-Curve-LeitfadenUnreal Engine Movie Render Queue: Render-Einstellungen für ArchitekturBlender Asset Browser: Eine Asset-Bibliothek für Architekturprojekte einrichtenArchitekturvideos mit der Gemini API analysieren: Schritt-für-Schritt-AnleitungVorbereitung auf die Archicad-Autodesk-Forma-Verbindung: Leitfaden für reibungslosen BIM-Datentransfer4 Einstellungen gegen fehlerhafte Wandanschlüsse in Archicad: Leitfaden für VerbundwändePhasing-Management in Revit: Schritt-für-Schritt-Leitfaden für RenovierungsprojekteSketchUp Dynamic Component erstellen: Anleitung für intelligente Bauteile mit Formeln
TutorialsGoogleGemini Omni FlashVeo 3.1

Architekturvideos mit der Gemini API analysieren: Schritt-für-Schritt-Anleitung

Die Gemini API kann Videos zusammenfassen, Fragen zu ihrem Inhalt beantworten und Informationen zu Zeitstempeln liefern. Dieser Leitfaden zeigt, wie Sie Architektur- und Innenraumvideos passend zur Dateigröße verarbeiten und die Ergebnisse überprüfen.

Ein Rundgang durch einen lichtdurchfluteten, modernen Innenraum veranschaulicht das Thema VideoanalyseKI-Bild
Symbolbild, mit KI erzeugt.Bild: 3dsınıfı / FCA AI

Kurz gesagt

  1. Gemini-Modelle können Videos beschreiben, Fragen zu ihrem Inhalt beantworten und auf bestimmte Zeitstempel verweisen.
  2. Google empfiehlt die Files API für Dateien ab 100 MB sowie für Videos, die wiederverwendet werden sollen.
  3. Die Dokumentation nennt für Inline-Videos sowohl eine Grenze von unter 100 MB als auch eine Gesamtgröße der Anfrage von unter 20 MB. Die niedrigere Grenze aus den Anwendungsanweisungen ist die vorsichtigere Wahl.
  4. Gemini Omni Flash und Veo 3.1 sind Optionen zur Videogenerierung. Das Beispiel in diesem Leitfaden zur Analyse vorhandener Videos verwendet dagegen das Modell gemini-3.8-flash.

Was erfahren Sie in diesem Leitfaden?

Dieses Tutorial zeigt, wie Sie einen grundlegenden Workflow einrichten, um Architekturpräsentationen, Baustellendokumentationen, Innenraumrundgänge oder Videos zum Entwurfsprozess mit der Gemini API zu analysieren. Dabei geht es nicht darum, neue Videos zu erstellen, sondern ein vorhandenes Video an das Modell zu übermitteln und eine Zusammenfassung, Antworten zu bestimmten Szenen oder eine Inhaltsübersicht anzufordern. In der Dokumentation von Google zum Videoverständnis werden die Fähigkeiten der Modelle beschrieben, Videos zu erläutern, in Abschnitte zu gliedern und Informationen daraus zu extrahieren, Fragen zum Videoinhalt zu beantworten und Zeitstempel heranzuziehen.

Die Beispiele enthalten Textanfragen, die an die API gesendet werden. Sie garantieren kein bestimmtes Ergebnis, sondern helfen dabei, klar zu formulieren, welche Informationen Sie aus dem Video erhalten möchten. Bevor Sie die Ausgabe als Grundlage für Projektentscheidungen, Maße oder technische Prüfungen verwenden, sollten Sie sie mit dem Originalmaterial abgleichen.

Voraussetzungen und Dateiauswahl

Für den Workflow benötigen Sie Zugriff auf die Gemini API und eine Integration, über die Sie das Video übermitteln können. Die offiziellen Beispiele verwenden Python, JavaScript, Java, Go und REST. Die folgenden Schritte sind jedoch nicht an eine bestimmte Programmiersprache gebunden. Im REST-Beispiel kommt ein Schlüssel mit dem Namen GEMINI_API_KEY zum Einsatz. Einzelheiten zum API-Zugriff oder zu den Kontobedingungen werden in den hier verwendeten Videodokumentationen nicht erläutert.

Im Beispiel für eine API-Anfrage ist der Modellname gemini-3.8-flash angegeben. Dieses Modell wird im Beispiel zum Videoverständnis verwendet. Für die Videogenerierung gibt es einen separaten Leitfaden: Google nennt Gemini Omni Flash für die allgemeine Videogenerierung und die Bearbeitung mit Sprache sowie Veo 3.1 für Anforderungen wie die Verlängerung einer Szene oder die Steuerung über das letzte Einzelbild. Verwechseln Sie diese beiden Anwendungsbereiche nicht.

Prüfen Sie vor dem Senden der Datei, wie groß sie ist und ob Sie sie wiederverwenden möchten:

  • Für Videos mit mehr als 100 MB, längere Videos und Dateien, die erneut verwendet werden sollen, empfiehlt Google die Files API. In der Tabelle der Dokumentation ist für die Files API ein Limit von 2 GB bei kostenloser Nutzung und 20 GB bei kostenpflichtiger Nutzung aufgeführt.

  • Für die Option Cloud Storage Registration wird ein Limit von 2 GB pro Datei genannt; für den Speicherplatz selbst wird kein zusätzliches Limit angegeben.

  • Die Methode mit YouTube-URLs ist für öffentliche YouTube-Videos aufgeführt.

  • Inline-Daten eignen sich für kleine Dateien, die nur einmal verwendet werden. In der Tabelle der Dokumentation wird diese Methode mit Videos unter 100 MB und kurzen Videos in Verbindung gebracht. Im Anwendungsabschnitt steht außerdem, dass die gesamte Anfrage unter 20 MB liegen muss. Da diese beiden Kriterien voneinander abweichen, ist es bei der Inline-Übermittlung vorsichtiger, das niedrigere Limit von 20 MB für die Gesamtanfrage einzuhalten.

Schritt-für-Schritt-Workflow zur Analyse

  1. Legen Sie fest, welche Frage das Video beantworten soll. Formulieren Sie lieber konkret, welche Informationen Sie suchen, statt allgemein um eine „Videoanalyse“ zu bitten. Bei einem Innenraumrundgang könnten etwa die Raumaufteilung, sichtbare Materialien und die Bereiche, durch die sich die Kamera bewegt, getrennte Punkte sein. Gehen Sie nicht davon aus, dass das Modell Maße oder verborgene Bauteilschichten erkennen kann, die im Bild nicht zu sehen sind.

  2. Übermitteln Sie die Datei mit der passenden Methode. Bei wiederholter Nutzung oder großen Dateien empfiehlt sich die Files API. Im offiziellen Beispiel wird das Video hochgeladen, die Verarbeitung abgewartet und die Dateireferenz zusammen mit der Textanfrage gesendet, sobald ihr Status ACTIVE ist. Schlägt die Verarbeitung fehl, behandelt das Beispiel der Dokumentation den Status FAILED als Fehler. Für kleine Videos können Sie Inline-Daten verwenden; prüfen Sie dabei die Dateigröße anhand des Limits für die Gesamtanfrage.

  3. Senden Sie die Anfrage zusammen mit dem Videoinhalt. Die Anfrage enthält das Video als Eingabe und den Analyseauftrag als Texteingabe. Im Python-Beispiel wird die Datei über die Files API hochgeladen; in einem Beispiel mit kleineren Inhalten werden die Videodaten inline übermittelt. Unabhängig von der gewählten Integration müssen der MIME-Typ des Videos und die Dateireferenz korrekt übergeben werden.

  4. Fordern Sie beim ersten Versuch eine begrenzte Ausgabe an. Sie können die folgenden Beispiele jeweils separat in den Textteil der Anfrage einfügen. Jedes Beispiel zielt auf einen anderen Zweck bei der Architekturanalyse ab.

Prompt
Bu mimari iç mekân videosunu sahne sırasına göre özetle. Görüntüde açıkça görülen mekânları, malzeme izlenimlerini ve kamera hareketlerini ayrı maddeler hâlinde belirt. Görüntüde olmayan bilgileri tahmin etme; belirsiz noktaları açıkça işaretle.

Diese Anfrage gliedert die allgemeine Beschreibung in Räume, Materialien und Kamerabewegungen. Bewerten Sie Aussagen zu Materialien als visuelle Eindrücke aus dem Video und nicht als verbindliche technische Angaben.

Prompt
Videoda girişten ana yaşam alanına geçişin görüldüğü bölümü bul. İlgili zaman damgasını belirt ve o anda kadrajda görünen mekânsal ilişkileri kısaca açıkla. Bölüm net değilse bunu söyle; zaman veya plan bilgisi uydurma.

Dieser Text stellt eine Frage zu einer Szene anhand eines Zeitstempels. Öffnen Sie die im Modell genannten Stellen im Video und prüfen Sie sie. Zwar nennt die Dokumentation die Fähigkeit, auf Zeitstempel zu verweisen, sie garantiert aber keine vollkommen genaue Zuordnung bei jeder Anfrage.

Prompt
Bu şantiye videosunda tamamlanmış görünen imalatları ve hâlen devam ettiği açıkça anlaşılan işleri ayır. Her bulguyu videoda görülen sahneyle ilişkilendir; yapısal güvenlik, ölçü veya mevzuat uygunluğu hakkında çıkarım yapma.

Dieses Beispiel fordert eine Klassifizierung an, die bei der Organisation einer visuellen Dokumentation helfen kann. Es liefert jedoch keine Bestätigung zur Sicherheit oder Regelkonformität. Vergleichen Sie die Antworten mit den Aufzeichnungen des Baustellenteams.

  1. Prüfen Sie die Antwort und grenzen Sie die Anfrage weiter ein. Reicht die allgemeine Zusammenfassung nicht aus, stellen Sie eine neue Frage und beschreiben Sie dabei einen sichtbaren Raum, eine Szene oder einen bestimmten Zeitraum. Zu den Fähigkeiten von Gemini beim Videoverständnis gehören Fragen zum Inhalt und Verweise auf Zeitstempel. Prüfen Sie wichtige Ergebnisse im Video, bevor Sie sie verwenden.

Häufige Fehler

Die passende Methode anhand der Dateigröße nicht prüfen: Für große Dateien oder Videos, die wiederverwendet werden sollen, wird die Files API empfohlen. Auch wenn sich für kleine Dateien die Inline-Methode anbietet, nennt die Dokumentation zusätzlich ein Limit von 20 MB für die Gesamtanfrage. Es reicht daher möglicherweise nicht aus, nur die Videodatei selbst zu berücksichtigen.

Eine Analyse anfordern, bevor die Verarbeitung abgeschlossen ist: Im Beispiel zur Files API wird nach dem Upload gewartet, bis die Datei den Status ACTIVE erreicht. Die Dateireferenz vorher zu verwenden, entspricht nicht dem Beispiel-Workflow.

Videoanalyse mit Videogenerierung verwechseln: Für die Analyse einer vorhandenen Aufnahme sollten Sie den Leitfaden zum Videoverständnis verwenden. In der Dokumentation werden Gemini Omni Flash und Veo 3.1 als separate Workflows für Videogenerierung und -bearbeitung beschrieben.

Technische Gewissheit aus dem Bild ableiten: Bitten Sie das Modell, sichtbare Elemente zu beschreiben. Stellen Sie Maße, Materialeigenschaften oder die Eignung einer Ausführung, die nicht im Bild belegt sind, nicht als bestätigte Informationen dar. Überprüfen Sie auch Zeitstempel und Szenenzuordnung anhand des Originalvideos.

Auswirkungen auf Workflows in Architektur und Innenraumgestaltung

Diese Methode kann Architekturbüros, Innenarchitektinnen und Innenarchitekten sowie Studierenden als Ausgangspunkt dienen, um Szenen in längeren Präsentationsvideos zu finden, einen Innenraumrundgang zu strukturieren oder sichtbare Arbeiten aus einer Baustellendokumentation herauszufiltern. Die Files API ist besonders bei großen Dateien, die wiederverwendet werden sollen, praktisch; für kleine einmalige Tests ist die Inline-Übermittlung eine Alternative. Die Quelle macht jedoch keine Angaben zu den Nutzungskosten oder zu bestimmten Hardwareanforderungen. Kosten und Kompatibilität sollten daher vor der Implementierung gesondert geprüft werden. Die Antwort des Modells ersetzt keine technische Freigabe.

Nächste Schritte

Lassen Sie zunächst eine kurze, repräsentative Aufnahme allgemein zusammenfassen. Grenzen Sie die Ausgabe anschließend mit Fragen zu Szenen oder Zeitstempeln weiter ein. Wenn Sie mehrere Anfragen zum selben Video senden, sollten Sie die Files-API-Empfehlung von Google berücksichtigen. Falls Sie mit der API auch Videos generieren müssen, informieren Sie sich zu Gemini Omni Flash und Veo 3.1 getrennt vom Workflow zum Videoverständnis.

Quelle und Lizenz

Dieser Leitfaden wurde auf Grundlage der Informationen in Googles Dokumentation zur Videoanalyse und Videogenerierung mit der Gemini API ins Türkische übertragen. Beide Quellen stehen unter der Lizenz CC BY 4.0.

Quellen

2 Quellen
A(
ai.google.dev (CC BY 4.0)ai.google.dev/gemini-api/docs/video-understanding
Zusammenfassung
A(
ai.google.dev (CC BY 4.0)ai.google.dev/gemini-api/docs/video
Zusammenfassung

Quelltexte werden nicht neu veröffentlicht; kurze Zitate sind gekennzeichnet, der Rest ist eigene Zusammenfassung und Einordnung.

Die Einschätzung von 3dsınıfı
3dEinschätzung der Redaktion

Für Architekturbüros und Studierende liegt der größte Nutzen darin, Szenen in langen Videos schneller zu finden und erste Zusammenfassungen zu erstellen. Die Ausgabe des Modells ist jedoch eine Interpretation auf Grundlage des Bildmaterials; sie ersetzt keine Prüfung von Maßen, Materialspezifikationen oder der Ausführung auf der Baustelle.

Teams in der Türkei sollten mit einem kurzen Beispielvideo und klar eingegrenzten Fragen beginnen. Da die Dokumentation weder Preise noch Hardwareanforderungen nennt, sollten Kosten und Bedingungen für den API-Zugriff gesondert geprüft werden. Dateigröße und Häufigkeit der Wiederverwendung bestimmen außerdem, ob sich die Files API oder die Inline-Übermittlung besser eignet.

Häufige Fragen

Kann die Gemini API Architekturvideos analysieren?

Gemini-Modelle können Videos beschreiben, Fragen zu ihrem Inhalt beantworten und auf bestimmte Zeitstempel verweisen. Technische Erkenntnisse sollten anhand des Originalmaterials überprüft werden.

Wie lassen sich große Videos an die Gemini API übermitteln?

Google empfiehlt die Files API für Dateien ab 100 MB oder Videos, die wiederverwendet werden sollen. Die Dokumentation nennt für die Files API ein Limit von 2 GB bei kostenloser und 20 GB bei kostenpflichtiger Nutzung.

Welches Modell wird im Beispiel zum Videoverständnis verwendet?

Das Beispiel in Googles Dokumentation zum Videoverständnis verwendet das Modell `gemini-3.8-flash`. Für die Videogenerierung werden Gemini Omni Flash und Veo 3.1 als separate Optionen beschrieben.

Kommentare und Forum sind auf Türkisch.Mitdiskutieren
+

Verwandte Meldungen