Kurz gesagt
- Gemini Omni Flash wird für die Erstellung kurzer Videos aus Text und Bildern sowie für die dialogbasierte Videobearbeitung empfohlen.
- Veo 3.1 bietet Optionen wie natürliches Audio, Videoverlängerung und bildgenaue Generierung.
- Ein guter Prompt kann Motiv, Handlung, Ort und Kamerawahl jeweils separat beschreiben.
- Laut Googles Leitfaden können Ergebnisse und Zuverlässigkeit bei fortgeschrittenen Kameraperspektiven variieren.
Was erfahren Sie in diesem Leitfaden?
Eine Architekturszene in ein Video umzuwandeln, bedeutet mehr, als nur „Zeig ein modernes Haus“ zu sagen. Ein kontrollierterer Einstieg gelingt, wenn Sie genau beschreiben, um welchen Raum es geht, was sich in der Szene verändert, zu welcher Tageszeit sie spielt und wie sich die Kamera bewegt. Dieser Leitfaden behandelt die Erstellung von Architektur- und Innenraum-Prompts für Gemini Omni Flash und Veo, die in den Quellen genannten Unterschiede bei der Nutzung der beiden Optionen sowie häufige Fehler beim Prompting.
In Googles Dokumentation wird Gemini Omni Flash für die Erstellung kurzer Videos aus Text und Bildern sowie für die Bearbeitung in mehreren Gesprächsrunden hervorgehoben. Veo 3.1 wird durch Funktionen wie natürliches Audio, Videoverlängerung und bildgenaue Generierung beschrieben. Legen Sie daher zunächst fest, was Sie benötigen: Für die Erstellung einer neuen Szene und die dialogbasierte Weiterbearbeitung können Sie Omni Flash in Betracht ziehen; für die genannten Anforderungen wie Verlängerung oder bildgenaue Steuerung Veo 3.1.
Voraussetzungen und Auswahl des Tools
Die Quelldokumente beschreiben für die Videogenerierung die Gemini API und die Vertex AI Agent Platform. Für Omni Flash wird die Interactions API genannt, für Veo 3.1 die generateContent API. Die Dokumentation macht keine Angaben zu einer bestimmten lokalen Softwareversion, einem Kontotyp, Kosten oder Zugangsbedingungen. Prüfen Sie diese Punkte vor der Nutzung in der aktuellen Dokumentation des jeweiligen Dienstes.
Klären Sie vor dem Start mit drei Fragen, was Sie erreichen möchten:
Soll ein neues Architekturvideo erstellt oder ein vorhandenes Video analysiert werden? Die Quellen beschreiben die Videogenerierung; für die Analyse eines bestehenden Videos verweisen sie auf einen separaten Leitfaden zum Videoverständnis.
Ist die Eingabe Text, ein Bild oder eine Kombination verschiedener Formate? Gemini Omni Flash wird als multimodales Modell beschrieben, das Text-, Bild-, Audio- und Videoeingaben gemeinsam unterstützt. Für Veo 3.1 wird eine Steuerung anhand von Bildern genannt.
Welche Änderung ist für das Ergebnis entscheidend? Wählen Sie ein Ziel, etwa einen Raum vorzustellen, eine Kamerabewegung zu beschreiben oder eine Szene fortzusetzen.
Ein Prompt lässt sich mit folgenden Bausteinen erstellen: Motiv (der Bildfokus), Handlung (was passiert), Szene und Kontext (wo und wann spielt sie, wie ist die Atmosphäre), Kameraperspektive und Kamerabewegung. Sie müssen nicht alle Bestandteile in jedem Prompt verwenden; wählen Sie sie je nach Bedarf aus.
Architektur-Video-Prompts Schritt für Schritt
1. Beschreiben Sie zuerst den Raum und den Fokus
Das Motiv ist das Gebäude oder das Element des Innenraums, das im Mittelpunkt des Videos steht. Beschreiben Sie statt allgemeiner Formulierungen sichtbare Merkmale wie Material, Form und räumliche Beziehungen. Das folgende Beispiel zielt auf die Erstellung einer neuen Außenraumszene ab:
A contemporary public library with a broad timber canopy and a glazed ground floor, set in a quiet urban plaza at early morning. Soft overcast daylight reveals the timber grain and the reflections in the glass. Wide establishing shot, calm architectural visualization.In diesem Beispiel werden Gebäude, Material, Umgebung, Tageszeit und Bildausschnitt gemeinsam festgelegt. Wählen Sie für ein Konzeptvideo aus, welcher Aspekt des Entwurfs im Vordergrund stehen soll, etwa die Fassadenrhythmik, der Eingangsbereich oder die Beziehung des Gebäudes zum Platz. Beschreiben Sie die Eigenschaften, die im Video sichtbar werden sollen, statt nicht sichtbare technische Merkmale oder exakte Maße in den Prompt aufzunehmen.
2. Legen Sie die Handlung in der Szene fest
Die Handlung beschreibt, wodurch sich das Video von einem statischen Bild unterscheidet. In der Architekturvisualisierung lässt sie sich mit beobachtbaren Elementen gestalten, etwa der Bewegung von Menschen, einer Veränderung des Umgebungslichts oder Blättern, die sich im Wind bewegen:
A small group of visitors walks slowly through a contemporary museum atrium, pausing beneath a large skylight. Sunlight shifts gently across the stone floor while a few leaves outside move in a light breeze. Medium-wide shot, restrained and realistic movement.Hier sind die Handlungen kurz gehalten und aufeinander abgestimmt. Wenn Sie viele Veränderungen oder Ereignisse in einem Clip beschreiben, kann unklar werden, welche Bewegung wichtig ist. Wählen Sie zunächst eine zentrale Handlung und ergänzen Sie bei Bedarf eine kleine Bewegung in der Umgebung.
3. Ergänzen Sie Kameraperspektive und Kamerabewegung
Die Kameraperspektive gibt an, von welchem Blickpunkt aus das Publikum den Raum sieht; die Bewegungsbeschreibung legt fest, wie sich die Aufnahme entwickelt. Googles Leitfaden nennt unter anderem Totale, Vogelperspektive, Augenhöhe und Nahaufnahme sowie Bewegungen wie Pan, Tilt, Dolly, Truck, Zoom und Crane. Außerdem wird ausdrücklich darauf hingewiesen, dass die Ergebnisse bei fortgeschrittenen Perspektiven variieren können.
A double-height residential living room with a sculptural staircase and a large window facing a garden. Begin with a wide eye-level view, then make a slow dolly in toward the staircase. Soft late-afternoon light, stable camera, natural material detail.Dieser Prompt beschreibt klar den Anfangsausschnitt und eine einzelne Kamerabewegung. „Dolly in“ bezeichnet eine physische Annäherung der Kamera an das Motiv; der Leitfaden unterscheidet diese Bewegung vom Zoom. Beginnen Sie mit nur einer Bewegung, damit sich das Ergebnis beurteilen lässt, statt mehrere Kameraanweisungen für eine Aufnahme zu kombinieren.
4. Verknüpfen Sie Licht und Atmosphäre mit dem Raum
Der Szenenkontext umfasst Aspekte wie Ort, Tageszeit, Wetter und Atmosphäre. Beschreiben Sie das Licht so, dass es die Wahrnehmung des Entwurfs unterstützt. Wenn beispielsweise Oberflächen sichtbar werden sollen, geben Sie an, aus welcher Richtung das Licht kommt und welche Atmosphäre es erzeugt:
A quiet boutique hotel lobby with pale stone walls, a dark timber reception desk, and a shallow reflecting pool. Early morning light enters from the side and creates soft reflections on the stone. Static wide shot, subtle water movement, calm atmosphere.Die feststehende Kamera unterstützt hier den Fokus auf Lobby und Materialien; die Wasserbewegung bringt zugleich etwas Dynamik in die Szene. Achten Sie darauf, dass Licht-, Kamera- und Handlungsbeschreibungen demselben visuellen Ziel dienen. Eine dramatische Nachtatmosphäre zusammen mit hellem Mittagssonnenlicht im selben Prompt kann beispielsweise zu widersprüchlichen Ergebnissen führen.
5. Betrachten Sie eine Bildeingabe als Orientierung
Wenn Ihnen ein Referenzbild vorliegt, können Sie einen Workflow mit Bildeingabe in Betracht ziehen. Die Quellen geben an, dass Omni Flash mit Text und Bildern arbeiten kann und Veo 3.1 die Steuerung anhand eines Bildes unterstützt. Sie garantieren jedoch nicht, dass jedes Detail des Bildes exakt erhalten bleibt. Beschreiben Sie deshalb im Prompt zusätzlich, welche Eigenschaft wichtig ist:
Use the provided architectural image as visual direction for a compact courtyard house. Show a slow truck right across the courtyard, revealing the relationship between the timber screen, planted edge, and interior glazing. Gentle daylight, restrained movement, wide shot.Dieses Beispiel zeigt, was im Bildausschnitt zu sehen sein soll, während das Bild als Orientierung dient. Wenn sich Material oder räumliche Beziehungen im Ergebnis verändern, passen Sie den Prompt an und vereinfachen Sie den zentralen Fokus. Die Quellen nennen die Möglichkeit der Bildsteuerung, beschreiben jedoch weder einen bestimmten Schritt zum Hochladen eines Bildes noch einen konkreten Weg durch die Benutzeroberfläche.
Häufige Fehler
Zu allgemeine Beschreibungen verwenden: Formulierungen wie „ein schönes Hausvideo“ legen weder Motiv noch Atmosphäre klar fest. Beschreiben Sie den Gebäudetyp, den Raum und das Merkmal, das im Mittelpunkt stehen soll.
Handlung und Kamera verwechseln: Bei einer Beschreibung wie „Während sich die Kamera nähert, dreht sich die Fassade“ kann unklar sein, welche Bewegung Vorrang hat. Formulieren Sie zuerst die Handlung der Szene und danach separat die Kamerabewegung.
Widersprüchliche Atmosphären verlangen: Beschreibungen unterschiedlicher Tages- und Lichtverhältnisse im selben Prompt schwächen den Szenenkontext. Legen Sie eine Tageszeit und eine Atmosphäre fest.
Davon ausgehen, dass jede Kameraperspektive gleich zuverlässig ist: Google weist darauf hin, dass Ergebnisse und Zuverlässigkeit bei einigen fortgeschrittenen Kameraperspektiven variieren können. Wenn ein unerwarteter Bildausschnitt entsteht, probieren Sie es erneut mit einer einfacheren Perspektive.
Generierung und Analyse verwechseln: Die API-Dokumentation in diesem Leitfaden konzentriert sich auf die Videogenerierung. Wenn Sie ein vorhandenes Video analysieren möchten, konsultieren Sie die in den Quellen genannte Dokumentation zum Videoverständnis.
Einsatz in Architektur- und Visualisierungs-Workflows
Dieser Ansatz kann für Architektinnen und Architekten, Innenarchitektinnen und Innenarchitekten sowie Visualisierungsteams hilfreich sein, um Konzeptideen, die Atmosphäre eines Innenraums oder die Beziehung eines Gebäudes zu seiner Umgebung in kurze bewegte Entwürfe zu übertragen. Werden Motiv, Handlung und Kamerawahl im Prompt getrennt beschrieben, lassen sich verschiedene Präsentationsideen leichter vergleichen. Die Quellen sagen jedoch nicht, dass das erzeugte Video die Projektgeometrie oder Materialien exakt beibehält. Bewerten Sie das Ergebnis daher als Versuch für die visuelle Kommunikation und nicht als Ersatz für die Entwurfsvalidierung.
Bei der Toolauswahl sollten neben dem Einsatzzweck auch Lizenz, Zugangsbedingungen und Kosten geprüft werden. Die Quelltexte erläutern weder Preise noch Kontovoraussetzungen. Teams sollten vor der Verwendung von Bildern aus realen Projekten die geltenden Nutzungsbedingungen und die interne Datenrichtlinie prüfen. Außerdem sollten sie technisch sicherstellen, dass der gewählte API-Workflow mit dem bestehenden Produktionsablauf kompatibel ist. Bei einer größeren Präsentation ist es sinnvoller, Kamera- und Szenenbeschreibungen in kurzen Tests zu überprüfen, statt sich auf einen einzigen Prompt zu verlassen.
Nächste Schritte
Führen Sie zunächst mehrere Tests für dieselbe Szene durch und ändern Sie dabei nur die Kamerabewegung. Aktualisieren Sie anschließend jeweils nur ein Element, etwa Licht oder Handlung. So lässt sich leichter erkennen, welche Beschreibung das Ergebnis beeinflusst hat. Für Gemini Omni Flash ist die Bearbeitung in mehreren Runden dokumentiert; geben Sie bei jeder Runde klar an, welche Änderung Sie anstreben. Setzen Sie Veo 3.1 für Anforderungen wie die in den Quellen beschriebene Videoverlängerung oder bildgenaue Generierung ein. Prüfen Sie die Ergebnisse in beiden Fällen im Hinblick auf den vorgesehenen Architekturpräsentationszweck.
Quellen und Lizenz
Dieser Leitfaden wurde unter Verwendung von Googles Dokument „Video generation in the Gemini API“ und Googles Cloud-Leitfaden „Video generation prompt guide“ ins Türkische übertragen und angepasst. Beide Quellen sind unter der Lizenz CC BY 4.0 lizenziert.
Quellen
2 QuellenQuelltexte werden nicht neu veröffentlicht; kurze Zitate sind gekennzeichnet, der Rest ist eigene Zusammenfassung und Einordnung.
Für Architekturbüros liegt der praktische Wert dieses Ansatzes darin, dass sich Raumideen in kurze bewegte Darstellungen übertragen und Kameraoptionen vor einer Präsentation ausprobieren lassen. Besonders bei der Vermittlung von Konzept und Atmosphäre können kurze Tests mit klaren Beschreibungen den Workflow unterstützen.
Büros und Studierende in der Türkei sollten vor einer Nutzungsentscheidung außerdem Kosten, Zugangsbedingungen und die Regeln für die Verwendung von Projektbildern prüfen. Die Quellen erläutern weder Preise noch Kontovoraussetzungen; außerdem wird nicht zugesichert, dass das erzeugte Video die Entwurfsdetails exakt beibehält. Daher empfiehlt es sich, das Ergebnis als Unterstützung für die visuelle Kommunikation und nicht als Werkzeug zur Entwurfsvalidierung zu betrachten.
Häufige Fragen
Was ist der Unterschied zwischen Gemini Omni Flash und Veo 3.1?
Google hebt Gemini Omni Flash für die Erstellung kurzer Videos aus Text und Bildern sowie für die Bearbeitung in mehreren Gesprächsrunden hervor. Veo 3.1 bietet Funktionen wie natürliches Audio, Videoverlängerung und bildgenaue Generierung.
Welche Angaben sollte ein Architektur-Video-Prompt enthalten?
Motiv, Handlung, Szenenkontext, Kameraperspektive und Kamerabewegung können dabei helfen, den Prompt zu strukturieren. Nicht jedes Element muss in jedem Prompt vorkommen.
Was kosten Veo 3.1 oder Gemini Omni Flash?
Die bereitgestellten Quellen nennen keine Preise. Prüfen Sie vor der Nutzung die aktuellen Preis- und Zugangsbedingungen des jeweiligen Dienstes.



