Neueste Meldungen
Named Attributes in Blender Geometry Nodes: Schritt für SchrittLeitfaden für Architekturvideo-Prompts mit Gemini Omni Flash und Veo 3.1Unreal Engine GPU Lightmass und Lightmap-UVs: Leitfaden für ArchitekturszenenHongling Middle School Shixia Campus auf ArchDaily veröffentlichtHoudini: PolyReduce und Remesh – Praxisleitfaden für ArchitekturmodelleArchicad 27: Ansichten und Layouts konsistent dokumentierenAutodesk Assistant und MCP in Revit: Modelle abfragen und Pläne erstellenPunktwolken in Blender importieren: Point Cloud I/O im ÜberblickPanoramisches Architektur-Rendering in Blender und Animationen sicher speichernUnreal Engine Landscape-Layer: Materialien erstellen und Landschaften bemalen
TutorialsVeoGemini Omni FlashVeo 3.1

Leitfaden für Architekturvideo-Prompts mit Gemini Omni Flash und Veo 3.1

Gemini Omni Flash und Veo 3.1 bieten unterschiedliche Workflows für die Videogenerierung aus Text-Prompts. Dieser Leitfaden zeigt, wie sich Angaben zu Motiv, Handlung, Kontext und Kamera für Architektur- und Innenraumszenen in einem Prompt kombinieren lassen.

Zeitgenössisches Wohnhaus mit Innenhof und Spiegelbecken im Licht der Golden HourKI-Bild
Symbolbild, mit KI erzeugt.Bild: 3dsınıfı / FCA AI

Kurz gesagt

  1. Gemini Omni Flash wird für kurze Videos und Workflows vorgestellt, bei denen Ergebnisse in mehreren Durchgängen überarbeitet werden.
  2. Veo 3.1 bietet Funktionen wie native Audioausgabe, Videoverlängerung, Generierung bestimmter Frames und bildbasierte Steuerung.
  3. Ein Videoprompt lässt sich in Komponenten wie Motiv, Handlung, Szene oder Kontext, Kameraperspektive und Kamerabewegung gliedern.
  4. Die Quellen machen keine Angaben zu Preisen, Kontoanforderungen oder Produktionslimits.

Was erfahren Sie in diesem Leitfaden?

Wenn Sie ein Architekturmotiv in eine bewegte Szene verwandeln möchten, sollte der Prompt mehr enthalten als eine allgemeine Beschreibung wie „ein Video von einem modernen Haus“. Beschreiben Sie stattdessen getrennt, was im Bild zu sehen ist und wie sich die Kamera verhalten soll. Googles Leitfaden für Videoprompts nennt Motiv, Handlung, Szene oder Kontext, Kameraperspektive und Kamerabewegung als zentrale Bestandteile eines Prompts. Nicht jeder Prompt muss all diese Elemente enthalten. Wer jedoch weiß, was jedes einzelne beschreibt, kann die eigene Absicht klarer formulieren.

Die Beispiele in diesem Tutorial wurden eigens für Architekturvisualisierungen und Innenraumpräsentationen erstellt. Sie garantieren kein bestimmtes Ergebnis und versprechen auch nicht, dass sich eine bestimmte Kamerasteuerung zuverlässig umsetzen lässt. Laut Leitfaden werden einige fortgeschrittene Kameraperspektiven offiziell nicht unterstützt; außerdem kann die Zuverlässigkeit der Ergebnisse je nach Anwendungsfall variieren.

Voraussetzungen und Modellauswahl

Für die Videogenerierung können die in Googles Gemini-API- oder Vertex-AI-Leitfaden für Videoprompts beschriebenen Modelloptionen verwendet werden. Die Quellen erläutern weder die Schritte zur Kontoerstellung noch Preise, Kontingente oder bestimmte Abo-Anforderungen. Informieren Sie sich daher in der jeweiligen Produktdokumentation über die Zugangsbedingungen.

In der Dokumentation zur Gemini API wird Gemini Omni Flash für Workflows empfohlen, mit denen sich aus Text und Bildern kurze Videos erzeugen und Ergebnisse in mehreren Durchgängen überarbeiten lassen. Für diese mehrstufige Bearbeitung nennt die Dokumentation die Interactions API. Veo 3.1 wird unter anderem mit der Videogenerierung mit nativem Audio, der Videoverlängerung, der Generierung bestimmter Frames und der bildbasierten Steuerung in Verbindung gebracht. Für diese Funktionen verweist die Dokumentation auf die generateContent API. Die Wahl sollte sich nach dem jeweiligen Bedarf richten: Wenn ein vorheriges Ergebnis innerhalb eines Dialogs verfeinert werden soll, kommt Omni Flash infrage; für Verlängerungen oder die Generierung bestimmter Frames lässt sich Veo 3.1 prüfen.

Architektur-Prompts Schritt für Schritt erstellen

  1. Legen Sie das Hauptmotiv fest. Beschreiben Sie das architektonische Element im Mittelpunkt der Szene, zum Beispiel ein eingeschossiges Wohnhaus, ein kleines Café oder ein Museum mit Innenhof. Ergänzen Sie die Motivbeschreibung um gewünschte Eigenschaften wie Material oder Form. Schreiben Sie konkret, welcher Raum gezeigt werden soll, statt eine allgemeine Formulierung wie „ein Innenraum“ zu verwenden.

  2. Bestimmen Sie die Handlung. Soll das Video einen statischen Raum zeigen oder eine Veränderung darstellen? Der Leitfaden umfasst unter Handlung Bewegungen, Interaktionen oder Veränderungen, die sich im Laufe der Zeit vollziehen. In einer Architekturpräsentation könnten Sie etwa beschreiben, wie das Tageslicht durch einen Raum wandert oder die Kamera einen Korridor entlangfährt. Der Leitfaden weist außerdem darauf hin, bei der Beschreibung eines längeren Vorgangs in einem einzelnen Clip die Clipdauer zu berücksichtigen.

  3. Beschreiben Sie Raum und Atmosphäre. Geben Sie an, wo sich der Innen- oder Außenraum befindet, zu welcher Tageszeit die Szene spielt und welche Stimmung herrscht. Angaben wie „ein großzügiger Wohnbereich mit großen Glasflächen, Morgenlicht und sanften Reflexionen auf dem Boden“ machen den Kontext greifbar. Wenn sich in Ihrem Prompt unnötige Details ansammeln, streichen Sie alles, was die Hauptidee nicht unterstützt.

  4. Wählen Sie Kameraperspektive und -bewegung. Eine Weitwinkelaufnahme kann den Raum im Zusammenhang mit seiner Umgebung zeigen; eine Aufnahme auf Augenhöhe bietet eine neutralere Sicht. Beschreiben Sie die Bewegung separat, zum Beispiel als statische Aufnahme, langsamen Pan oder Dollyfahrt nach vorn. Bei einem Pan wird die Kamera horizontal geschwenkt, bei einem Tilt vertikal; mit einer Dollyfahrt bewegt sich die Kamera physisch näher an das Motiv heran oder davon weg. Das sind unterschiedliche Bewegungen. Eine einzelne, klare Beschreibung wie „Die Kamera fährt näher heran“ ist ein verständlicherer Ausgangspunkt, als mehrere Bewegungen zu kombinieren.

Beispiel 1: Das Wohnhaus in einer Totalen zeigen

Prompt
Wide establishing shot of a compact courtyard house at golden hour. Warm sunlight falls across pale stone walls and a shaded terrace. The camera makes a slow, steady dolly in toward the entrance.

In diesem Beispiel ist das Haus mit Innenhof das Motiv, die Golden Hour und das Sonnenlicht bilden den Kontext, die Kameraperspektive ist eine Weitwinkelaufnahme und die Bewegung eine langsame Dollyfahrt nach vorn. Kombinieren Sie diese Elemente zunächst in einem Versuch und beurteilen Sie das Ergebnis. Ändern Sie anschließend bei Bedarf nur eine Komponente.

Beispiel 2: Materialien im Innenraum zeigen

Prompt
A calm contemporary living room with oak cabinetry, a light stone floor, and a large window. Soft morning light moves across the room. Static eye-level shot, with subtle reflections on the floor.

Hier besteht die Handlung in der Veränderung des Lichts im Raum; die Kamera bleibt statisch. Der Leitfaden beschreibt eine statische Aufnahme als Kamerabewegung, bei der die Kamera an ihrem Platz bleibt. Eine statische Kameraperspektive eignet sich als Ausgangspunkt für Versuche, bei denen die Materialien und die Lichtwirkung im Vordergrund stehen sollen.

Beispiel 3: Durch einen Galerieflur fahren

Prompt
A quiet art gallery corridor with white walls, a polished concrete floor, and evenly spaced framed works. A slow tracking shot moves forward through the corridor, keeping the architecture in view.

Dieser Prompt beschreibt den Raum und die Vorwärtsbewegung der Kamera. Wenn Sie statt „Tracking Shot“ eine der im Leitfaden erläuterten Bewegungen konkreter benennen möchten, können Sie eine Dollyfahrt beschreiben, bei der die Kamera durch die Szene fährt. Das Ergebnis kann variieren; überprüfen und überarbeiten Sie den Prompt daher kontrolliert.

Beispiel 4: Den Innenhof aus der Vogelperspektive zeigen

Prompt
Bird's-eye view of a small landscaped courtyard between low-rise buildings. A narrow path curves around a shallow reflecting pool, with planting beds along the edges. The camera slowly cranes upward to reveal the full layout.

In diesem Beispiel bezeichnet „Bird's-eye view“ eine Perspektive, bei der die Kamera direkt von oben auf die Szene blickt. Mit der Crane-Bewegung soll sich der Bildausschnitt nach oben bewegen und so den gesamten Innenhof zeigen. Der Leitfaden weist darauf hin, dass die offizielle Unterstützung und Zuverlässigkeit einiger fortgeschrittener Perspektiven variieren können. Prüfen Sie deshalb das Ergebnis, wenn Sie eine Ansicht von oben wünschen, und versuchen Sie es gegebenenfalls noch einmal mit einer einfacheren Weitwinkelaufnahme.

Häufige Fehler

  • Zu allgemein formulieren: „Ein Video von einem stilvollen Gebäude“ enthält kaum Informationen zu Motiv, Kontext oder Kamera. Legen Sie zunächst den Raum und das Geschehen im Video fest.

  • Widersprüchliche Bewegungen vorgeben: Pan, Tilt, Dolly und Zoom sind unterschiedliche Kamerabewegungen. Statt mehrere Bewegungen in einem Prompt aneinanderzureihen, sollten Sie zuerst eine Bewegung festlegen und das Ergebnis beurteilen.

  • Eine langwierige Veränderung in einem Clip beschreiben: Der Leitfaden empfiehlt, bei der Beschreibung längerer Vorgänge die Clipdauer zu berücksichtigen. Fassen Sie das Geschehen zu einer kurzen, verständlichen Handlung zusammen.

  • Jeden Prompt mit allen Komponenten füllen: Motiv, Handlung, Kontext, Perspektive und Bewegung müssen nicht immer gemeinsam verwendet werden. Fügen Sie keine Elemente hinzu, die Sie nicht benötigen.

  • Das Ergebnis als sicher annehmen: Die im Prompt genannte Kameraperspektive oder -bewegung führt nicht bei jedem Versuch garantiert zum gleichen Ergebnis. Prüfen Sie insbesondere Aufnahmen mit fortgeschrittenen Perspektiven.

  • Sicherheitsfilter außer Acht lassen: Google weist darauf hin, dass für Gemini Omni Flash und Veo Sicherheitsfilter gelten. Prompts, die gegen die Regeln für unzulässige Inhalte verstoßen, können blockiert werden.

Auswirkungen auf Architektur- und Visualisierungs-Workflows

Dieser Ansatz hilft Visualisierungsteams, Innenarchitekten und Studierenden, die eine statische Architekturpräsentation mit einer kurzen bewegten Szene ergänzen möchten, ihre Prompts systematischer aufzubauen. Wenn Raum, Handlung wie Licht oder Bewegung und Kamerabeschreibung getrennt betrachtet werden, lassen sich unterschiedliche Versuche leichter vergleichen. Die Quellen beschreiben jedoch keinen Workflow für den Import aus einer bestimmten 3D-Software, die Kompatibilität von Modelldateien oder die Umwandlung eines vorhandenen Renderings in ein Video.

Die Modellauswahl sollte sich nach der benötigten Videofunktion richten; Anforderungen wie mehrstufige Bearbeitung und Szenenverlängerung sind getrennt zu betrachten. Prüfen Sie vor der Generierung die verwendete API und die Zugangsbedingungen. Beachten Sie außerdem, dass die Quellen keine Angaben zu Budget und Hardwareanforderungen enthalten. Wenn Kamerabeschreibungen und generierte Ergebnisse in realen Projektpräsentationen eingesetzt werden sollen, ist zusätzlich zu prüfen, ob sie die Entwurfsentscheidungen für den Raum korrekt wiedergeben.

Nächste Schritte

Schreiben Sie für den ersten Versuch einen kurzen Prompt und wählen Sie eine zentrale Kamerabewegung. Ändern Sie anschließend für einen neuen Versuch jeweils nur ein Element: Beschreiben Sie beispielsweise denselben Raum statt mit einer statischen Aufnahme mit einem langsamen Pan. Informieren Sie sich in der jeweiligen API-Dokumentation über den mehrstufigen Bearbeitungsworkflow in Omni Flash und die bei Veo 3.1 in den Quellen genannten Anforderungen für Verlängerungen oder die Generierung bestimmter Frames. Wenn das Ergebnis nicht den Erwartungen entspricht, hilft es, Motiv, Handlung, Szene und Kamera einzeln zu überprüfen und so Unklarheiten zu finden.

Quellen und Lizenz

Dieses Tutorial wurde auf Grundlage der Modellbeschreibungen und Prompt-Komponenten in Googles Dokumenten „Video generation in the Gemini API“ und „Video generation prompt guide“ ins Türkische übertragen und angepasst. Beide Quellen stehen unter der CC-BY-4.0-Lizenz.

Quellen

2 Quellen
A(
ai.google.dev (CC BY 4.0)ai.google.dev/gemini-api/docs/video
Zusammenfassung
C(
cloud.google.com (CC BY 4.0)cloud.google.com/vertex-ai/generative-ai/docs/video/video-gen-prompt-guide
Zusammenfassung

Quelltexte werden nicht neu veröffentlicht; kurze Zitate sind gekennzeichnet, der Rest ist eigene Zusammenfassung und Einordnung.

Die Einschätzung von 3dsınıfı
3dEinschätzung der Redaktion

Für Architekturbüros und Visualisierungsteams in der Türkei kann es den Prozess für kurze Präsentationsvideos besser planbar machen, wenn Motiv, Raum und Kamerabeschreibung getrennt betrachtet werden. Auch Studierende, die statische Bilder durch bewegte Erzählformen ergänzen möchten, können diesen Ansatz als Ausgangspunkt nutzen.

Preise, Hardwareanforderungen und API-Zugangsbedingungen werden in den Quellen jedoch nicht erläutert. Prüfen Sie deshalb vor dem Einsatz die einschlägige Servicedokumentation und die Kosten. Auch die Konsistenz der Kamerabewegungen und die korrekte Wiedergabe des Entwurfs sollten anhand der Ergebnisse gesondert bewertet werden.

Häufige Fragen

Worin unterscheiden sich Gemini Omni Flash und Veo 3.1?

Gemini Omni Flash wird für die Videogenerierung kurzer Clips und mehrstufige Bearbeitungsworkflows hervorgehoben. Veo 3.1 bietet Funktionen wie native Audioausgabe, Videoverlängerung, die Generierung bestimmter Frames und bildbasierte Steuerung.

Welche Angaben sollte ein Architekturvideo-Prompt enthalten?

Motiv, Handlung, Szene oder Kontext, Kameraperspektive und Kamerabewegung sind mögliche Komponenten eines Prompts. Nicht jeder Prompt muss alle enthalten.

Was kosten Gemini Omni Flash und Veo 3.1?

Die Quelldokumente enthalten keine Angaben zu Preisen. Informationen zu Kosten und Zugangsbedingungen finden Sie in der jeweiligen Produktdokumentation.

Kommentare und Forum sind auf Türkisch.Mitdiskutieren
+

Verwandte Meldungen