Kurz gesagt
- Gemini Omni Flash eignet sich für kurze Videos aus Text und Bildern sowie für mehrstufige Bearbeitungen.
- Veo 3.1 bietet Funktionen wie Szenenverlängerung, gezielte Steuerung bestimmter Frames und integrierte Audiogenerierung.
- Prompts mit klarer Aufgabe, Einschränkungen und Erwartungen an das Ergebnis können den Produktionsprozess besser kontrollierbar machen.
- Googles Dokumentation zur Gemini-API-Videogenerierung erläutert die Modellauswahl; der Leitfaden zum Prompt-Design zeigt, wie Anweisungen formuliert werden.
Was erfahren Sie in diesem Leitfaden?
Ein Architekturvisual in ein kurzes Video zu verwandeln oder Änderungen an einer generierten Szene anzufordern, bedeutet mehr, als nur einen eindrucksvollen Raum zu beschreiben. Ein Prompt sollte klar vermitteln, was in der Szene geschieht, wie sich die Kamera bewegt, welche Elemente erhalten bleiben sollen und wie das Ergebnis aussehen soll. In diesem Leitfaden ordnen wir die in der Gemini-API-Dokumentation beschriebenen Videomodelle den Anforderungen der Architekturvisualisierung zu, erstellen praktische Prompt-Beispiele und zeigen, wie Sie Ergebnisse iterativ verbessern können.
In Googles Dokumentation wird Gemini Omni Flash als allgemeine Empfehlung für die Erstellung kurzer Videos aus Text und Bildern sowie für Bearbeitungen über mehrere Gesprächsrunden hinweg vorgestellt. Veo 3.1 ist dagegen besonders für Anforderungen wie Szenenverlängerung, Kontrolle des letzten Frames oder die Integration in ältere Workflows interessant. Diese Beschreibungen der Modellfähigkeiten stammen aus der Dokumentation des Anbieters und bedeuten nicht, dass die Ergebnisse in jeder Szene gleich ausfallen.
Voraussetzungen und Modellauswahl
Dieser Leitfaden behandelt Gemini Omni Flash und Veo 3.1, die in der Dokumentation zur Videogenerierung mit der Gemini-API aufgeführt sind. Mit Omni Flash lassen sich kurze Videos aus Text und Bildern erstellen; außerdem unterstützt das Modell über die Interactions API mehrstufige dialogbasierte Bearbeitungen. Veo 3.1 wird für die Videogenerierung über die generateContent API beschrieben und bietet integriertes Audio, Szenenverlängerung, framebezogene Generierung und bildgestützte Steuerung.
Die Dokumentation enthält keine näheren Angaben zur Kontoerstellung, Abrechnung, Verfügbarkeit oder erforderlichen Hardware. Prüfen Sie deshalb vor Produktionsbeginn separat die aktuellen API-Zugangsbedingungen und Kosten. In diesem Leitfaden wird weder ein bestimmtes Abonnement noch eine lokale Hardwarevoraussetzung angenommen. Da die Videodokumentation die API-Nutzung behandelt, basieren die Beispiele auf einem API-Workflow. Menüpunkte oder Parameter werden nicht genannt; daher beschreibt dieser Leitfaden keinen konkreten Navigationspfad in einer Benutzeroberfläche.
Wählen Sie das Modell passend zu Ihrer Aufgabe:
Wenn Sie einen kurzen Clip aus Text- oder Bildeingaben erstellen und ihn anschließend in Gesprächsrunden überarbeiten möchten, kommt Omni Flash infrage.
Wenn Sie eine Szene verlängern, bestimmte Frames gezielt steuern oder integriertes Audio verwenden möchten, ziehen Sie Veo 3.1 in Betracht.
Wenn Sie ein vorhandenes Video analysieren statt eines zu generieren möchten, lesen Sie den separaten Leitfaden „Video understanding“, auf den die Dokumentation verweist.
Schritt für Schritt: Prompts für Architekturvideos
Googles Leitfaden zum Prompt-Design empfiehlt klare und konkrete Anweisungen. Aufgabe, Einschränkungen und erwartetes Ausgabeformat sollten im Prompt stehen. Außerdem wird betont, dass die Entwicklung von Prompts aus Testen und Verbessern besteht. Die folgenden Beispiele wurden eigens für den Architekturbereich erstellt und sind keine Kopien der Prompt-Beispiele aus den Quellen.
1. Beschreiben Sie zuerst die Szene und die Bewegung
Nennen Sie im ersten Prompt gemeinsam den Projekttyp, den sichtbaren Raum, die Lichtstimmung und die gewünschte Kamerabewegung. Statt viele vage Adjektive zu verwenden, konzentrieren Sie sich auf beobachtbare Elemente im Video.
Create a short architectural video of a calm contemporary living room with pale oak flooring, a limestone feature wall, and soft morning light entering through tall windows. Show the room from the doorway as the camera slowly moves toward the seating area. Keep the furniture layout stable and the atmosphere quiet and natural.Diese Beschreibung benennt Raummerkmale, Lichtverhältnisse und Kamerabewegung jeweils klar. Prüfen Sie beim Bewerten des ersten Ergebnisses beispielsweise, ob die Raumaufteilung erhalten blieb, die Kamera sich wie gewünscht bewegt und die Lichtbeschreibung verständlich umgesetzt wurde. Statt beim nächsten Versuch alles neu zu formulieren, präzisieren Sie gezielt die Anweisung, die nicht funktioniert hat.
2. Verwenden Sie ein Referenzbild als Steuerungseingabe
Omni Flash kann mit Text und Bildern arbeiten; Veo 3.1 unterstützt ebenfalls eine bildgestützte Steuerung. Fügen Sie ein geeignetes Bild als Eingabe hinzu und geben Sie im Text an, welche visuellen Merkmale erhalten bleiben sollen. Das folgende Beispiel ist für die Verwendung eines Renderings als Videoeingabe gedacht.
Use the provided architectural image as the visual reference for the room. Create a short video that preserves its material palette, window positions, and furniture arrangement. Show a gentle camera move from the dining area toward the kitchen, with consistent daylight and no new furniture.Die Vorgaben zum Beibehalten konzentrieren sich hier auf die wesentlichen Gestaltungsentscheidungen des Bildes. Details, die in der Referenz nicht zu sehen sind, kann das Modell anders interpretieren. Deshalb ist es sinnvoll, wichtige Material- und Platzierungsentscheidungen auch im Text ausdrücklich zu benennen. Die Quellen garantieren nicht, dass das Modell jedes Detail exakt beibehält.
3. Verbessern Sie das erste Ergebnis in einer Bearbeitungsrunde
Die Unterstützung mehrstufiger dialogbasierter Bearbeitungen in Omni Flash ermöglicht es, nach der ersten Generierung eine gezielte Änderung anzufordern. Wenn Sie pro Runde jeweils eine wesentliche Änderung beschreiben, wird klarer, was angepasst werden soll.
In the current video, replace the dark coffee table with a low, light-oak table. Keep the room layout, camera movement, window light, and all other furniture unchanged.Dieses Beispiel verlangt lediglich, den Couchtisch zu ersetzen und alle übrigen Elemente beizubehalten. Ändern sich im Ergebnis auch andere Elemente, benennen Sie in der nächsten Runde noch genauer, was unverändert bleiben soll. Die mehrstufige Bearbeitung ist für Omni Flash dokumentiert; der Erfolg jeder Bearbeitung in jeder Szene ist jedoch nicht garantiert.
4. Beschreiben Sie die gewünschte Szenenverlängerung separat
Wenn ein Clip fortgesetzt werden soll, ziehen Sie die dokumentierte Funktion zur Szenenverlängerung in Veo 3.1 in Betracht. Die Quellen stellen diese Funktion vor, erklären aber weder die Schritte in der Benutzeroberfläche noch die Parameter. Das folgende Prompt konzentriert sich daher auf den Inhalt der Fortsetzung.
Extend the architectural scene with a slow continuation into the adjoining courtyard. Maintain the same stone surfaces, soft daylight, and restrained visual mood. Let the view reveal the courtyard gradually, without changing the established architectural style.Das Beispiel beschreibt, welche visuelle Sprache in der Fortsetzung beibehalten werden soll. Folgen Sie bei der technischen Umsetzung der Szenenverlängerung den aktuellen Veo-Anleitungen. Gehen Sie nicht von einem Steuerelement oder API-Parameter aus, der hier nicht genannt wird.
Häufige Fehler
Unklare Bewegungsbeschreibungen: Statt allein auf offene Formulierungen wie „mach es filmischer“ zu setzen, beschreiben Sie die Ausgangsposition der Kamera und die Richtung, in die sie sich bewegen soll.
Zu viele Änderungen in einem Prompt: Werden Kamera, Material, Licht und Möbel gleichzeitig geändert, lässt sich das Ergebnis schwerer bewerten. Legen Sie zunächst die grundlegende Szene an und fordern Sie gezielte Änderungen anschließend in einzelnen Runden an.
Elemente, die erhalten bleiben sollen, nicht benennen: Die Eingabe eines Bildes bedeutet nicht, dass automatisch jede Gestaltungsentscheidung übernommen wird. Nennen Sie wichtige Material-, Platzierungs- und Lichtmerkmale auch im Text.
Das Modell unabhängig von der Aufgabe auswählen: In der Dokumentation wird Omni Flash für kurze Videos und dialogbasierte Bearbeitungen genannt; Veo 3.1 für Anforderungen wie Szenenverlängerung, framebezogene Generierung oder integriertes Audio. Eine unpassende Auswahl kann zu unnötigen Versuchen führen.
Ein perfektes Ergebnis beim ersten Versuch erwarten: Prompt-Design ist ein iterativer Prozess. Prüfen Sie die Generierung, identifizieren Sie fehlende oder fehlerhafte Aspekte und passen Sie die Anweisung gezielt an.
Die nächsten Schritte im Architektur- und Visualisierungsworkflow
Architekturbüros und Studierende können kurze Kamerafahrten nutzen, um die Atmosphäre eines Innenraums, das Zusammenspiel von Materialien oder das Raumgefühl beim Durchqueren für Präsentationen zu untersuchen. Die Arbeit mit Bildeingaben kann Bewegungsversuche auf Grundlage eines vorhandenen Renderings ermöglichen. Die Quellen garantieren jedoch nicht, dass das Modell die Entwurfsgeometrie und sämtliche visuellen Details exakt beibehält. Betrachten Sie das Ergebnis daher als Versuch der visuellen Vermittlung, nicht als technische Zeichnung oder verbindliche Projektunterlage.
Bevor ein Team die Methode in seinen Workflow integriert, sollte es den API-Zugang, die aktuellen Lizenz- und Kostenbedingungen sowie die Kompatibilität mit dem bestehenden Produktionsprozess prüfen. Die Dokumentation enthält keine Angaben zu Preisen, lokalen Hardwareanforderungen oder zur Kompatibilität mit bestimmter Designsoftware. Für eine fundiertere Bewertung empfiehlt es sich, mit einer kleinen Testszenen zu beginnen und bei jeder Prompt-Runde festzuhalten, welche Gestaltungsentscheidungen erhalten bleiben und welche sich ändern.
Quellen und Lizenz
Dieser Leitfaden wurde auf Grundlage der Dokumentation von Google zur Videogenerierung mit der Gemini-API und zu Prompt-Design-Strategien ins Türkische übertragen. Beide Quellen stehen unter der Lizenz CC BY 4.0. Die architektonischen Prompt-Beispiele wurden eigens für diesen Leitfaden verfasst; Prompt-Beispiele aus den Quellen wurden nicht kopiert.
Quellen
2 QuellenQuelltexte werden nicht neu veröffentlicht; kurze Zitate sind gekennzeichnet, der Rest ist eigene Zusammenfassung und Einordnung.
Für Architekturbüros und Studierende in der Türkei kann dieser Ansatz praktisch sein, um aus vorhandenen Renderings kurze Präsentationsvideos zu erstellen und unterschiedliche Szenenerzählungen auszuprobieren. Wenn Sie ausdrücklich festhalten, welche Entscheidungen des Ausgangsbildes erhalten bleiben sollen, lässt sich die Entwurfsabsicht leichter nachvollziehen.
Allerdings enthalten die Quellen keine Angaben zu API-Zugang, Kosten, Lizenzierung oder Kompatibilität mit bestimmter Designsoftware. Bevor Sie die Methode direkt in den Produktionsworkflow übernehmen, sollten Sie sie deshalb an einer kleinen Szene testen und die aktuellen Bedingungen prüfen. Sinnvoller ist es, die Ergebnisse als Alternative zur visuellen Vermittlung zu betrachten – nicht als Garantie für technische Genauigkeit.
Häufige Fragen
Wofür lässt sich Gemini Omni Flash bei der Erstellung von Architekturvideos einsetzen?
Laut Google-Dokumentation kann das Modell kurze Videos aus Text und Bildern erstellen und unterstützt über die Interactions API mehrstufige Bearbeitungen.
Was ist der Unterschied zwischen Gemini Omni Flash und Veo 3.1?
Omni Flash wird für die allgemeine Videogenerierung und dialogbasierte Bearbeitung empfohlen. Veo 3.1 bietet Funktionen wie Szenenverlängerung, framebezogene Generierung und integriertes Audio.
Welche Hardware wird für die Videogenerierung mit der Gemini-API benötigt?
Die Quelldokumentation enthält keine Angaben zu erforderlicher Hardware. Aktuelle Informationen zu API-Zugang und Kosten sollten Sie in der Gemini-API-Dokumentation nachlesen.



