Kurz gesagt
- Gemini Omni Flash und Veo unterstützen die Videogenerierung mit Text-Prompts.
- Ein Prompt lässt sich anhand von Motiv, Bewegung, Szene oder Kontext sowie Kamerabeschreibung strukturieren.
- Gemini Omni Flash ist auf kurze Videos aus Text und Bildern sowie auf mehrstufige Bearbeitung ausgelegt.
- Veo 3.1 bietet native Audioausgabe, Videoverlängerung, bildspezifische Generierung und bildbasierte Steuerung.
Was lernen Sie in diesem Leitfaden?
Die Beschreibung „ein modernes Haus“ reicht in einem Architekturvideo-Prompt möglicherweise nicht aus, um festzulegen, wie die Szene aussehen und wie sich die Kamera verhalten soll. Googles Leitfaden zur Videogenerierung empfiehlt, eine Idee in Bestandteile wie Motiv, Handlung, Szene oder Kontext und Kamera zu gliedern. In diesem Leitfaden übertragen wir diesen Ansatz auf Innen- und Außenvisualisierungen.
Ziel ist nicht, einen magischen Prompt zu finden, der ein bestimmtes Ergebnis garantiert, sondern die Szenenbeschreibung verständlich und kontrollierbar zu machen. Die englischen Prompt-Beispiele unten wurden eigens für diesen Leitfaden verfasst. Jeder Prompt ist so gestaltet, dass er einzeln ausprobiert werden kann. Wählen Sie eine passende Variante und passen Sie sie an Ihr Projekt an.
Voraussetzungen und Modellauswahl
Die Gemini-API-Dokumentation von Google führt Gemini Omni Flash und Veo für die Videogenerierung auf. Laut Dokumentation eignet sich Gemini Omni Flash besonders für kurze Videos aus Text und Bildern sowie für dialogbasierte Bearbeitung in mehreren Schritten. Als Beispiele für einen iterativen Bearbeitungsansatz werden Anfragen genannt, mit denen ein Element in der Szene geändert oder die Perspektive angepasst wird.
Veo 3.1 wird mit Funktionen wie nativer Audiogenerierung, Videoverlängerung, bildspezifischer Generierung und bildbasierter Steuerung beschrieben. Laut Leitfaden kann Veo 3.1 bei besonderen Anforderungen die passende Wahl sein; als Standardoption für die Videogenerierung wird Gemini Omni Flash empfohlen. Welche Option geeignet ist, hängt vom gewünschten Workflow ab.
Die Quellen erläutern weder erforderliche Abonnementmodelle noch Nutzungskosten, Computerhardware oder Bedingungen für die Kontoerstellung. Prüfen Sie daher vor Projektbeginn zusätzlich die aktuellen Angaben zu Verfügbarkeit und Kosten des verwendeten Dienstes. Die folgenden Beispiele konzentrieren sich auf das Schreiben von Prompts; sie beschreiben weder bestimmte Menüs einer Benutzeroberfläche noch API-Aufrufe.
So erstellen Sie einen Prompt für ein Architekturvideo
Berücksichtigen Sie beim Schreiben eines Prompts die folgenden Bestandteile. Es ist nicht nötig, jedes Element immer zu verwenden. Wählen Sie diejenigen aus, die für die jeweilige Szene relevant sind.
Motiv: Legen Sie fest, welcher Raum oder welches Objekt im Mittelpunkt des Videos steht. Statt „ein Innenraum“ können Sie charakteristische Merkmale ergänzen, etwa „ein Wohnbereich mit offener Küche und Holzdecke“.
Handlung: Was verändert sich im Video, was bewegt sich? Entscheiden Sie sich für eine klare Bewegung, etwa Licht, das über eine Wand wandert, oder eine Kamera, die langsam einen Flur entlangfährt.
Szene und Kontext: Beschreiben Sie, ob es sich um einen Innen- oder Außenraum handelt, und geben Sie Tageszeit, Wetter und Atmosphäre an. Morgenlicht, ein regennasser Boden oder ein sonniger Innenhof prägen beispielsweise die Wirkung der Szene.
Kamerawinkel und -bewegung: Geben Sie einen Blickwinkel wie Weitwinkel, Augenhöhe oder Aufsicht sowie eine Kamerabewegung wie eine statische Aufnahme, einen horizontalen Schwenk oder eine Dollyfahrt an. Der Leitfaden weist darauf hin, dass einige fortgeschrittene Kamerawinkel offiziell nicht unterstützt werden und die Ergebnisse variieren können.
Beim ersten Versuch erleichtert es die Beurteilung des Ergebnisses, eine zentrale Bewegung auszuwählen, statt viele Bewegungen in denselben Prompt zu packen. Die Beispiele unten sind als Ausgangspunkte gedacht.
1. Statische Totale im Innenraum
Wide establishing shot of a calm contemporary living room with a timber ceiling, pale stone floor, and a large window. Soft morning light falls across the room. Static camera, realistic architectural visualization, no people.In diesem Prompt ist ein bestimmter Wohnbereich das Motiv, das Morgenlicht der Kontext und die statische Totale die Kameravorgabe. Material- und Lichtbeschreibungen prägen den visuellen Charakter der Szene. Da keine Kamerabewegung vorgegeben ist, bleibt der Fokus auf dem Gesamteindruck des Raums.
2. Langsame Kamerafahrt durch einen Flur
A long gallery corridor in a contemporary art museum, with warm limestone walls and a polished concrete floor. The camera slowly dollies forward at eye level toward a bright courtyard. Soft daylight, quiet atmosphere.„Dollies forward“ beschreibt hier, wie die Kamera physisch nach vorn fährt. Die Augenhöhe und der Blick in Richtung Innenhof machen deutlich, wohin die Bewegung führt. Statt verschiedene Kamerabewegungen entlang des Flurs zu kombinieren, wird nur eine Vorwärtsfahrt verwendet.
3. Horizontaler Schwenk entlang einer Außenfassade
A small contemporary house beside a green garden on an overcast afternoon. Slow pan right across the facade, revealing timber cladding, deep window frames, and the entrance. Wide shot, gentle wind moving the garden plants.In diesem Beispiel sind die Fassade das Motiv und der Garten sowie das bewölkte Wetter der Kontext. Der horizontale Schwenk beschreibt eine Drehung des Bildausschnitts nach rechts. Die Pflanzenbewegung im Wind ergänzt eine kleine Handlung. Kamerabewegung und Bewegung innerhalb der Szene werden getrennt beschrieben.
4. Innenhofgestaltung aus der Vogelperspektive
Bird's-eye view of a compact residential courtyard with a rectangular reflecting pool, stone paving, planted beds, and a timber pergola. Slow, steady camera movement above the courtyard in clear afternoon light.Die Vogelperspektive ist eine Winkelangabe, mit der sich die Lage der Elemente im Innenhof zueinander zeigen lässt. Der Leitfaden führt diesen Blickwinkel als Beispiel an. Beachten Sie jedoch, dass das Ergebnis vom Prompt und vom jeweiligen Anwendungsfall abhängen kann.
5. Nahaufnahme eines Materialdetails
Close-up of a pale stone wall meeting a dark timber door frame in a quiet interior. Slow dolly in toward the junction, soft side light revealing the surface texture, realistic architectural detail.In diesem Beispiel steht nicht der gesamte Raum, sondern der Übergang zwischen Wand und Türrahmen im Mittelpunkt. Nahaufnahme und langsame Kamerafahrt dienen dazu, die Materialbeziehung sichtbar zu machen. Bei realen Projekten sollte zusätzlich geprüft werden, ob das Detail mit dem Entwurf übereinstimmt.
Häufige Fehler
Motiv und Bewegung unklar lassen: Allgemeine Formulierungen wie „Erstelle ein beeindruckendes Video“ enthalten nicht genug Details, um die Szene zu beschreiben. Benennen Sie den Raum und geben Sie klar an, was im Video geschehen soll.
Widersprüchliche Kameraanweisungen verwenden: Gleichzeitig eine statische Aufnahme, einen schnellen Schwenk und eine Vorwärtsfahrt zu verlangen, kann das Kameraverhalten unklar machen. Testen Sie zunächst eine Bewegung. Falls nötig, bitten Sie in einem weiteren Bearbeitungsschritt um eine Anpassung.
Die Szene übermäßig komplex beschreiben: Wählen Sie die wichtigsten Elemente aus, statt zahlreiche Objekte, Ereignisse und atmosphärische Details hinzuzufügen. Denken Sie auch daran, dass Veränderungen, die sich über einen langen Zeitraum erstrecken, möglicherweise nicht zur Dauer eines kurzen Clips passen.
Davon ausgehen, dass alle Kamerawinkel gleichermaßen zuverlässig sind: Laut Leitfaden werden einige fortgeschrittene Winkel offiziell nicht unterstützt, und die Zuverlässigkeit der Ergebnisse kann variieren. Beginnen Sie mit eindeutigen Angaben wie Totale, Augenhöhe, statische Aufnahme oder einfacher Schwenk.
Einsatz im Architektur- und Visualisierungsworkflow
Innenarchitekten, Architekturbüros und Visualisierungskünstler können diesen Ansatz nutzen, um räumliche Ideen in bewegte Präsentationsentwürfe zu übertragen. Wenn räumliche Zusammenhänge durch eine Kamerabewegung statt mit einem einzelnen Bild vermittelt werden sollen, kann es hilfreich sein, Motiv, Handlung und Kameravorgabe getrennt zu beschreiben. Die Quellen garantieren jedoch nicht, dass ein Modellergebnis unmittelbar für Projektzeichnungen oder Entwurfsentscheidungen geeignet ist. Betrachten Sie die generierten Bilder nicht als Beleg für die Richtigkeit des Entwurfs, sondern als visuelle Entwürfe, die überprüft werden müssen.
Stimmen Sie auch bei der Modellauswahl die Funktionen auf den Bedarf ab: Prüfen Sie Gemini Omni Flash für kurze Videos aus Text und Bildern oder für mehrstufige Bearbeitung. Bei Bedarf an Videoverlängerung, bildspezifischer Generierung, bildbasierter Steuerung oder nativer Audiogenerierung kommen die Funktionen von Veo 3.1 in Betracht. Die Quellen enthalten keine Einzelheiten zu Lizenzierung, Kosten, Hardwareanforderungen oder Kompatibilität mit bestehenden Produktionspipelines. Legen Sie den Workflow für den Büroeinsatz daher erst fest, nachdem Sie diese Punkte anhand der aktuellen Nutzungsbedingungen überprüft haben.
Nächste Schritte
Wählen Sie eine Projektszene aus und beschreiben Sie zunächst Motiv und Kontext. Fügen Sie anschließend nur einen Kamerawinkel und eine Bewegung hinzu, um den ersten Versuch zu erstellen. Überlegen Sie bei der Beurteilung des Ergebnisses, was sich ändern soll: Bildausschnitt, Licht oder ein Raumelement? Gemini Omni Flash ist laut Beschreibung auf einen mehrstufigen Bearbeitungsansatz ausgelegt, der solche schrittweisen Anpassungswünsche unterstützt. Bei speziellen Anforderungen wie Videoverlängerung oder bildspezifischer Steuerung können Sie die dokumentierten Funktionen von Veo 3.1 prüfen.
Quelle und Lizenz
Dieser Leitfaden wurde auf Grundlage der Seiten „Video generation prompt guide“ von Google Cloud und „Video generation in the Gemini API“ aus der Gemini-API-Dokumentation ins Türkische übertragen. Beide Quellen stehen unter der CC BY 4.0-Lizenz. Die Architektur-Prompt-Beispiele wurden eigens für diesen Leitfaden verfasst.
Quellen
2 QuellenQuelltexte werden nicht neu veröffentlicht; kurze Zitate sind gekennzeichnet, der Rest ist eigene Zusammenfassung und Einordnung.
Für Architekturbüros und Visualisierungsteams liegt der praktische Nutzen dieses Ansatzes darin, eine Szene in kleine, überprüfbare Entscheidungen zu zerlegen. Wenn derselbe Raum mit unterschiedlichen Kameravorgaben getestet wird, lässt sich eine Präsentationsidee leichter diskutieren. Es sollte jedoch nicht davon ausgegangen werden, dass die Ergebnisse dem Entwurf exakt entsprechen.
Büros und Studierende in der Türkei sollten vor dem Einsatz Kosten, Verfügbarkeit und Kompatibilität mit dem bestehenden Workflow prüfen. Die Quellen nennen weder Hardwareanforderungen noch Preise. Deshalb lässt sich daraus keine bestimmte Computerinvestition oder Lizenzform ableiten. Am sichersten ist es, generierte Videos als Entwürfe zu behandeln, die noch überprüft werden müssen, und nicht als endgültige Projektergebnisse.
Häufige Fragen
Worin unterscheiden sich Gemini Omni Flash und Veo 3.1?
Google hebt Gemini Omni Flash für die Generierung kurzer Videos und mehrstufige Bearbeitung hervor. Veo 3.1 wird mit nativer Audiogenerierung, Videoverlängerung, bildspezifischer Generierung und bildbasierter Steuerung beschrieben.
Welche Angaben sollte ein Prompt für ein Architekturvideo enthalten?
Zu den grundlegenden Bestandteilen gehören Motiv, Handlung, Szene oder Kontext sowie die Kameravorgabe. Es ist nicht erforderlich, alle Angaben in jedem Prompt zu verwenden.
Welche Videofunktionen unterstützt Veo 3.1?
Laut Dokumentation bietet Veo 3.1 native Audiogenerierung, Videoverlängerung, bildspezifische Generierung und bildbasierte Steuerung.



