Kurz gesagt
- Gemini Omni Flash ist dafür ausgelegt, kurze Videos aus Text und Bildern zu generieren und die Ergebnisse in mehreren Runden zu bearbeiten.
- Veo 3.1 bietet nativen Ton, Videoverlängerung, generationsspezifische Frames und bildgestützte Steuerung.
- Eine klare Aufgabe, eindeutige Einschränkungen und das gewünschte Ausgabeformat gehören zu den zentralen Bestandteilen des Promptdesigns.
- Der Leitfaden von Google empfiehlt, Beispiele einzubeziehen und Prompts anhand der Ergebnisse iterativ zu verbessern.
Was erfahren Sie in diesem Leitfaden?
Wir zeigen, wie Sie einen Prompt strukturieren, wenn Sie eine Architekturszene in eine kurze Videosequenz verwandeln möchten, wie Sie Gemini Omni Flash oder Veo 3.1 passend zu Ihrem Workflow auswählen und wie Sie Ihre Beschreibung nach dem ersten Ergebnis verbessern. Die Beispiele sind auf Anwendungsfälle der Architekturvisualisierung zugeschnitten, etwa die Darstellung eines Innenraums bei Tageslicht, eine Kamerafahrt entlang einer Fassade und den Erhalt der Materialwirkung.
Die hier gezeigten Prompts sind keine Kopien der Beispiele aus den Quellen, sondern eigenständige Entwürfe auf Grundlage der dort dokumentierten Prinzipien zu klaren Anweisungen, Einschränkungen, Eingabetypen und iterativer Überarbeitung. Da die Qualität des Ergebnisses vom Modell, den Eingaben und den Versuchen abhängt, sollten Sie die Prompts als Ausgangspunkt und nicht als Garantie für ein bestimmtes Resultat verstehen.
Voraussetzungen und Modellauswahl
Dieser Workflow basiert auf den Videogenerierungsmodellen in der Gemini API. In den Quellen werden Gemini Omni Flash und Veo 3.1 als Optionen für unterschiedliche Anforderungen beschrieben. Als allgemeines Einstiegsmodell wird Gemini Omni Flash für die Generierung kurzer Videos aus Text und Bildern sowie für dialogbasierte Bearbeitung über mehrere Runden hinweg empfohlen. Die Quellen nennen auch die gleichzeitige Unterstützung von Bild-, Audio- und Videoeingaben sowie Stärken wie Szenenkonsistenz und Charakterkontinuität.
Ziehen Sie Veo 3.1 in Betracht, wenn Sie eine Szene verlängern, ein bestimmtes Frame generieren oder nativen Ton benötigen. Das Modell bietet bildgestützte Steuerung und generationsspezifische Frames über die generateContent-API. Die mehrstufige Bearbeitung mit Gemini Omni Flash wird über die Interactions API beschrieben. Dieser Leitfaden enthält keine Informationen zur Freischaltung des API-Zugriffs, zu Preisen, Hardwareanforderungen oder Kontobedingungen. Prüfen Sie diese Punkte vor der Nutzung anhand der jeweils aktuellen Quellen.
Legen Sie vor dem Start fest, welche Szene Sie erzeugen möchten. Wenn Sie ein Bild verwenden wollen, formulieren Sie die Anweisung so, dass es als Videoeingabe dient. Ohne Bildvorlage beschreiben Sie Raum, Licht, Kamerabewegung und gewünschtes Ergebnis eindeutig im Text. Die Quellen bestätigen die Unterstützung dieser Eingaben, nennen jedoch keine bestimmte Dauer, Auflösung oder Bildrate. Ergänzen Sie daher keine technischen Werte, die nicht dokumentiert sind.
Schritt für Schritt zum Prompt
Beginnen Sie mit einer klaren Hauptaufgabe. Schreiben Sie gleich im ersten Satz, was das Modell erzeugen soll. Statt einer allgemeinen Formulierung wie „Erstelle ein Innenraumvideo“ nennen Sie den gezeigten Raum und den Zweck des Videos. Ergänzen Sie anschließend Details zur Szene.
Aydınlık bir konut mutfağını gösteren kısa bir mimari görselleştirme videosu oluştur. Kamera, mutfak adasının yanından yavaşça ilerleyerek mekânın tamamını ortaya çıkarsın. Sakin bir sabah atmosferi kur; kadrajda insan gösterme.In diesem Entwurf werden Aufgabe, Raum, Kamerabewegung und Szeneneinschränkung getrennt voneinander formuliert. Benennen Sie ausdrücklich, welche Aspekte der Szene wichtig sind, statt dem Modell die Entscheidung zu überlassen.
Erklären Sie, was mit der Bildeingabe geschehen soll. Wenn Sie ein Referenzbild hinzufügen, erläutern Sie im Prompt seine Funktion: Soll die räumliche Anordnung erhalten bleiben oder dient es lediglich als Orientierung für Material- und Lichtwirkung? Den Quellen zufolge kann Gemini Omni Flash Bilder als Eingaben für die Videogenerierung verwenden; Veo 3.1 bietet ebenfalls bildgestützte Steuerung. Das folgende Beispiel ist für einen Workflow mit Bildeingabe formuliert.
Eklediğim iç mekân görselini sahnenin mekânsal düzeni için referans al. Kamera oturma alanından pencereye doğru yavaşça ilerlesin. Görseldeki mobilya yerleşimini ve malzeme karakterini koru; ışık yumuşak ve doğal olsun.Gehen Sie nicht davon aus, dass jedes Detail eines Bildes exakt erhalten bleibt. Prüfen Sie die erste Ausgabe. Weichen Anordnung oder Materialwirkung vom Erwarteten ab, benennen Sie in der nächsten Runde ausdrücklich, welcher Aspekt korrigiert werden soll.
Beschreiben Sie die Bewegung konkret. Geben Sie für die Kamerabewegung die Richtung und den Zusammenhang zwischen Start- und Endpunkt in der Szene an. Beschreiben Sie, was im Verlauf der Einstellung zu sehen sein soll, statt sich auf mehrdeutige Adjektive wie „kinematisch“ zu verlassen.
Bir çağdaş müze girişini dışarıdan gösteren mimari video üret. Kamera girişe doğru yavaşça yaklaşsın ve cam cephe boyunca sağa kayarak fuaye içini görünür kılsın. Yapının kütlesi kadrajda okunaklı kalsın; hareket sakin ve kesintisiz olsun.Dieses Beispiel beschreibt sowohl die Kamerabewegung als auch das gewünschte architektonische Motiv. Interpretiert das Modell die Bewegung anders, korrigieren Sie in der neuen Anweisung nur den betreffenden Abschnitt. So lässt sich leichter beurteilen, wie sich die Änderung auf die Szene auswirkt.
Ergänzen Sie Einschränkungen und Ausgabeformat. Zu den grundlegenden Promptstrategien im Quellleitfaden gehört es, unerwünschte Elemente zu benennen und das gewünschte Ergebnis konkret zu beschreiben. Bei einer Architekturpräsentation können Sie beispielsweise festlegen, dass keine Menschen ins Bild kommen, die Gebäudeform unverändert bleibt oder das Video auf eine bestimmte Szene beschränkt ist.
Eklediğim cephe görselinden hareketli bir mimari sunum videosu oluştur. Kamera cephe boyunca yavaşça ilerlesin. Yapının ana formunu ve pencere düzenini değiştirme; yeni kat, tabela veya insan ekleme. Odak cephe malzemesi ve gün ışığının yüzeydeki etkisi olsun.Formulieren Sie Einschränkungen nach ihrer Priorität. Vermeiden Sie widersprüchliche Anweisungen: Wenn Sie gleichzeitig eine statische Kamera und eine Kamerafahrt verlangen, kann das Ziel für das Modell unklar werden.
Bewerten Sie das Ergebnis und korrigieren Sie es in der nächsten Runde. Gemini Omni Flash unterstützt dialogbasierte Bearbeitung über mehrere Runden hinweg über die Interactions API. Ermitteln Sie, was am ersten Ergebnis nicht stimmt, und beschreiben Sie anschließend gezielt das zu korrigierende Element, statt den gesamten Prompt von Grund auf neu zu schreiben.
Önceki videoda kamera hareketi uygun, ancak pencere düzeni referans görselden farklılaştı. Kamera hareketini koru ve yeni üretimde pencere aralıklarını görseldeki gibi tutmaya odaklan.Eine solche Folgeanweisung unterscheidet klar zwischen den Eigenschaften, die erhalten bleiben, und denen, die geändert werden sollen. Googles Leitfaden zum Promptdesign behandelt Prompting als iterativen Prozess und empfiehlt, Ergebnisse zu prüfen und Beschreibungen für den jeweiligen Einsatzzweck weiterzuentwickeln.
Häufige Fehler
Sich auf vage Adjektive verlassen: Wörter wie „schön“, „beeindruckend“ oder „realistisch“ ersetzen keine Szenenbeschreibung. Nennen Sie auch den Raum, die Lichtverhältnisse, die Bewegung und den Fokus.
Alles in einen einzigen Satz packen: Trennen Sie Aufgabe, Rolle des Bildes, Kamerabewegung und Einschränkungen übersichtlich voneinander. Ein langer Prompt führt nicht automatisch zu einem besseren Ergebnis. Entscheidend sind klare und widerspruchsfreie Anweisungen.
Das erste Ergebnis für endgültig halten: Prüfen Sie die Modellausgabe und halten Sie die einzelnen Probleme fest. Wenn Sie in der nächsten Runde jeweils nur ein Merkmal korrigieren, lässt sich leichter nachvollziehen, welche Anweisung welche Änderung bewirkt hat.
Das Modell nicht passend zum Bedarf auswählen: Für mehrstufige Bearbeitung und allgemeine Videogenerierung kommt Gemini Omni Flash infrage; für Anforderungen wie Verlängerungen, generationsspezifische Frames oder nativen Ton kann Veo 3.1 eine Option sein. Verwechseln Sie die Funktionen nicht und prüfen Sie vor der Auswahl die aktuellen API-Dokumentationen.
Nächste Schritte im Architektur- und Visualisierungsworkflow
Für Architekturbüros kann dieser Ansatz bei Versuchen hilfreich sein, eine Raum- oder Fassadenidee in einen kurzen animierten Präsentationsentwurf zu verwandeln. Innenarchitekten können Material- und Lichtwirkung, Visualisierungskünstler Kamerabewegung und Szenenkontinuität jeweils separat im Prompt beschreiben und bewerten. Studierende können anhand derselben Referenz unterschiedliche Bewegungs- oder Atmosphärenbeschreibungen vergleichen.
Die Quellen machen jedoch keine Angaben zu einer direkten Anbindung an bestimmte 3D-Software, zum Austausch von Projektdateien, zur Ausgabeauflösung oder zu Preisen. Gehen Sie daher nicht davon aus, dass die Videogenerierung automatisch an den bestehenden Modellierungs- und Renderprozess anschließt. Prüfen Sie separat die verwendete API, Lizenz- und Kostenbedingungen, die zulässige Nutzung der Referenzbilder sowie die Eignung der Ergebnisse für Ihre Entwurfsentscheidungen. Die Videogenerierung kann eine Präsentationsalternative bieten, ersetzt aber weder architektonische Maße noch Ausführungsdetails oder technische Prüfung.
Quellen und Lizenz
Dieser Leitfaden wurde auf Grundlage der Dokumentation zur Videogenerierung in der Gemini API und des Promptdesign-Leitfadens von Google ins Türkische übertragen und angepasst. Beide Quellen stehen unter der Lizenz CC BY 4.0. Die Beispiele für Architekturprompts wurden eigenständig anhand der in den Dokumenten beschriebenen Techniken erstellt.
Quellen
2 QuellenQuelltexte werden nicht neu veröffentlicht; kurze Zitate sind gekennzeichnet, der Rest ist eigene Zusammenfassung und Einordnung.
Für Architekturbüros und Visualisierungsteams in der Türkei liegt der praktische Nutzen dieses Ansatzes darin, eine kurze Präsentationsidee mithilfe von Text- und Bildeingaben schnell ausprobieren zu können. Teams, die verschiedene Kamerabewegungen oder Atmosphären testen möchten, können Prompts in kleinen Schritten ändern und die Ergebnisse vergleichen.
Kosten, API-Zugriff und Ausgabebedingungen werden in den Quellen jedoch nicht erläutert. Diese Punkte sollten geklärt werden, bevor der Ansatz regelmäßig in den Workflow aufgenommen wird. Auch zu Hardwareanforderungen enthalten die Quellen keine Angaben. Die generierten Videos sollten als zu prüfende Präsentationsentwürfe und nicht als Nachweis für die Entwurfsgenauigkeit betrachtet werden. Zudem empfiehlt es sich, die Kompatibilität mit vorhandenen Softwareprozessen gesondert zu testen.
Häufige Fragen
Sollte man für die Architekturvideogenerierung Gemini Omni Flash oder Veo 3.1 verwenden?
Gemini Omni Flash wird für allgemeine Videogenerierung und mehrstufige Bearbeitung empfohlen. Wenn Sie eine Szene verlängern, generationsspezifische Frames erstellen oder nativen Ton benötigen, kommt Veo 3.1 infrage.
Kann Gemini Omni Flash mit einer Bildeingabe ein Video erzeugen?
Ja. Laut Quelle kann Gemini Omni Flash kurze Videos aus Text und Bildern generieren.
Welche Videofunktionen unterstützt Veo 3.1?
Veo 3.1 bietet nativen Ton, Videoverlängerung, generationsspezifische Frames und bildgestützte Steuerung.



