Neueste Meldungen
V-Ray Enmesh in 3ds Max: Wiederholte Oberflächenmuster erstellenBlender Python Console: Szenenobjekte schnell bearbeitenBlender Geometry Nodes: Boolean und Extrude für die ArchitekturmodellierungUnreal Engine Level Snapshots: Szenenvarianten sicher verwaltenArchitekturvisualisierung in ein Video verwandeln: Schritt für Schritt mit Gemini OmniArchitekturvisualisierung mit Unreal Engine 5.0: Lumen, Nanite und SchattenMake2D und Print in Rhino 8: Leitfaden für 2D-Zeichnungen und PlotausgabeHochwertige Architektur-Renderings mit dem Unreal Engine Movie Render GraphReactor erhält Unterstützung von NVIDIA: Investitionen in Echtzeit-3D-InfrastrukturBilbaos Kunstmuseum wächst mit Agravitas um 6.000 m²
TutorialsGoogleGemini Omni 1.1 Flash PreviewVeo 3.1

Architekturvisualisierung in ein Video verwandeln: Schritt für Schritt mit Gemini Omni

Gemini Omni und Veo können ein vorhandenes Bild als erstes Videobild verwenden und daraus ein Video erstellen. Dieser Leitfaden erklärt den Ablauf anhand der Bildauswahl, Bewegungs-Prompts und grundlegender API-Einstellungen.

Ein leicht bewegter Vorhang in einem modernen Innenraum im MorgenlichtKI-Bild
Symbolbild, mit KI erzeugt.Bild: 3dsınıfı / FCA AI

Kurz gesagt

  1. Gemini Omni und Veo können ein Bild als Startbild eines Videos verwenden.
  2. Für Gemini Omni 1.1 Flash Preview sind in der Dokumentation Videolängen von 3–10 Sekunden angegeben.
  3. Ein Prompt lässt sich besser steuern, wenn er in Beschreibungen von Motiv, Bewegung, Umgebung und Kamera aufgeteilt wird.
  4. Für die Nutzung der REST API sind ein Google Cloud-Projekt, die Agent Platform API und eine Authentifizierung erforderlich.

Was erfahren Sie in diesem Leitfaden?

Wenn Sie eine Architekturvisualisierung in ein kurzes Video verwandeln, geht es nicht nur darum, der Szene Bewegung zu verleihen, sondern auch darum, die Lesbarkeit des Entwurfs zu erhalten. In diesem Leitfaden zeigen wir, wie Sie ein vorhandenes Bild als Startbild verwenden, Bewegungen mit kurzen, klaren Beschreibungen vorgeben, die Kameraführung festlegen und die grundlegenden Einstellungen im API-Beispiel verstehen. Die Beispiele eignen sich für Visualisierungen von Wohnräumen, Fassaden und Landschaften.

Laut der Dokumentation von Google können Gemini Omni und Veo aus einem vorhandenen Bild ein Video generieren. Die Funktion ist über das Media Studio der Gemini Enterprise Agent Platform oder über die Videogenerierungs-API verfügbar. Da die Ergebnisse nicht bei jedem Prompt identisch ausfallen müssen, empfiehlt es sich, die ersten Versuche kurz zu halten und sich auf eine einzelne Bewegungsidee zu konzentrieren.

Voraussetzungen: Konto, Modell und Bild

Für die Arbeit über das Media Studio oder die API benötigen Sie ein Google Cloud-Konto sowie ein ausgewähltes oder neu erstelltes Google Cloud-Projekt. Wenn Sie die API nutzen möchten, muss die Agent Platform API aktiviert sein und die Anfrage authentifiziert gesendet werden. Laut Dokumentation müssen Sie außerdem die Google Cloud CLI installieren und sich darüber authentifizieren, wenn Sie das REST-Beispiel in einer lokalen Entwicklungsumgebung verwenden. Für den Zugriff über die Konsole ist demnach keine zusätzliche Authentifizierungseinrichtung erforderlich.

Zu den für die Bild-zu-Video-Generierung dokumentierten Modellen gehören gemini-omni-1.1-flash-preview sowie verschiedene Modelle von Veo 3.0 und Veo 3.1. Die folgenden Schritte basieren auf dem Gemini Omni API-Beispiel, in dem Bildeingabe und Einstellungen ausdrücklich erläutert werden. In der API-Anfrage wird das Eingabebild über eine Cloud Storage-URI angegeben; als MIME-Typ dient im Beispiel image/png. Vergewissern Sie sich daher vor dem ersten Versuch, dass das gewünschte Bild im Projekt zugänglich ist und Sie in der Anfrage den richtigen Speicherort angeben.

Im API-Beispiel sind für die Dauer ganzzahlige Werte zwischen 3 und 10 Sekunden und für das Seitenverhältnis die Optionen 16:9 oder 9:16 aufgeführt. Wird keine Auflösung angegeben, ist 720p voreingestellt; für gemini-omni-1.1-flash-preview nennt die Dokumentation die Optionen 360p, 720p, 1080p und 4K. Wenn Sie ein anderes Modell verwenden, sollten Sie die unterstützten Einstellungen separat prüfen. Die Quellen enthalten keine Preisangaben.

Schritt für Schritt: einen Video-Prompt für eine Architekturvisualisierung erstellen

  1. Legen Sie ein Ziel fest. Entscheiden Sie, welches Merkmal des Bildes in Bewegung gezeigt werden soll: zum Beispiel wechselndes Tageslicht in einem Innenraum, eine langsame Kamerafahrt entlang einer Fassade oder leicht bewegte Blätter in einem Innenhof. Beschreiben Sie lieber eine zentrale Aktion, statt mehrere große Ereignisse im selben Prompt vorzugeben.

  2. Benennen Sie Motiv und Kontext. Der Prompt-Leitfaden beschreibt Motiv, Aktion und Szenenkontext als separate Bestandteile. Bei einer Architekturvisualisierung kann das Motiv ein Raum, eine Fassade, eine Treppe oder ein Innenhof sein. Beschreiben Sie den Kontext kurz anhand von Material, Tageszeit und Lichtstimmung. Die Aufforderung, neue architektonische Elemente hinzuzufügen, die im Bild nicht vorhanden sind, kann dem Ziel widersprechen, den Entwurf zu erhalten.

  3. Beschreiben Sie die Bewegung zurückhaltend. Geben Sie beim ersten Versuch eine kleine Bewegung vor, etwa langsam über die Wand wanderndes Licht oder sich leicht bewegende Vorhänge und Pflanzen. Der Prompt-Leitfaden hebt hervor, dass die Aktion beschreibt, was im Video geschieht. Schreiben Sie deshalb konkret, was sich wie bewegt, statt vage Formulierungen wie „cinematisch“ zu verwenden.

  4. Legen Sie die Kameraführung fest. Möglich sind etwa eine statische Aufnahme, ein langsamer Schwenk oder ein Dolly. Die Kamerabewegung beeinflusst die Wahrnehmung des Raums im Bild. Kombinieren Sie daher nicht mehrere Kamerabewegungen in einem Prompt. Google weist darauf hin, dass die Unterstützung einiger fortgeschrittener Kameraperspektiven nicht offiziell garantiert wird und die Zuverlässigkeit der Ergebnisse variieren kann.

Die folgenden Beispiele wurden für diesen Leitfaden zur architektonischen Nutzung erstellt und nicht unverändert aus der Quelle übernommen.

Prompt
A calm architectural interior visualization of a contemporary living room, soft morning daylight slowly moving across the pale stone floor, sheer curtains gently shifting in a light breeze, preserve the room layout and materials, static wide shot, subtle natural motion

In diesem Prompt ist die wichtigste Veränderung das über den Boden wandernde Tageslicht; die Bewegung der Vorhänge bleibt zweitrangig und dezent. Die statische Weitwinkelaufnahme konzentriert sich darauf, die gesamte Raumaufteilung zu zeigen.

Prompt
A contemporary timber house seen from the garden, leaves on nearby trees moving gently in the breeze, soft overcast daylight, preserve the façade design and proportions, slow truck right along the garden edge, restrained architectural visualization

In diesem Fassadenbeispiel bewegt sich die Kamera langsam nach rechts, während sich die Blätter leicht im Wind bewegen. Die Aufforderung, die Proportionen der Fassade beizubehalten, betont die Rolle des Bildes bei der Entwurfspräsentation. Das Ergebnis sollte dennoch unbedingt überprüft werden.

Prompt
A quiet courtyard in a contemporary residential project at golden hour, subtle movement in ornamental grasses, warm light changing gently on the paving, preserve the original landscape composition, static wide shot, realistic restrained motion

Der Prompt für den Innenhof beschreibt die begrenzte Bewegung in der Landschaft und die Veränderung des Lichts. Eine statische Kamera kann bei Präsentationen sinnvoll sein, in denen die Komposition stärker im Vordergrund stehen soll als die Bewegung.

  1. Senden Sie Bild und Einstellungen gemeinsam. Im API-Beispiel enthält die Anfrage neben dem Text-Prompt auch die Bildeingabe; die Aufgabe ist als image_to_video gekennzeichnet. Seitenverhältnis, Auflösung und Dauer lassen sich ebenfalls in die Anfrage aufnehmen. Für einen schnellen Test bietet sich 16:9 und eine kurze Dauer an. Das sind jedoch lediglich Beispielwerte und nicht automatisch die richtige Wahl für jeden Anwendungsfall.

  2. Warten Sie, bis die Verarbeitung abgeschlossen ist, und prüfen Sie das Ergebnis. Laut Dokumentation kann die Videogenerierung länger als eine Minute dauern. Bei einer abgeschlossenen synchronen Anfrage wird die Ausgabe direkt in der Antwort zurückgegeben. Bei asynchronen Anfragen, die im Hintergrund ausgeführt werden, wird das Ergebnis später über eine Interaktions-ID abgefragt. Asynchrone Anfragen werden laut Dokumentation höchstens 14 Tage gespeichert.

Häufige Fehler

Zu viele Bewegungen gleichzeitig vorgeben: Wenn Sie zugleich eine Lichtveränderung, Kamerabewegung, Personenbewegung und Wetterereignisse beschreiben, lässt sich das Ergebnis schwerer beurteilen. Erstellen Sie zunächst eine Version mit nur einer Bewegung und ergänzen Sie bei Bedarf in einem zweiten Versuch ein weiteres Element.

Die Kameraführung unklar beschreiben: Wählen Sie statt „Bewege die Kamera“ eine konkrete Bewegung wie eine statische Aufnahme, einen Schwenk oder einen Dolly. Fortgeschrittene Kameraperspektiven funktionieren möglicherweise nicht in jedem Fall gleich zuverlässig.

Dauer und Auflösung nicht prüfen: Im API-Beispiel liegt die Dauer zwischen 3 und 10 Sekunden. Prüfen Sie vor der Anfrage die vom Modell akzeptierten Auflösungen und Seitenverhältnisse. Laut Dokumentation beträgt die Standardauflösung 720p, wenn keine Auflösung angegeben wird.

Das Ergebnis wie ein Entwurfsdokument behandeln: Die Videogenerierung bringt Bewegung in ein Bild. Die Quellen garantieren jedoch weder architektonische Genauigkeit noch, dass Designelemente in jedem Frame unverändert bleiben. Betrachten Sie den generierten Clip daher als Entwurf für die visuelle Vermittlung und nicht als technische Zeichnung oder verbindliche Projektdokumentation.

Einsatz im Arbeitsablauf von Architektur und Visualisierung

Diese Methode kann von Architekturbüros, Innenarchitektinnen und Innenarchitekten sowie Visualisierungskünstlerinnen und -künstlern ausprobiert werden, die aus einer statischen Innenraum- oder Fassadenvisualisierung einen kurzen Präsentationsclip erstellen möchten. Eine bewegte Skizze kann bei Entwurfsbesprechungen helfen, Licht, Atmosphäre oder Raumgefühl zu vermitteln. Die verfügbaren Quellen sagen jedoch nicht zu, mit welcher Genauigkeit sich die Ergebnisse für professionelle Präsentationen eignen oder dass architektonische Details in jeder Szene erhalten bleiben. Vergleichen Sie das Ergebnis deshalb mit den Projektvisualisierungen und generieren Sie es bei Bedarf erneut.

Im Arbeitsablauf sind zwei praktische Aspekte besonders wichtig: die Einrichtung, etwa Cloud-Projekt und API-Zugriff, sowie die vom Modell unterstützten Einstellungen für Dauer, Auflösung und Seitenverhältnis. Die Quellen enthalten weder Angaben zu Preisen noch zu lokalen Hardwareanforderungen. Anstatt darüber zu spekulieren, sollten Sie vor der Generierung die aktuellen Nutzungsbedingungen und Projekteinstellungen prüfen. Das API-Beispiel, in dem das Bild über Cloud Storage übermittelt wird, zeigt außerdem, dass auch der Speicherort der Datei Teil des Ablaufs ist.

Nächste Schritte

Ändern Sie beim ersten Versuch ausschließlich die Bewegungsbeschreibung im Prompt und verwenden Sie dasselbe Bild sowie dieselben Einstellungen. So können Sie vergleichen, ob sich die Kamerabewegung oder die Lichtbeschreibung stärker auf das Ergebnis auswirkt. Testen Sie anschließend die passende Version mit anderen Einstellungen für Dauer oder Seitenverhältnis. Wenn Sie mit REST arbeiten, beachten Sie den Unterschied: Eine synchrone Anfrage liefert das Ergebnis unmittelbar zurück; bei einer asynchronen Anfrage wird das Ergebnis später über die Interaktions-ID abgefragt.

Quelle und Lizenz

Dieser Leitfaden wurde anhand der offiziellen Google Cloud-Anleitungen „Video generation prompt guide“ und „Generate videos from an image“ ins Türkische übertragen und angepasst. Beide Quellen stehen unter der Lizenz CC BY 4.0. Die architektonischen Beispiel-Prompts wurden eigens für diesen Beitrag erstellt.

Quellen

2 Quellen
C(
cloud.google.com (CC BY 4.0)cloud.google.com/vertex-ai/generative-ai/docs/video/video-gen-prompt-guide
Zusammenfassung
C(
cloud.google.com (CC BY 4.0)cloud.google.com/vertex-ai/generative-ai/docs/video/generate-videos-from-an-image
Zusammenfassung

Quelltexte werden nicht neu veröffentlicht; kurze Zitate sind gekennzeichnet, der Rest ist eigene Zusammenfassung und Einordnung.

Die Einschätzung von 3dsınıfı
3dEinschätzung der Redaktion

Der Ansatz, eine Architekturvisualisierung in einen kurzen Clip zu verwandeln, bietet insbesondere bei Konzeptpräsentationen eine praktische Möglichkeit, die Atmosphäre zu vermitteln. Die Quellen garantieren jedoch nicht, dass die Entwurfsentscheidungen in jedem Frame unverändert erhalten bleiben. Daher ist es sinnvoller, das Ergebnis als kontrollierten Entwurf zur visuellen Vermittlung und nicht als Entwurfsprüfung zu betrachten.

Büros und Studierende in der Türkei sollten vor dem Einstieg Voraussetzungen wie ein Google Cloud-Projekt, API-Zugriff und die Verfügbarkeit der Bilddatei in der Cloud berücksichtigen. Da die Quellen weder Preise noch lokale Hardwareanforderungen nennen, sollten keine Kostenannahmen getroffen werden. Prüfen Sie vor der Generierung die Nutzungsbedingungen.

Häufige Fragen

Kann man mit Gemini Omni aus einer Architekturvisualisierung ein Video erstellen?

Ja. Laut der Google Cloud-Dokumentation können Gemini Omni und Veo ein vorhandenes Bild als erstes Videobild verwenden.

Welche Videolängen unterstützt Gemini Omni bei der Bild-zu-Video-Generierung?

Im API-Beispiel ist die Dauer als ganzzahliger Wert zwischen 3 und 10 Sekunden angegeben.

Was ist für die Videogenerierung mit der Gemini Omni API erforderlich?

Erforderlich sind ein Google Cloud-Konto und -Projekt, eine aktivierte Agent Platform API sowie eine Authentifizierung. Im Beispiel wird das Bild über eine Cloud Storage-URI übermittelt.

Kommentare und Forum sind auf Türkisch.Mitdiskutieren
+

Verwandte Meldungen