Neueste Meldungen
Architektur-Render in ein Video verwandeln: Schritt-für-Schritt-Anleitung für Gemini OmniArchitektur-Rendering mit Unreal Engine Path Tracer: Schritt-für-Schritt-AnleitungArchitekturbilder mit Nano Banana erstellen: Prompt- und BearbeitungsleitfadenMechaPaint 2.0 ergänzt PBR-Malwerkzeuge und Geometrie aus FotosVeras 5.2 ist da: Mit GPT-6 Astra vom Referenzbild zum editierbaren 3D-ModellBlender-Unterstützung für Android: Version 5.3 auf einem Wacom-Tablet gezeigtDesign Museum Gent erneuert: Erweiterungsbau aus weißen RecyclingziegelnCinema 4D 2026.4 erhält integrierten MCP-Server und WerkzeugberechtigungenGemini 4 Argon angekündigt: 1 Million Output-Token und gestaffelter ZugangChaos Vantage 3.4 ist da: OpenPBR, Chaos Scans und DLSS 4.5
TutorialsVeoGoogleGemini Omni 1.1 Flash Preview

Architektur-Render in ein Video verwandeln: Schritt-für-Schritt-Anleitung für Gemini Omni

Die von Google veröffentlichten Anleitungen zu Gemini Omni und Veo erklären, wie ein Bild als erstes Videobild genutzt und der Prompt mit Angaben zu Szene, Bewegung und Kamera formuliert wird. Wir zeigen einen praktischen Workflow für Architekturvisualisierungen.

Ruhiger, moderner Innenraum mit leicht bewegten Vorhängen im TageslichtKI-Bild
Symbolbild, mit KI erzeugt.Bild: 3dsınıfı / FCA AI

Kurz gesagt

  1. Gemini Omni und einige Veo-Modelle können ein vorhandenes Bild als erstes Videobild verwenden.
  2. Für Gemini Omni 1.1 Flash Preview lässt sich eine Videolänge zwischen 3 und 10 Sekunden festlegen.
  3. Bei API-Anfragen kann das Seitenverhältnis auf 16:9 oder 9:16 gesetzt werden; ohne Angabe der Auflösung gilt standardmäßig 720p.
  4. Der Prompt kann mit Beschreibungen von Motiv, Bewegung, Szene und Kamera strukturiert werden.

Was erfahren Sie in diesem Leitfaden?

Sie erfahren, wie Sie ein Innenraum-Rendering oder eine Architekturvisualisierung als Startbild für ein kurzes Video verwenden und anschließend per Text beschreiben, was sich im Video verändern soll. Laut der Google-Dokumentation unterstützen Gemini Omni und Veo die Videogenerierung aus einem vorhandenen Bild. Der hier vorgestellte Workflow richtet sich an Architektinnen und Architekten, Innenarchitektinnen und Innenarchitekten sowie Visualisierungskünstler, die ein Bild direkt animieren möchten.

Wichtig ist die grundlegende Unterscheidung: Statt nur einen Videoprompt zu schreiben, geben Sie ein vorhandenes Bild als Startbild vor und beschreiben die Bewegung separat. Der Prompt kann erklären, was zu sehen ist, was geschieht, wo und wann die Szene spielt und wie sich die Kamera verhält. Sie müssen nicht in jedem Prompt alle Kategorien verwenden. Wenn Sie die einzelnen Bestandteile jedoch getrennt betrachten, können Sie klarer formulieren, was sich verändern soll.

Voraussetzungen und Modellauswahl

Sie müssen sich mit einem Google Cloud-Konto anmelden und ein Google Cloud-Projekt auswählen oder erstellen. Wenn Sie über die API arbeiten, muss außerdem die Agent Platform API aktiviert und die Authentifizierung für die Umgebung eingerichtet werden. Laut Dokumentation ist bei der Verwendung der Console keine zusätzliche Authentifizierungseinrichtung erforderlich; für REST-Beispiele können die Anmeldedaten der Google Cloud CLI verwendet werden.

Die Bild-zu-Video-Generierung ist über Gemini Enterprise Agent Platform Media Studio oder die API zur Videogenerierung verfügbar. In diesem Leitfaden verwenden wir gemini-omni-1.1-flash-preview, dessen Modellname ausdrücklich genannt wird. Zu den weiteren Optionen, die laut Dokumentation diese Funktion unterstützen, gehören Veo 3.1 Lite, Veo 3.1, Veo 3.1 Fast, Veo 3.0 und Veo 3.0 Fast. Für nicht näher beschriebene Einzelheiten zum Modellzugriff, zu Kontobedingungen und Nutzungskosten sollten Sie die aktuellen Produktinformationen in Google Cloud prüfen.

Im API-Beispiel wird das Eingabebild über eine Cloud-Storage-Adresse angegeben und der MIME-Typ als image/png ausgewiesen. Für Gemini Omni 1.1 Flash Preview stehen die Auflösungen 360p, 720p, 1080p und 4K sowie die Seitenverhältnisse 16:9 und 9:16 zur Auswahl. Wird keine Auflösung angegeben, gilt standardmäßig 720p. Die Videodauer kann in ganzen Sekunden zwischen 3 und 10 Sekunden festgelegt werden. Dies sind API-Parameter aus der Dokumentation; gehen Sie nicht davon aus, dass dieselben Optionen bei anderen Modellen oder in anderen Oberflächen verfügbar sind.

Schritt für Schritt: Architekturvisualisierung in ein Video verwandeln

  1. Startbild auswählen. Wählen Sie die gewünschte Architekturvisualisierung aus. Das kann zum Beispiel eine Innenraumperspektive oder eine Außenansicht eines Gebäudes sein. Das Bild dient als erstes Bild des generierten Videos. Notieren Sie vorab, welche Elemente sich bewegen sollen: etwa Bäume, Vorhänge, eine Wasseroberfläche oder die Kamera.

  2. Produktionsmethode wählen. Arbeiten Sie über eine Benutzeroberfläche, verwenden Sie Media Studio. Für einen programmgesteuerten Workflow nutzen Sie die API. Bei der API-Variante müssen Sie ein Projekt auswählen und die Agent Platform API aktivieren. Für die Nutzung von REST muss auch die Authentifizierung eingerichtet sein. Im API-Beispiel zur Bild-zu-Video-Generierung wird die Anfrage mit der Aufgabe image_to_video gesendet.

  3. Den Prompt in Bestandteile gliedern. Der Prompt-Leitfaden von Google behandelt Elemente wie Motiv, Handlung, Szene oder Kontext, Kamerawinkel und Kamerabewegung. In einer Architekturszene kann das Motiv der Raum oder das Gebäude selbst sein; die Handlung beschreibt die Bewegung, die im Bild stattfinden soll. Ergänzen Sie anschließend Szenendetails wie Tageslicht, Wetter und Umgebung sowie Kameraangaben wie eine statische Einstellung oder eine langsame Kamerafahrt.

  4. Das folgende Beispiel als Ausgangsprompt verwenden. Testen Sie jeden Prompt einzeln und prüfen Sie, welche Beschreibung am besten mit der Visualisierung harmoniert.

Prompt
A calm architectural interior, sheer curtains moving gently in a light breeze, soft morning daylight shifting across the timber floor, wide shot, static camera, preserve the original room layout and material palette

In diesem Beispiel ist der Raum das Motiv, die Bewegung der Vorhänge die Handlung, das Morgenlicht die Szenenbeschreibung und die weite Einstellung mit statischer Kamera die gewünschte Aufnahme. Der Prompt zielt darauf ab, aus einer statischen Architekturpräsentation eine kleine, kontrollierte Bewegung zu erzeugen.

  1. Bewegungen für Außenaufnahmen begrenzen. Wenn Sie statt des Gebäudes die Bewegung in der Umgebung beschreiben, wird klarer, welcher Teil der Szene animiert werden soll.

Prompt
A contemporary house in a landscaped garden, leaves and tall grasses moving gently in the wind, late afternoon light, a slow dolly in toward the entrance, wide establishing shot

Hier werden die Bewegung der Pflanzen, das Licht und die Kamerafahrt auf das Gebäude zu separat beschrieben. „Dolly in“ bezeichnet eine physische Bewegung der Kamera auf das Motiv zu und sollte nicht mit einem Zoom verwechselt werden, bei dem lediglich der Bildausschnitt vergrößert wird.

  1. API-Einstellungen auf das gewünschte Bild abstimmen. Die Anfrage enthält die Modellkennung, den Textprompt und die Bildeingabe; als Ausgabetyp wird Video festgelegt und die Aufgabe image_to_video ausgewählt. Für eine horizontale Präsentation können Sie das in der Dokumentation angegebene Seitenverhältnis 16:9 wählen, für eine vertikale Veröffentlichung 9:16. Legen Sie die Dauer auf 3–10 Sekunden fest. Wenn Sie keine Ausgabeauflösung angeben, gilt im API-Beispiel standardmäßig 720p.

  2. Generierung verfolgen und Ergebnis prüfen. Laut Google kann die Videogenerierung länger als eine Minute dauern. Bei einer synchronen Anfrage kann das Video nach Fertigstellung heruntergeladen werden. Bei einer asynchronen Anfrage wird der Hintergrundparameter verwendet; das Ergebnis lässt sich später über die Interaktions-ID abfragen. Asynchrone Anfragen werden laut Dokumentation bis zu 14 Tage aufbewahrt. Prüfen Sie vor der Verwendung in einer Präsentation, ob Architekturformen, Materialien und Bewegungen zum Ausgangsbild passen.

Häufige Fehler

Den Prompt in einen einzigen vagen Satz pressen: Eine allgemeine Beschreibung wie „Erstelle ein schönes Architekturvideo“ macht keine konkreten Angaben zu Motiv, Bewegung, Umgebung und Kamera. Schreiben Sie stattdessen klar, welches Element sich bewegen soll und ob die Kamera statisch bleibt oder sich bewegt.

Widersprüchliche Kameraangaben verwenden: Die Kamera soll in derselben Eingabe statisch bleiben und sich zugleich dem Gebäude nähern – das kann widersprüchliche Ergebnisse erzeugen. Entscheiden Sie sich zunächst für ein Kameraverhalten und testen Sie nach Sichtung des Ergebnisses eine weitere Variante.

Dauer und Seitenverhältnis vergessen: In der API lässt sich eine Dauer zwischen 3 und 10 Sekunden festlegen. Wird kein Seitenverhältnis angegeben, kann es der Dokumentation zufolge aus dem Prompt abgeleitet werden. Wenn Sie jedoch ein horizontales oder vertikales Ergebnis anstreben, ermöglicht eine ausdrückliche Angabe besser kontrollierte Versuche.

Das Ergebnis mit dem Ausgangsbild gleichsetzen: Die Dokumentation beschreibt, wie ein Bild als erstes Videobild verwendet und die Generierung mit einem Prompt gesteuert wird. Sie garantiert nicht, dass Geometrie oder Materialien der Architektur unter allen Umständen exakt erhalten bleiben. Prüfen Sie das generierte Video daher vor einer wichtigen Präsentation oder der Abgabe an Kundinnen und Kunden sorgfältig.

Nächste Schritte: Einsatz im Architektur-Workflow

Dieser Ansatz kann für Architektur- und Innenarchitekturbüros interessant sein, die einer statischen Visualisierung kurze Umgebungsbewegungen hinzufügen und so Präsentationsvarianten erstellen möchten. Verschiedene Prompts lassen sich insbesondere ausprobieren, wenn es um Kamerabewegungen, Lichtveränderungen oder die Bewegung von Elementen wie Pflanzen und Vorhängen geht. Die Projektgeometrie im Ausgangsbild und im Video muss jedoch überprüft werden. Betrachten Sie das Ergebnis nicht als technische Zeichnung, Maßangabe oder verbindliches Designdokument.

Studierende und Visualisierungskünstler können auf Grundlage desselben Startbilds verschiedene Bewegungs- und Kamerabeschreibungen testen. Büros sollten vorab prüfen, über welches Konto und welchen Dienst Projektvisualisierungen verarbeitet werden, welche Zugriffsbedingungen gelten und welche Nutzungskosten anfallen könnten. Da die Quellen keine Preise nennen, müssen die aktuellen Produktbedingungen für die Budgetplanung gesondert geprüft werden. Bei der API-Variante kommen außerdem die Auswahl des Projekts sowie die Aktivierung der API und die Authentifizierung hinzu.

Quellen und Lizenz

Dieser Leitfaden wurde auf Grundlage der Informationen in den Google Cloud-Seiten „Video generation prompt guide“ und „Generate videos from an image“ ins Türkische übertragen und angepasst. Beide Quellen stehen unter der Lizenz CC BY 4.0.

Quellen

2 Quellen
C(
cloud.google.com (CC BY 4.0)cloud.google.com/vertex-ai/generative-ai/docs/video/video-gen-prompt-guide
Zusammenfassung
C(
cloud.google.com (CC BY 4.0)cloud.google.com/vertex-ai/generative-ai/docs/video/generate-videos-from-an-image
Zusammenfassung

Quelltexte werden nicht neu veröffentlicht; kurze Zitate sind gekennzeichnet, der Rest ist eigene Zusammenfassung und Einordnung.

Die Einschätzung von 3dsınıfı
3dEinschätzung der Redaktion

Für Architektur- und Innenarchitekturbüros liegt der praktische Nutzen dieses Ansatzes darin, kurze Präsentationsvarianten aus einem bestehenden Rendering zu erstellen. Bewegungen der Kamera und der Umgebung per Prompt zu beschreiben, kann für Teams hilfreich sein, die ein statisches Bild in einer anderen Erzählform ausprobieren möchten. Es sollte jedoch nicht davon ausgegangen werden, dass das Ergebnis Geometrie und Materialentscheidungen des Entwurfs exakt beibehält; vor der Abgabe ist eine Prüfung unerlässlich.

Büros und Studierende in der Türkei sollten vor dem Ausprobieren den Zugang zu Google Cloud, die Schritte zur API-Einrichtung und die aktuellen Nutzungskosten klären. Die Quellen enthalten keine Preisangaben. Außerdem bedeutet die verfügbare 4K-Option nicht, dass sie in jedem Workflow erforderlich ist. Ausgabeauflösung und Dauer sollten passend zum Verwendungszweck gewählt werden.

Häufige Fragen

Lässt sich mit Gemini Omni aus einem Bild ein Video erstellen?

Ja. Laut der Google-Dokumentation unterstützt Gemini Omni die Videogenerierung, bei der ein vorhandenes Bild als erstes Videobild verwendet wird. Die Funktion ist über Media Studio oder die API verfügbar.

Wie lang kann ein Video mit Gemini Omni 1.1 Flash Preview sein?

Laut API-Dokumentation kann die Dauer in ganzen Sekunden zwischen 3 und 10 Sekunden festgelegt werden.

Welche Auflösungen stehen für die Bild-zu-Video-Generierung zur Verfügung?

Für Gemini Omni 1.1 Flash Preview sind 360p, 720p, 1080p und 4K aufgeführt. Ohne Angabe der Auflösung gilt standardmäßig 720p.

Kommentare und Forum sind auf Türkisch.Mitdiskutieren
+

Verwandte Meldungen