Neueste Meldungen
TutorialsVeoGoogleVeo 3.1

Architekturvisualisierung mit Veo 3.1 in ein Video verwandeln: Schritt für Schritt

Dieser Leitfaden erklärt, wie Sie mit Veo 3.1 aus einer Architekturvisualisierung ein kurzes Video erstellen. Die Schritte – vom Vorbereiten des ersten Frames bis zur Wahl der API – basieren auf den von Google veröffentlichten Funktionen.

Zeitgenössisches Wohnzimmer mit Tageslicht und dem Eindruck einer sanften KamerabewegungKI-Bild
Symbolbild, mit KI erzeugt.Bild: 3dsınıfı / FCA AI

Kurz gesagt

  1. Mit Veo 3.1 lassen sich in der Gemini API 8-sekündige Videos in 720p, 1080p und 4K erstellen.
  2. Laut Gemini-API-Leitfaden sind die Videogenerierung mit erstem und letztem Frame, das Verlängern von Videos und die Verwendung von bis zu drei Referenzbildern möglich.
  3. In den Beispielen für Vertex AI wird das Bild über eine Cloud-Storage-URI als Eingabe bereitgestellt.
  4. Da sich API- und Modelloptionen je nach Plattform unterscheiden, sollte der Request-Body nicht unverändert in einen anderen Dienst kopiert werden.

Was Sie in diesem Leitfaden lernen

Dieser Leitfaden behandelt die wichtigsten Schritte, um eine Architekturvisualisierung mit Veo 3.1 in einen bewegten Präsentationsclip zu verwandeln. Ziel ist es, einen kurzen Videotest zu erstellen, indem Sie die Kamerabewegung und Umgebungsbewegungen in einer statischen Innenraum- oder Gebäudevisualisierung beschreiben. Die Beispiele eignen sich etwa für Projektpräsentationen, Konzeptdarstellungen oder den Vergleich von Alternativen im Visualisierungsprozess. Der erzeugte Clip ersetzt weder eine technische Zeichnung noch ein genehmigtes Projekt, sondern dient als Entwurf zur visuellen Vermittlung.

Der Gemini-API-Leitfaden beschreibt für Veo 3.1 die Generierung 8-sekündiger Videos, Auflösungsoptionen von 720p, 1080p und 4K sowie die native Audiogenerierung. Außerdem nennt er die Videogenerierung mit erstem und letztem Frame, das Verlängern eines bereits erzeugten Videos und die Steuerung mithilfe von bis zu drei Referenzbildern. Diese Angaben stammen aus der Gemini-API-Dokumentation; es sollte nicht davon ausgegangen werden, dass alle Optionen in jedem Produkt gleich verfügbar sind.

Voraussetzungen: Plattform und Zugriff

Es gilt, zwei unterschiedliche API-Wege auseinanderzuhalten:

  • Gemini API: Das Veo-3.1-Beispiel in der Dokumentation verwendet die generateContent API. Als Modellname wird in den Beispielen veo-3.1-generate-preview angegeben. Für API-Anfragen wird ein Gemini-API-Schlüssel benötigt.

  • Vertex AI: Erforderlich sind ein Google-Cloud-Projekt, die Aktivierung der Agent Platform API und eine geeignete Authentifizierung. Das dokumentierte Beispiel für die Bild-zu-Video-Generierung verwendet das Modell gemini-omni-1.1-flash-preview sowie eine Bild-URI aus Cloud Storage; auf derselben Seite sind auch die Modell-IDs von Veo 3.1 aufgeführt.

Diese Modellnamen und Request-Strukturen sind nicht austauschbar. Entscheiden Sie zuerst, welche API Sie verwenden möchten, und folgen Sie anschließend der aktuellen Dokumentation der jeweiligen Plattform – einschließlich Modell-ID und Beispiel-Request. Bereiten Sie für Vertex AI ein Bild vor, auf das über Cloud Storage zugegriffen werden kann. Laut Dokumentation ist für den Zugriff auf Google-Cloud-Dienste über die Konsole keine zusätzliche Authentifizierung einzurichten; für REST-Beispiele können die Anmeldedaten der gcloud CLI verwendet werden.

Schritt für Schritt: von der Architekturvisualisierung zum Clip

  1. Wählen Sie ein geeignetes Ausgangsbild für die Bewegung. Beginnen Sie mit einem Bild aus einer einzigen Hauptperspektive, bei dem klar ist, welcher Bereich im Fokus stehen soll. In einem Innenraum-Render können zum Beispiel Sitzbereich, Fenster und Tageslicht gemeinsam im Bild zu sehen sein. Legen Sie fest, worauf die Betrachtenden im Clip schauen sollen, statt alles im Bild gleichzeitig in Bewegung zu versetzen.

  2. Beschreiben Sie die Kamerabewegung als einzelne Aktion. Wählen Sie eine eindeutige Richtung, etwa: „Die Kamera bewegt sich langsam in den Raum hinein.“ Beschreiben Sie außerdem, was sich im Raum nicht verändern soll: etwa, dass Form und Position von Wänden, Möbeln und Öffnungen erhalten bleiben und sich nur der Vorhang leicht bewegt. Das ist eine Methode, dem Modell zu vermitteln, welche Elemente im Video unverändert bleiben sollen; ein bestimmtes Ergebnis ist damit nicht garantiert.

  3. Verwenden Sie für den ersten Versuch einen kurzen, fokussierten Prompt. Das folgende Beispiel ist ein neu formulierter Architektur-Prompt:

Prompt
A calm architectural visualization of a contemporary living room, based on the input image. The camera slowly moves forward toward the seating area. Preserve the room layout, wall openings, furniture positions, materials, and proportions. Soft daylight shifts gently across the floor; sheer curtains move slightly in a natural breeze. No people, no new objects, no sudden camera movement. Quiet, realistic atmosphere.

In dieser Beschreibung werden Kamerarichtung, beizubehaltende Raumelemente und erlaubte kleine Bewegungen einzeln aufgeführt. Wenn sich Geometrie oder Komposition im ersten Ergebnis unerwünscht verändern, vereinfachen Sie den Prompt und versuchen Sie es mit weniger Bewegung erneut.

  1. Übermitteln Sie die Bildeingabe und Videooptionen passend zur API. Im Vertex-AI-Beispiel wird das Bild mit Cloud-Storage-URI und MIME-Typ in die Anfrage eingebunden; für die Videoausgabe gibt es Felder für Seitenverhältnis, Auflösung und Dauer. Im Gemini-Omni-Beispiel ist die Dauer als ganzzahliger Wert zwischen 3 und 10 mit der Einheit Sekunden definiert. Verwechseln Sie diese Einstellungen nicht mit den Veo-3.1-Einstellungen der Gemini API: Laut Gemini-API-Leitfaden erzeugt Veo 3.1 Videos mit einer Dauer von 8 Sekunden.

  2. Erzeugen Sie eine neue Version, indem Sie nur eine Variable ändern. Ändern Sie nach dem ersten Ergebnis nicht gleichzeitig Kamera, Beleuchtung und Bewegung in der Szene. Aktualisieren Sie jeweils nur ein Element. Wenn Sie die Kamerabewegung in einem zweiten Versuch reduzieren oder in einem anderen die Lichtveränderung weglassen, lässt sich leichter erkennen, welche Beschreibung das Bild besser steuert.

  3. Nutzen Sie bei Bedarf die Funktionen für Übergänge zwischen Frames oder Referenzen. Der Gemini-API-Leitfaden führt die Generierung mit erstem und letztem Frame sowie die Verwendung von bis zu drei Referenzbildern als unterstützte Funktionen auf. Diese Optionen können für Workflows nützlich sein, bei denen ein Start- und Endbild oder visuelle Referenzen eingesetzt werden sollen. Prüfen Sie jedoch in der aktuellen Dokumentation, ob diese Funktionen mit dem gewählten Modell und der gewählten API verfügbar sind.

Häufige Fehler

  • Beispiele verschiedener APIs kombinieren: Der interactions-Request auf der Vertex-AI-Seite und das Veo-3.1-Beispiel der Gemini API verwenden nicht dasselbe Request-Schema. Stimmen Sie Modell-ID, Authentifizierung und Parameter auf die gewählte Plattform ab.

  • Jedes Element im Bild in Bewegung versetzen: Nennen Sie ausdrücklich Merkmale, die erhalten bleiben sollen, etwa Raumaufteilung und Möbelpositionen. Die bewegten Elemente im Prompt zu begrenzen, ist ein kontrollierterer Versuch, die visuelle Konsistenz zu wahren.

  • Daueroptionen auf das falsche Modell übertragen: Das Gemini-Omni-Beispiel in Vertex AI nennt einen Bereich von 3 bis 10 Sekunden, während der Gemini-API-Leitfaden Veo 3.1 als Modell für 8-sekündige Videos beschreibt. Übertragen Sie Parameter einer API nicht auf eine andere.

  • Die erste Generierung wie eine Visualisierung des genehmigten Projekts behandeln: Das erzeugte Video interpretiert das Ausgangsbild als bewegte Szene. Prüfen Sie vor der Verwendung in einer Präsentation, ob Entwurfsentscheidungen und räumliche Details erhalten geblieben sind.

  • Davon ausgehen, dass jede Funktion überall verfügbar ist: Bestimmte Veo-3.1-Funktionen können in der Gemini API, Vertex AI und verschiedenen Produkten unterschiedlich angeboten werden. Prüfen Sie vor dem Senden einer Anfrage die Dokumentation der gewählten Plattform.

Einordnung in den Architektur- und Visualisierungsworkflow

Die Methode kann sich besonders für erste Versuche von Architektur- und Innenarchitekturbüros eignen, die ein fertiges Render mit einer kurzen Kamerabewegung präsentieren möchten. Auch Studierende können anhand desselben Bildes verschiedene Bewegungsbeschreibungen vergleichen. Zu beachten sind jedoch der erforderliche API-Zugriff sowie die Einrichtung von Konto und Projekt. Da die Quellen weder aktuelle Nutzungspreise noch für alle Nutzer gültige Zugangsbedingungen nennen, sollten Kosten und Verfügbarkeit vorab geprüft werden. Auch zu den Hardwareanforderungen machen die Quellen keine Angaben zu einer bestimmten lokalen GPU; der beschriebene Workflow basiert auf Cloud-APIs.

Nächste Schritte

Beginnen Sie mit einem einzelnen Render und einer einzelnen Kamerabewegung. Vergleichen Sie anschließend die Ergebnisse, indem Sie in derselben Szene jeweils nur ein Element ändern. Wenn Sie mehrere Frames oder Referenzen verwenden möchten, prüfen Sie, ob die ausgewählte API und das Modell dies unterstützen. Folgen Sie bei der Arbeit mit Vertex AI den Schritten für Projekt, API-Aktivierung und Cloud Storage; bei der Gemini API verwenden Sie das zu Veo 3.1 gehörende Beispiel für einen Request. Vergleichen Sie abschließend den erzeugten Clip mit der Projektvisualisierung und prüfen Sie mögliche Abweichungen bei Form, Öffnungen und Möbelanordnung.

Quellen und Lizenz

Dieser Leitfaden wurde auf Grundlage des Google-Cloud-Leitfadens zur Bild-zu-Video-Generierung und der Veo-3.1-Dokumentation von Google AI for Developers ins Türkische übertragen und angepasst. Beide Quellen stehen unter der CC BY 4.0-Lizenz. Die Erläuterungen auf der Veo-Produktseite wurden ebenfalls zur Einordnung der Funktionen herangezogen.

Quellen

3 Quellen
C(
cloud.google.com (CC BY 4.0)cloud.google.com/vertex-ai/generative-ai/docs/video/generate-videos-from-an-image
Zusammenfassung
A(
ai.google.dev (CC BY 4.0)ai.google.dev/gemini-api/docs/veo
Zusammenfassung
D
deepmind.googledeepmind.google/models/veo
Zusammenfassung

Quelltexte werden nicht neu veröffentlicht; kurze Zitate sind gekennzeichnet, der Rest ist eigene Zusammenfassung und Einordnung.

Die Einschätzung von 3dsınıfı
3dEinschätzung der Redaktion

Für Architekturbüros und Visualisierungsteams liegt der praktische Nutzen dieses Ansatzes darin, aus einem bestehenden Render einen kurzen Entwurf für eine bewegte Darstellung erstellen zu können. Gerade bei Konzeptpräsentationen kann eine Kamerabewegung eine statische Ansicht verständlicher machen. Das Ergebnis sollte jedoch nicht als verifizierte Wiedergabe der Projektgeometrie behandelt werden.

Teams in der Türkei sollten vor dem Test auch den API-Zugriff, die Nutzungskosten und den Funktionsumfang der gewählten Plattform prüfen; die Quellen enthalten keine Preisangaben. Da der Workflow über Cloud-APIs beschrieben wird, ist keine bestimmte lokale Grafikkarte erforderlich. Am sichersten ist es, mit einem einzelnen Frame und einer begrenzten Bewegung zu beginnen und das Ergebnis sorgfältig zu prüfen.

Häufige Fragen

Wie lang sind mit Veo 3.1 erzeugte Videos und welche Auflösungen sind verfügbar?

Die Gemini-API-Dokumentation nennt für Veo 3.1 Videos mit einer Dauer von 8 Sekunden sowie die Auflösungen 720p, 1080p und 4K.

Kann Veo 3.1 aus Architekturvisualisierungen Videos erstellen?

Der Gemini-API-Leitfaden nennt die Steuerung anhand eines Bildes, die Generierung mit erstem und letztem Frame sowie die Verwendung von bis zu drei Referenzbildern. Welche Optionen verfügbar sind, sollte für die gewählte API und das jeweilige Modell geprüft werden.

Ist für die Verwendung von Veo 3.1 ein Google-Cloud-Projekt erforderlich?

Das Vertex-AI-Beispiel setzt ein Google-Cloud-Projekt und die Aktivierung der Agent Platform API voraus. Die Gemini API ist ein separater Zugangsweg.

Kommentare und Forum sind auf Türkisch.Mitdiskutieren
+

Verwandte Meldungen