Últimas noticias
Guía de render interior con Blender Cycles: ruido y tiempoAnálisis de imágenes arquitectónicas con Gemini API: 5 prompts y flujo de trabajoCrear una tabla de cómputo de materiales en Revit: guía paso a pasoGeneración de imágenes arquitectónicas con Nano Banana 2.1: guía paso a paso de promptsDistribuir plantas y objetos sobre superficies con Blender Geometry NodesCrear videos arquitectónicos con Gemini: cómo elegir modelo y promptCómo colocar texturas en Blender con UV Project y UV WarpAjustes de malla y ShrinkWrap en Rhino 8: guía para crear mallas limpiasGeneración de imágenes arquitectónicas con Nano Banana 2.1: guía de prompts y ediciónBake de texturas en Blender Cycles: guía paso a paso desde UV hasta mapas de luz
TutorialesGoogleGemini Omni FlashVeo 3.1

Crear videos arquitectónicos con Gemini: cómo elegir modelo y prompt

En la API de Gemini, Gemini Omni Flash y Veo 3.1 ofrecen flujos de trabajo distintos para crear videos arquitectónicos. Esta guía te ayuda a elegir el modelo y definir las escenas para perfeccionar los prompts paso a paso.

Patio contemporáneo con pavimento de piedra y pantalla de madera bajo la luz de la mañanaImagen IA
Imagen ilustrativa generada con IA.Imagen: 3dsınıfı / FCA AI

En resumen

  1. Gemini Omni Flash destaca por crear videos cortos a partir de texto e imágenes y permitir la edición en varios turnos.
  2. Veo 3.1 admite audio nativo, extensión de video, generación orientada a fotogramas específicos y guía mediante imágenes.
  3. Las instrucciones claras y concretas, junto con las restricciones de salida, ayudan al modelo a acercarse a la escena deseada.
  4. La guía de Google recomienda perfeccionar los prompts de forma iterativa, según los resultados observados tras el primer intento.

¿Qué aprenderás en esta guía?

Para convertir una idea arquitectónica en una narrativa visual en movimiento, primero hay que elegir el flujo de generación adecuado y luego describir la escena con claridad. En la documentación de la API de Gemini destacan dos opciones para generar videos: Gemini Omni Flash y Veo 3.1. En esta guía veremos para qué tipo de trabajo conviene cada modelo, cómo redactar instrucciones para una escena arquitectónica y cómo mejorar el primer resultado.

Gemini Omni Flash se centra en crear videos cortos a partir de texto e imágenes y en editarlos mediante una conversación de varios turnos. Veo 3.1, por su parte, ofrece funciones como generación de audio nativo, extensión de video, generación orientada a fotogramas específicos y guía mediante imágenes. Estas funciones no significan que ambos modelos deban utilizarse del mismo modo en todos los proyectos: la elección debe basarse en el flujo de trabajo necesario.

Requisitos: software, versión y cuenta

Esta guía trata sobre la generación de video mediante la API de Gemini. La documentación de Google presenta Gemini Omni Flash y Veo 3.1 para flujos de trabajo de video. Las fuentes no especifican el tipo de cuenta necesario, los precios, los requisitos de hardware local ni versiones adicionales de software. Por ello, antes de empezar, comprueba el acceso a la API y las condiciones vigentes en la documentación del servicio correspondiente; no des por sentado ningún requisito de cuenta o hardware que no se haya indicado aquí.

Para empezar, divide la escena que quieres generar en varios elementos concretos: tipo de espacio, materiales visibles, iluminación, elementos importantes en el encuadre y propósito del video. Prepara también una imagen de referencia, si vas a utilizarla. Gemini Omni Flash admite la generación de video a partir de texto e imágenes; para Veo 3.1, la documentación explica la guía mediante imágenes a través de la API generateContent.

Cómo crear paso a paso un prompt para video arquitectónico

1. Define primero qué necesitas del modelo

Si quieres crear un video corto a partir de texto o de una imagen y editar el resultado en varias rondas, considera Gemini Omni Flash. Además de generar videos, este modelo permite la edición conversacional en varios turnos. Si necesitas funciones como extender un video, centrarte en fotogramas específicos o generar audio nativo, consulta las funciones documentadas de Veo 3.1. La elección del modelo debe depender más de la función necesaria en el flujo de trabajo que de la naturaleza arquitectónica de la escena.

2. Describe la escena con claridad y acota el resultado

La guía de diseño de prompts de Google recomienda dar instrucciones claras y concretas, además de incluir restricciones sobre el formato y los límites de la respuesta. En visualización arquitectónica, en lugar de pedir simplemente «crea un video de una casa moderna», describe qué elementos deben aparecer y qué cambios no deseas. En el primer intento, selecciona los objetivos visuales más importantes en lugar de intentar resolver todos los detalles.

El siguiente ejemplo está preparado para pedirle a Gemini Omni Flash un video arquitectónico corto a partir de texto:

Prompt
Create a short architectural video of a quiet contemporary courtyard. Show pale stone paving, a timber screen, and a single olive tree. Keep the building geometry and material palette consistent throughout. Use soft morning light. Avoid adding people, signage, or extra structures.

El prompt en inglés enumera con claridad los elementos principales del patio, las condiciones de iluminación y la coherencia visual que se debe mantener. La indicación «Short» se ajusta al uso documentado de Gemini Omni Flash para generar videos cortos. Evalúa el primer resultado y, en el siguiente turno, da una instrucción centrada únicamente en los elementos que falten o hayan cambiado.

3. Usa una imagen de referencia para orientar la generación

Si tienes una imagen de un interior o una fachada, puedes probar a usar la imagen junto con texto. Gemini Omni Flash admite la generación de videos cortos a partir de texto e imágenes; Veo 3.1 también permite la guía mediante imágenes. Explicar en el prompt qué características de la referencia son importantes hará que la solicitud sea más clara. No des por sentado que todos los detalles de la imagen se conservarán exactamente: comprueba el resultado.

Prompt
Use the supplied interior image as visual direction for a short video. Preserve the room's visible layout, warm wood surfaces, and large window. Show a calm transition in the daylight across the space. Do not introduce new furniture, change the room layout, or add text.

Este ejemplo explica por escrito qué características de la imagen de referencia se deben seguir. Si cambian la distribución o el lenguaje de los materiales en el resultado, vuelve a intentarlo en el siguiente turno describiendo de forma concreta qué ha cambiado.

4. Mejora el primer resultado con edición en varios turnos

Gemini Omni Flash admite la edición conversacional de videos en varios turnos; la documentación ofrece ejemplos de sustitución de elementos y cambios de perspectiva. Por tanto, en lugar de volver a describir todo desde cero, puedes acotar la solicitud de edición a un aspecto concreto. El siguiente texto puede usarse como instrucción de seguimiento para el resultado anterior:

Prompt
Revise the previous video by changing the viewing perspective to show more of the timber screen. Keep the courtyard layout, stone paving, olive tree, and morning light consistent. Do not add new objects.

Este prompt de seguimiento especifica el cambio de perspectiva deseado y recuerda qué elementos de la escena deben conservarse. En lugar de pedir varios cambios importantes a la vez durante la edición, evalúa el resultado y señala la corrección prioritaria en un turno aparte.

5. Valora si necesitas fotogramas, extensión o audio en Veo 3.1

Si eliges Veo 3.1, adapta la solicitud a las funciones que ofrece la documentación. El modelo admite la extensión de video, la generación orientada a fotogramas específicos, la guía mediante imágenes y el audio nativo. El siguiente prompt ofrece un ejemplo de escena arquitectónica con sonido:

Prompt
Generate an architectural video of a small gallery courtyard with natural ambient sound. Keep the stone surfaces and surrounding walls visually consistent. Let the sound remain subtle and suited to a quiet outdoor space; do not include speech or music.

Este prompt es un ejemplo que utiliza la compatibilidad de Veo 3.1 con el audio nativo; no garantiza que se genere un sonido específico. Si necesitas generación orientada a fotogramas específicos o extender un video, formula la solicitud según esa función y sigue la documentación del flujo de API utilizado. No se deben presuponer parámetros ni pasos de menú que no aparezcan en las fuentes.

Errores frecuentes

Dar instrucciones vagas: Una solicitud general como «un video impactante de un interior» no explica qué elementos son importantes. Especifica el tipo de espacio, los materiales que deben conservarse y el cambio visual deseado.

Cargar demasiados objetivos en un solo prompt: Pedir cambios importantes de escena, materiales, perspectiva y atmósfera al mismo tiempo puede dificultar la evaluación del resultado. Primero establece la escena principal y, después, corrige en otro turno las carencias que hayas observado.

Considerar definitivo el primer resultado: La guía de Google plantea el diseño de prompts como un proceso iterativo. Revisa el resultado, conserva lo que funciona y prueba instrucciones más concretas para los aspectos problemáticos.

Suponer que ambos modelos tienen las mismas funciones: Gemini Omni Flash y Veo 3.1 destacan por funciones diferentes. Por ejemplo, la edición en varios turnos figura entre las capacidades de Omni Flash, mientras que la documentación de Veo 3.1 menciona el audio nativo y la extensión de video. Identifica la función que necesitas antes de elegir un modelo.

Suponer que la imagen de referencia fija todos los detalles: La guía mediante imágenes ayuda al modelo a interpretar la escena, pero las fuentes no garantizan que todos los detalles se conserven sin cambios. Compara el resultado con la referencia y especifica las correcciones necesarias.

Próximos pasos

Prepara primero un prompt básico, breve y claro para la misma escena. Después, evalúa el resultado y convierte un único cambio en una instrucción de seguimiento. Anotar las distintas versiones del prompt y el modelo con el que se probó ayuda a organizar mejor la evaluación visual dentro de la oficina. Este enfoque coincide con la recomendación de Google de experimentar y mejorar las instrucciones según las respuestas observadas.

Para los equipos de arquitectura e interiorismo, este flujo puede servir para convertir la idea de un espacio en una narrativa en movimiento para una presentación conceptual o para usar una imagen existente como guía para un video. Sin embargo, las fuentes no explican los costos de generación, los requisitos de hardware, las condiciones de licencia ni la compatibilidad con un software de diseño específico. Antes de utilizar el resultado en una entrega real, verifica por separado el acceso, las condiciones de uso y la compatibilidad con el flujo de trabajo; considera el video generado parte de la comunicación visual, no un sustituto de las decisiones de diseño.

Fuentes y licencia

Esta guía se ha adaptado a partir de la documentación de Google sobre generación de video con la API de Gemini y diseño de prompts. Salvo que se indique lo contrario, el contenido de ambas páginas está sujeto a la licencia CC BY 4.0. Los ejemplos de prompts se han redactado específicamente para el uso arquitectónico, tomando como base las indicaciones técnicas de las fuentes.

Fuentes

2 fuentes
A(
ai.google.dev (CC BY 4.0)ai.google.dev/gemini-api/docs/video
Resumen
A(
ai.google.dev (CC BY 4.0)ai.google.dev/gemini-api/docs/prompting-strategies
Resumen

No republicamos los textos de las fuentes; las citas breves van marcadas y el resto es resumen y comentario propios.

La opinión de 3dsınıfı
3dValoración del editor

Para los equipos de arquitectura y visualización, este enfoque puede ayudar a convertir una idea visual estática en una breve narrativa en movimiento y a evaluar alternativas con rapidez. En particular, el uso de referencias visuales y la edición en varios turnos pueden facilitar las pruebas durante la fase conceptual.

Antes de decidir, las oficinas y los estudiantes de Turquía deberían investigar por separado el acceso a la API, los costos de uso y las condiciones de licencia; las fuentes no explican estos aspectos. Tampoco se especifican los requisitos de hardware local, por lo que conviene hacer una prueba pequeña para comprobar si la generación se ajusta al flujo de trabajo y a las expectativas de entrega existentes. Es recomendable considerar los resultados como material de comunicación visual, no como datos de diseño definitivos.

Preguntas frecuentes

¿Se debe usar Gemini Omni Flash o Veo 3.1 para crear videos arquitectónicos?

Gemini Omni Flash puede ser una opción para crear videos cortos a partir de texto o imágenes y editarlos en varios turnos. Si necesitas audio nativo, extensión de video o generación orientada a fotogramas específicos, consulta las funciones documentadas de Veo 3.1.

¿Cómo se escribe un prompt para video arquitectónico con la API de Gemini?

Describe claramente el espacio, los elementos que deben conservarse y el cambio visual deseado. Comprueba el resultado y, en el siguiente turno, céntrate en una corrección concreta.

¿Veo 3.1 admite guía mediante imágenes y audio?

Según la documentación de Google, Veo 3.1 admite la guía mediante imágenes y la generación de audio nativo. La guía mediante imágenes se explica a través de la API generateContent.

Los comentarios y el foro están en turco.Únete al debate
+

Noticias relacionadas