En resumen
- Gemini Omni Flash se recomienda para generar videos cortos con texto e imágenes y editarlos mediante instrucciones conversacionales.
- Veo 3.1 ofrece opciones como audio natural, extensión de video y generación a partir de fotogramas específicos.
- Un buen prompt puede describir por separado el tema, la acción, el lugar y las preferencias de cámara.
- Según la guía de Google, los resultados y la fiabilidad de los ángulos de cámara avanzados pueden variar.
¿Qué aprenderás en esta guía?
Convertir una escena arquitectónica en un video no consiste solo en decir «muestra una casa moderna». Describir claramente el espacio, qué cambia en la escena, a qué hora del día transcurre y cómo se mueve la cámara ofrece un punto de partida más controlado. En esta guía abordamos cómo crear prompts centrados en arquitectura e interiores para Gemini Omni Flash y Veo, las diferencias de uso de estas dos opciones que se indican en las fuentes y los errores habituales al escribir prompts.
La documentación de Google destaca Gemini Omni Flash para generar videos cortos a partir de texto e imágenes y editarlos en varias rondas. Veo 3.1, por su parte, se describe con funciones como audio natural, extensión de video y generación a partir de fotogramas específicos. Por eso, primero define lo que necesitas: considera Omni Flash para crear una escena nueva y trabajar en el resultado mediante instrucciones conversacionales; y Veo 3.1 para necesidades indicadas como la extensión o la orientación a partir de fotogramas específicos.
Requisitos y elección de herramientas
La documentación de las fuentes describe Gemini API y Vertex AI Agent Platform para la generación de video. En el caso de Omni Flash, se menciona Interactions API; para Veo 3.1, generateContent API. La documentación no especifica una versión de software local, tipo de cuenta, precio ni condiciones de acceso; compruébalos en la documentación actualizada del servicio correspondiente antes de empezar.
Antes de empezar, aclara el objetivo con estas tres preguntas:
¿Se generará un video arquitectónico nuevo o se analizará uno existente? Las fuentes describen la generación de video; para analizar videos existentes remiten a una guía aparte sobre comprensión de video.
¿La entrada será texto, una imagen o una combinación de varios tipos? Gemini Omni Flash se describe como un modelo multimodal que admite conjuntamente entradas de texto, imagen, audio y video. Para Veo 3.1 se indica la orientación mediante imágenes.
¿Qué cambio es importante en el resultado? Elige un objetivo, como presentar un espacio, describir el movimiento de cámara o añadir una continuación a una escena.
Puedes estructurar un prompt con estos elementos: tema (el foco de la imagen), acción (qué ocurre), escena y contexto (dónde, cuándo y cuál es la atmósfera), ángulo de cámara y movimiento de cámara. No es obligatorio incluir todos los elementos en cada prompt: selecciónalos según lo que necesites.
Prompts de video arquitectónico paso a paso
1. Describe primero el espacio y el foco
El tema es el elemento arquitectónico o interior que ocupa el centro del video. En lugar de usar expresiones generales, especifica características visibles como los materiales, la forma y las relaciones espaciales. El siguiente ejemplo sirve para crear una escena exterior nueva:
A contemporary public library with a broad timber canopy and a glazed ground floor, set in a quiet urban plaza at early morning. Soft overcast daylight reveals the timber grain and the reflections in the glass. Wide establishing shot, calm architectural visualization.En este ejemplo se definen conjuntamente el edificio, los materiales, el entorno, la hora y el encuadre general. En un video conceptual, elige qué aspecto del diseño quieres destacar, como el ritmo de la fachada, el espacio de acceso o la relación del edificio con la plaza. En lugar de añadir al prompt características técnicas invisibles o medidas exactas, describe las cualidades que quieres visualizar en el video.
2. Define la acción de la escena
La acción explica en qué se diferencia el video de una imagen estática. En visualización arquitectónica, puedes incluir elementos observables como el movimiento de las personas, los cambios de luz del entorno o el movimiento de las hojas con el viento:
A small group of visitors walks slowly through a contemporary museum atrium, pausing beneath a large skylight. Sunlight shifts gently across the stone floor while a few leaves outside move in a light breeze. Medium-wide shot, restrained and realistic movement.Aquí las acciones son breves y coherentes entre sí. Describir muchas transformaciones o sucesos en un solo clip puede hacer que no quede claro qué movimiento es el importante. Empieza por una acción principal y, si hace falta, añade un pequeño movimiento ambiental que la acompañe.
3. Añade el ángulo y el movimiento de cámara
El ángulo de cámara indica desde qué punto de vista observa el espacio el espectador; la descripción del movimiento señala cómo avanza el plano. La guía de Google ofrece ejemplos de ángulos como plano general, vista aérea, altura de los ojos y primer plano, y de movimientos como pan, tilt, dolly, truck, zoom y crane. También señala específicamente que los resultados pueden variar con los ángulos avanzados.
A double-height residential living room with a sculptural staircase and a large window facing a garden. Begin with a wide eye-level view, then make a slow dolly in toward the staircase. Soft late-afternoon light, stable camera, natural material detail.Este prompt especifica claramente el encuadre inicial y un único movimiento de cámara. «Dolly in» describe el acercamiento físico de la cámara al sujeto; la guía lo distingue del zoom. En lugar de acumular muchas instrucciones de cámara en un mismo plano, empieza con un único movimiento para poder evaluar el resultado.
4. Relaciona la luz y la atmósfera con el espacio
El contexto de la escena abarca elementos como el lugar, la hora del día, el clima y la atmósfera. Describe la luz de forma que ayude a apreciar el diseño. Por ejemplo, si quieres que se vean las superficies de los materiales, indica de dónde procede la luz y qué atmósfera crea:
A quiet boutique hotel lobby with pale stone walls, a dark timber reception desk, and a shallow reflecting pool. Early morning light enters from the side and creates soft reflections on the stone. Static wide shot, subtle water movement, calm atmosphere.En este caso, la cámara fija ayuda a centrar la atención en el vestíbulo y los materiales, mientras que el movimiento del agua aporta un poco de dinamismo a la escena. Procura que las descripciones de luz, cámara y acción contribuyan al mismo objetivo visual. Por ejemplo, pedir una atmósfera nocturna dramática y, al mismo tiempo, mostrar el espacio con una luz intensa de mediodía puede producir resultados contradictorios.
5. Considera la imagen de entrada como una referencia
Si tienes una imagen de referencia, puedes considerar un flujo de trabajo que use una imagen como entrada. La fuente indica que Omni Flash puede trabajar con texto e imágenes, y que Veo 3.1 admite la orientación mediante imágenes. Sin embargo, no garantiza que se conserven exactamente todos los detalles de la imagen. Por eso, especifica también en el prompt qué característica es importante:
Use the provided architectural image as visual direction for a compact courtyard house. Show a slow truck right across the courtyard, revealing the relationship between the timber screen, planted edge, and interior glazing. Gentle daylight, restrained movement, wide shot.Este ejemplo indica qué quieres que aparezca en el encuadre, además de usar la imagen como referencia. Si cambian los materiales o las relaciones espaciales en el resultado, vuelve a ajustar el prompt y simplifica el foco principal. Las fuentes mencionan la posibilidad de orientar el resultado mediante imágenes, pero no describen un paso concreto para subirlas ni una ruta en la interfaz.
Errores habituales
Usar descripciones demasiado generales: expresiones como «un video de una casa bonita» no definen con claridad el tema ni la atmósfera. Describe el tipo de edificio, el espacio y la característica que quieres destacar.
Confundir la acción con el movimiento de cámara: en una descripción como «la fachada gira mientras la cámara se acerca», puede no quedar claro qué movimiento tiene prioridad. Escribe la acción de la escena y el movimiento de cámara por separado, en ese orden.
Pedir atmósferas incompatibles: describir distintas horas y condiciones de iluminación en el mismo prompt debilita el contexto de la escena. Elige una sola hora y una sola atmósfera.
Suponer que todos los ángulos de cámara son igual de fiables: Google indica que los resultados y la fiabilidad pueden variar con algunos ángulos de cámara avanzados. Si obtienes un encuadre inesperado, vuelve a intentarlo con un ángulo más básico.
Confundir la generación con el análisis: la documentación de API de esta guía se centra en la generación de video. Si necesitas analizar un video existente, consulta la documentación sobre comprensión de video que indican las fuentes.
Uso en flujos de trabajo de arquitectura y visualización
Este enfoque puede resultar útil para arquitectos, interioristas y equipos de visualización que quieran convertir escenas conceptuales, la atmósfera de un interior o la relación de un edificio con su entorno en breves pruebas en movimiento. Separar en el prompt el tema, la acción y las preferencias de cámara facilita la comparación de distintas ideas para una presentación. Sin embargo, las fuentes no indican que el video generado vaya a conservar exactamente la geometría del proyecto o los materiales; por tanto, evalúa el resultado como una prueba de comunicación visual, no como sustituto de la validación del diseño.
Al elegir una herramienta, también hay que comprobar la licencia, las condiciones de acceso al servicio y el costo, además del objetivo de uso. Las fuentes no explican los precios ni los requisitos de cuenta. Antes de usar imágenes de proyectos reales, los equipos deben revisar las condiciones del servicio correspondiente y las políticas internas sobre datos; desde el punto de vista técnico, también deben verificar que el flujo de API elegido sea compatible con el proceso de producción actual. Para una presentación importante, en lugar de confiar en un único prompt, conviene revisar las descripciones de cámara y escena mediante pruebas breves.
Próximos pasos
Primero, prueba varias versiones de la misma escena cambiando únicamente el movimiento de cámara; después, modifica un solo elemento, como la luz o la acción. Así será más fácil identificar qué descripción ha cambiado el resultado. La documentación indica que Gemini Omni Flash permite editar en varias rondas; si utilizas esta función, especifica con claridad el cambio que quieres en cada ronda. Considera Veo 3.1 para necesidades como la extensión de video o la generación a partir de fotogramas específicos que describe la fuente. En ambos casos, evalúa los resultados según el propósito arquitectónico de la presentación.
Fuentes y licencia
Este tutorial se ha adaptado al turco a partir del documento «Video generation in the Gemini API» de Google AI for Developers y la guía «Video generation prompt guide» de Google Cloud. Ambas fuentes tienen licencia CC BY 4.0.
Fuentes
2 fuentesNo republicamos los textos de las fuentes; las citas breves van marcadas y el resto es resumen y comentario propios.
Para los equipos de arquitectura, el valor práctico de este enfoque está en que puede facilitar la conversión de una idea espacial en breves narraciones en movimiento y la prueba de opciones de cámara antes de una presentación. En especial para comunicar conceptos y atmósferas, pequeñas pruebas con descripciones claras pueden contribuir al flujo de trabajo.
Las oficinas y los estudiantes en Turquía deben comprobar por separado el costo del servicio, las condiciones de acceso y las normas sobre el uso de imágenes de proyectos antes de decidirse a utilizarlo. Las fuentes no explican los precios ni los requisitos de cuenta; tampoco afirman que el video generado conserve exactamente los detalles del diseño. Por eso, conviene considerar el resultado como un apoyo a la comunicación visual, no como una herramienta de validación del diseño.
Preguntas frecuentes
¿Cuál es la diferencia entre Gemini Omni Flash y Veo 3.1?
Google destaca Gemini Omni Flash para generar videos cortos a partir de texto e imágenes y editarlos en varias rondas. Veo 3.1 ofrece funciones como audio natural, extensión de video y generación a partir de fotogramas específicos.
¿Qué información debe incluir un prompt de video arquitectónico?
El tema, la acción, el contexto de la escena, el ángulo de cámara y el movimiento de cámara pueden ayudar a estructurar el prompt. No es necesario incluir todos los elementos en cada prompt.
¿Cuánto cuestan Veo 3.1 o Gemini Omni Flash?
Las fuentes proporcionadas no indican los precios. Antes de utilizarlos, consulta los precios y las condiciones de acceso actualizados del servicio correspondiente.



