En resumen
- Gemini Omni Flash y Veo permiten generar videos mediante instrucciones de texto.
- Un prompt puede estructurarse con descripciones del sujeto, el movimiento, la escena o el contexto y la cámara.
- Gemini Omni Flash está orientado a crear videos cortos a partir de texto e imágenes y a editarlos mediante varias interacciones.
- Veo 3.1 ofrece audio nativo, extensión de video, generación de fotogramas específicos y orientación mediante imágenes.
¿Qué aprenderás en esta guía?
Decir únicamente «una casa moderna» en un prompt para un video de arquitectura quizá no baste para explicar cómo debe verse la escena ni cómo debe comportarse la cámara. La guía de Google para la generación de videos recomienda dividir la idea en componentes como el sujeto, la acción, la escena o el contexto y la cámara. En esta guía aplicaremos el mismo enfoque a las visualizaciones de interiores y exteriores.
El objetivo no es encontrar una instrucción mágica que garantice un resultado específico, sino hacer que la descripción de la escena sea clara y controlable. Los ejemplos de prompts en inglés que aparecen a continuación se han escrito específicamente para esta guía. Cada prompt está preparado para probarse por separado: elige el que se ajuste a la escena y adáptalo a tu proyecto.
Requisitos y elección del modelo
La documentación de Gemini API de Google incluye Gemini Omni Flash y Veo entre las opciones para generar videos. Según la documentación, Gemini Omni Flash se destaca para crear videos cortos a partir de texto e imágenes y para editarlos mediante conversaciones de varias interacciones. Por ejemplo, cambiar un elemento de la escena o ajustar la perspectiva son ejemplos de un proceso de edición iterativo.
Veo 3.1 se describe con funciones como la generación de audio nativo, la extensión de videos, la generación de fotogramas específicos y la orientación mediante imágenes. La guía indica que se puede elegir Veo 3.1 cuando se necesitan funciones específicas, y recomienda Gemini Omni Flash como opción predeterminada para generar videos. La opción adecuada depende del flujo de trabajo deseado.
Las fuentes no explican el tipo de suscripción necesario, el costo de uso, los requisitos de hardware del equipo ni las condiciones para crear una cuenta. Por eso, antes de iniciar un proyecto, conviene consultar por separado la información actualizada sobre acceso y costos del servicio utilizado. Los siguientes ejemplos se centran en la redacción de prompts; no describen un menú específico de una interfaz ni una llamada a la API.
Cómo estructurar un prompt para un video de arquitectura
Redacta el prompt teniendo en cuenta los siguientes componentes. No es obligatorio incluirlos todos cada vez; selecciona los que necesite la escena.
Sujeto: Define el espacio o el objeto en el que se centra el video. En lugar de «un interior», incluye características distintivas como «una sala de estar con cocina abierta y techo de madera».
Acción: ¿Qué cambia o se mueve en el video? Elige un movimiento único y claro, como la luz que avanza por una pared o la cámara que se desplaza lentamente por un pasillo.
Escena y contexto: Describe si se trata de un interior o un exterior, la hora del día, el clima y la atmósfera. Por ejemplo, la luz de la mañana, el suelo mojado tras la lluvia o un patio soleado ayudan a definir la sensación de la escena.
Ángulo y movimiento de cámara: Usa un punto de vista, como gran angular, a la altura de los ojos o desde arriba, y una descripción de cámara, como toma fija, paneo horizontal o movimiento dolly. La guía señala que algunos ángulos de cámara avanzados no cuentan con soporte oficial y que los resultados pueden variar.
En lugar de incluir demasiados movimientos en el mismo prompt desde el primer intento, elegir un movimiento principal facilita la evaluación del resultado. Los siguientes ejemplos son puntos de partida.
1. Plano general fijo de un interior
Wide establishing shot of a calm contemporary living room with a timber ceiling, pale stone floor, and a large window. Soft morning light falls across the room. Static camera, realistic architectural visualization, no people.En este prompt, el sujeto es una sala de estar concreta, el contexto es la luz de la mañana y la descripción de cámara indica un plano general fijo. Las descripciones de materiales y luz definen el carácter visual de la escena; como no se añade movimiento de cámara, la atención se mantiene en el aspecto general del espacio.
2. Avance lento de la cámara por un pasillo
A long gallery corridor in a contemporary art museum, with warm limestone walls and a polished concrete floor. The camera slowly dollies forward at eye level toward a bright courtyard. Soft daylight, quiet atmosphere.Aquí, «dollies forward» describe el avance físico de la cámara. La altura de los ojos y la mirada dirigida hacia el patio aclaran hacia dónde se mueve. Se utiliza un solo movimiento de avance, en vez de añadir distintos movimientos de cámara a lo largo del pasillo.
3. Paneo horizontal de una fachada
A small contemporary house beside a green garden on an overcast afternoon. Slow pan right across the facade, revealing timber cladding, deep window frames, and the entrance. Wide shot, gentle wind moving the garden plants.En este ejemplo, la fachada es el sujeto; el jardín y el cielo nublado forman el contexto. El paneo horizontal describe un giro del encuadre hacia la derecha. El movimiento de las plantas con el viento añade una pequeña acción a la escena; la dirección de la cámara y el movimiento dentro de la escena se expresan por separado.
4. Organización del patio en una vista cenital
Bird's-eye view of a compact residential courtyard with a rectangular reflecting pool, stone paving, planted beds, and a timber pergola. Slow, steady camera movement above the courtyard in clear afternoon light.La vista de pájaro es una descripción de ángulo que sirve para mostrar la ubicación de los elementos del patio en relación unos con otros. La guía de referencia incluye este ángulo como ejemplo; aun así, ten en cuenta que el resultado generado puede depender del prompt y del caso de uso.
5. Acercamiento a los detalles de los materiales
Close-up of a pale stone wall meeting a dark timber door frame in a quiet interior. Slow dolly in toward the junction, soft side light revealing the surface texture, realistic architectural detail.Este ejemplo destaca la unión entre la pared y el marco de la puerta, en lugar de mostrar todo el espacio. El primer plano y el lento acercamiento son descripciones pensadas para hacer visible la relación entre los materiales. En proyectos reales, también es necesario comprobar que el detalle sea coherente con el diseño.
Errores frecuentes
No definir con claridad el sujeto y el movimiento: Expresiones generales como «genera un video impresionante» no ofrecen suficientes detalles para describir la escena. Nombra el espacio e indica claramente qué debe suceder en el video.
Usar instrucciones de cámara que se contradicen: Pedir a la vez una toma fija, un paneo rápido y un avance puede hacer que el comportamiento de la cámara no quede claro. Prueba primero un solo movimiento; si hace falta, solicita un cambio en una ronda de edición posterior.
Describir una escena demasiado compleja: En lugar de añadir muchos objetos, sucesos y detalles de la atmósfera, elige los elementos prioritarios. Ten en cuenta también que las transformaciones que se desarrollarían durante un período largo quizá no encajen con la duración del clip.
Suponer que todos los ángulos de cámara son igual de fiables: Según la guía, algunos ángulos avanzados no cuentan con soporte oficial y la fiabilidad de los resultados puede variar. En el primer intento, empieza con descripciones claras, como plano general, a la altura de los ojos, toma fija o paneo sencillo.
Cómo evaluarlo en un flujo de trabajo de arquitectura y visualización
Los diseñadores de interiores, los estudios de arquitectura y los artistas de visualización pueden usar este enfoque para convertir una idea espacial en borradores de presentaciones animadas. Separar las descripciones del sujeto, la acción y la cámara puede resultar útil, sobre todo cuando se quiere explicar la relación entre los espacios mediante el movimiento de cámara en lugar de con una sola imagen. Sin embargo, las fuentes no garantizan que los resultados del modelo se ajusten directamente a los planos del proyecto ni a las decisiones de diseño. Considera las imágenes generadas como borradores visuales que deben revisarse, no como prueba de la precisión del diseño.
Al elegir un modelo, relaciona también la necesidad con la función: consulta Gemini Omni Flash para generar videos cortos a partir de texto e imágenes o editarlos mediante varias interacciones; y Veo 3.1 cuando necesites extensión de video, generación de fotogramas específicos, orientación mediante imágenes o audio nativo. Las fuentes no ofrecen detalles sobre licencias, costos, requisitos de hardware ni compatibilidad con los flujos de producción existentes. Antes de definir un flujo de trabajo para una oficina, confirma estos aspectos en las condiciones actualizadas del servicio.
Próximos pasos
Elige una escena del proyecto y empieza por describir el sujeto y el contexto. Después, crea una primera prueba añadiendo solo un ángulo de cámara y un movimiento. Al evaluar el resultado, determina qué quieres cambiar: ¿el encuadre, la luz o algún elemento del espacio? Gemini Omni Flash se describe como una herramienta compatible con este tipo de solicitudes graduales mediante varias interacciones. Si necesitas funciones más específicas, como extender un video o guiar fotogramas concretos, consulta las funciones documentadas de Veo 3.1.
Fuentes y licencia
Esta guía se ha adaptado al turco a partir de la página «Video generation prompt guide» de Google Cloud y la documentación «Video generation in the Gemini API» de Gemini API. Ambas fuentes están bajo la licencia CC BY 4.0. Los ejemplos de prompts de arquitectura se han escrito específicamente para esta guía.
Fuentes
2 fuentesNo republicamos los textos de las fuentes; las citas breves van marcadas y el resto es resumen y comentario propios.
El valor práctico de este enfoque para los estudios de arquitectura y los equipos de visualización reside en que divide la escena en decisiones pequeñas y fáciles de controlar. Probar el mismo espacio con distintas descripciones de cámara puede facilitar el debate sobre una idea para una presentación; sin embargo, no se debe suponer que los resultados se ajustarán exactamente al diseño.
Los estudios y estudiantes de Turquía deberían confirmar, antes de empezar, los costos de uso, las condiciones de acceso y la compatibilidad con su flujo de trabajo actual. Las fuentes no especifican requisitos de hardware ni precios, por lo que no es posible recomendar una inversión concreta en equipos ni un modelo de licencia. Lo más prudente es tratar los videos generados como borradores que deben revisarse, no como entregables finales del proyecto.
Preguntas frecuentes
¿Cuál es la diferencia entre Gemini Omni Flash y Veo 3.1?
Google destaca Gemini Omni Flash para la generación de videos cortos y la edición mediante varias interacciones. Veo 3.1 se describe con funciones de audio nativo, extensión de video, generación de fotogramas específicos y orientación mediante imágenes.
¿Qué información debe incluir un prompt para un video de arquitectura?
El sujeto, la acción, la escena o el contexto y la descripción de cámara son componentes básicos. No es obligatorio incluirlos todos en cada prompt.
¿Qué funciones de video admite Veo 3.1?
Según la documentación, Veo 3.1 ofrece audio nativo, extensión de video, generación de fotogramas específicos y orientación basada en imágenes.



