En resumen
- Gemini Omni Flash se recomienda para generar videos cortos a partir de texto e imágenes y editarlos en varias rondas.
- Veo 3.1 ofrece funciones como extender escenas, dirigir fotogramas específicos y generar audio integrado.
- Los prompts con tareas, restricciones y expectativas de salida claras pueden dar más control al proceso de generación.
- La documentación de video de Gemini API de Google explica la elección de modelos, mientras que la guía de diseño de prompts presenta métodos para redactar instrucciones.
¿Qué aprenderás en esta guía?
Convertir una imagen arquitectónica en un video corto o pedir cambios en una escena generada no consiste únicamente en describir un espacio atractivo. El prompt debe explicar con claridad qué ocurre en la escena, cómo se mueve la cámara, qué elementos deben conservarse y cómo debe verse el resultado. En esta guía relacionaremos los modelos de video descritos en la documentación de Gemini API con las necesidades de la visualización arquitectónica, prepararemos ejemplos de prompts prácticos y veremos cómo mejorar los resultados de forma iterativa.
En la documentación de Google, Gemini Omni Flash se presenta como una opción general para generar videos cortos a partir de texto e imágenes y editarlos en varias rondas. Veo 3.1 destaca en necesidades como extender escenas, controlar el fotograma final o integrarse con flujos de trabajo anteriores. Estas descripciones de las capacidades de los modelos proceden de la documentación del proveedor; no implican que los resultados vayan a ser idénticos en todas las escenas.
Requisitos y elección del modelo
Esta guía se basa en Gemini Omni Flash y Veo 3.1, mencionados en la documentación de generación de video de Gemini API. Con Omni Flash se pueden crear videos cortos a partir de texto e imágenes; además, el modelo admite la edición conversacional en varias rondas mediante Interactions API. Veo 3.1 se describe como compatible con la generación de video a través de generateContent API, audio integrado, extensión de escenas, generación para fotogramas específicos y orientación a partir de imágenes.
La documentación no ofrece detalles sobre la creación de cuentas, los precios, las condiciones de acceso ni el hardware necesario. Por eso, antes de empezar a producir, consulta por separado las condiciones actuales de acceso a la API y la información de costos; aquí no se presupone una suscripción específica ni requisitos de hardware local. Como la documentación de video explica el uso de la API, los ejemplos se basan en un flujo de trabajo con API. No se describen pasos de menú ni parámetros, por lo que esta guía no indica una ruta específica dentro de una interfaz.
Elige el modelo según tus necesidades:
Considera Omni Flash para crear un clip corto a partir de texto o imágenes y luego ajustarlo mediante rondas conversacionales.
Considera Veo 3.1 si necesitas extender una escena, dirigir fotogramas específicos o usar audio integrado.
Si necesitas analizar un video existente en lugar de generarlo, consulta la guía independiente “Video understanding” recomendada en la documentación.
Paso a paso: prompts para videos de arquitectura
La guía de diseño de prompts de Google recomienda que las instrucciones sean claras y específicas, e indica que el prompt debe incluir la tarea, las restricciones y el formato de salida esperado. También destaca que desarrollar un prompt requiere probarlo y mejorarlo. Los siguientes ejemplos se han creado específicamente para usos arquitectónicos; no son copias de los prompts de ejemplo de las fuentes.
1. Describe primero la escena y el movimiento
En el primer prompt, especifica el tipo de proyecto, el espacio visible, la iluminación y el movimiento de cámara deseado. En vez de utilizar muchos adjetivos imprecisos a la vez, céntrate en elementos que puedan apreciarse en el video.
Create a short architectural video of a calm contemporary living room with pale oak flooring, a limestone feature wall, and soft morning light entering through tall windows. Show the room from the doorway as the camera slowly moves toward the seating area. Keep the furniture layout stable and the atmosphere quiet and natural.Esta descripción explica por separado las características de la estancia, las condiciones de iluminación y el movimiento de cámara. Al evaluar el primer resultado, comprueba, por ejemplo, si se ha conservado la distribución del espacio, si la cámara avanza en la dirección indicada y si se entiende la descripción de la luz. En el siguiente intento, en lugar de volver a escribirlo todo, aclara la instrucción que te haya parecido problemática.
2. Usa una imagen de referencia como entrada de orientación
Omni Flash puede trabajar con texto e imágenes, y Veo 3.1 también ofrece orientación a partir de imágenes. Añade una imagen adecuada como entrada e indica en el texto qué aspectos visuales quieres conservar. Este ejemplo está pensado para usar un render como entrada de video.
Use the provided architectural image as the visual reference for the room. Create a short video that preserves its material palette, window positions, and furniture arrangement. Show a gentle camera move from the dining area toward the kitchen, with consistent daylight and no new furniture.Las instrucciones de conservación se centran aquí en las decisiones de diseño principales de la imagen. El modelo puede interpretar de otra manera un detalle que no aparezca en la imagen de referencia; por eso, resulta útil nombrar también en el texto los materiales y las decisiones de distribución fundamentales. Las fuentes no garantizan que el modelo vaya a conservar a la perfección cada detalle.
3. Mejora el primer resultado con una ronda de edición
La edición conversacional en varias rondas de Omni Flash permite pedir un cambio específico después de la generación inicial. Describir un solo cambio principal en cada ronda ayuda a dejar más claro qué debe modificarse.
In the current video, replace the dark coffee table with a low, light-oak table. Keep the room layout, camera movement, window light, and all other furniture unchanged.Este ejemplo pide cambiar únicamente la mesa de centro y conservar los demás elementos. Si también cambian otros elementos en el resultado, especifica con más claridad en la siguiente ronda cuáles deben mantenerse. Aunque la documentación confirma que Omni Flash admite la edición en varias rondas, no garantiza que funcione bien en todas las escenas.
4. Define por separado cuándo necesitas extender una escena
Si necesitas generar la continuación de un clip, considera la función de extensión de escenas documentada para Veo 3.1. Las fuentes presentan esta función, pero no explican los pasos de la interfaz ni los parámetros; por eso, el siguiente prompt se centra en el contenido de la continuación.
Extend the architectural scene with a slow continuation into the adjoining courtyard. Maintain the same stone surfaces, soft daylight, and restrained visual mood. Let the view reveal the courtyard gradually, without changing the established architectural style.Este ejemplo describe el lenguaje visual que debe mantenerse en la continuación. Al aplicar técnicamente la extensión de escenas, sigue las instrucciones actualizadas de la documentación de Veo; no des por sentado ningún nombre de control ni parámetro de API que no se mencione aquí.
Errores frecuentes
Descripciones imprecisas del movimiento: En vez de usar expresiones abiertas a interpretación, como «que sea más cinematográfico», explica desde dónde empieza la cámara y en qué dirección se mueve.
Pedir demasiados cambios en un mismo prompt: Cambiar la cámara, los materiales, la iluminación y el mobiliario en una sola ronda dificulta evaluar el resultado. Primero establece la escena principal y luego solicita cambios específicos en rondas separadas.
No indicar qué elementos deben conservarse: Proporcionar una imagen de entrada no significa que todas las decisiones de diseño vayan a mantenerse automáticamente. Especifica también en el texto los materiales, la distribución y las características de iluminación importantes.
Elegir el modelo sin tener en cuenta las necesidades: La documentación distingue Omni Flash para videos cortos y edición conversacional, y Veo 3.1 para necesidades como extender escenas, generar fotogramas específicos o usar audio integrado. Una elección que no se ajuste a la necesidad puede dar lugar a pruebas innecesarias.
Esperar un resultado perfecto en el primer intento: El diseño de prompts es un proceso iterativo. Revisa la generación, identifica qué falta o qué está mal y actualiza las instrucciones de forma específica.
Próximos pasos en los flujos de trabajo de arquitectura y visualización
Los estudios de arquitectura y los estudiantes pueden explorar, con fines de presentación, la atmósfera de interiores, la combinación de materiales o la sensación de circulación en un espacio mediante breves movimientos de cámara. Trabajar con una imagen de entrada puede permitir probar movimientos a partir de un render existente; sin embargo, las fuentes no garantizan que el modelo vaya a conservar exactamente la geometría del diseño ni todos los detalles visuales. Por eso, conviene considerar el resultado como un experimento de narrativa visual, no como un dibujo técnico ni como un documento de proyecto definitivo.
Antes de incorporar esta herramienta al flujo de trabajo de un equipo, hay que verificar el acceso a la API, las condiciones actuales de licencia y costos, y la compatibilidad con el proceso de producción existente. La documentación no ofrece información sobre precios, requisitos de hardware local ni compatibilidad con programas de diseño específicos. Empezar con una escena de prueba pequeña y registrar qué decisiones de diseño se conservan o cambian en cada ronda del prompt permite hacer una evaluación más prudente.
Fuentes y licencia
Esta guía se ha adaptado al turco a partir de la documentación de Google sobre generación de video con Gemini API y estrategias de diseño de prompts. Ambas fuentes se ofrecen bajo la licencia CC BY 4.0. Los ejemplos de prompts arquitectónicos se han escrito específicamente para esta guía; no se han copiado los ejemplos de prompts de las fuentes.
Fuentes
2 fuentesNo republicamos los textos de las fuentes; las citas breves van marcadas y el resto es resumen y comentario propios.
Para los estudios de arquitectura y los estudiantes de Turquía, este enfoque puede resultar práctico para crear videos breves de presentación a partir de renders existentes y probar distintas formas de narrar una escena. En particular, explicar con claridad qué decisiones de la imagen inicial se quieren conservar facilita seguir la intención de diseño.
Sin embargo, las fuentes no explican el acceso a la API, los costos, las licencias ni la compatibilidad con programas de diseño específicos. Por eso, antes de incorporar el método directamente al flujo de producción, conviene probarlo con una escena pequeña y verificar las condiciones actuales. Es más sensato tratar los resultados como una alternativa de narrativa visual, no como una garantía de exactitud técnica.
Preguntas frecuentes
¿Para qué se puede utilizar Gemini Omni Flash en la generación de videos de arquitectura?
Según la documentación de Google, puede crear videos cortos a partir de texto e imágenes y admite la edición en varias rondas mediante Interactions API.
¿Cuál es la diferencia entre Gemini Omni Flash y Veo 3.1?
Omni Flash se recomienda para la generación general de video y la edición conversacional. Veo 3.1 se describe con funciones como extensión de escenas, generación para fotogramas específicos y audio integrado.
¿Qué hardware se necesita para generar videos con Gemini API?
Las fuentes no ofrecen información sobre el hardware necesario. Para conocer las condiciones de acceso a la API y los costos, consulta la documentación actualizada de Gemini API.



