En resumen
- Gemini Omni Flash se presenta para generar videos cortos y editar los resultados en varias rondas.
- Veo 3.1 ofrece audio nativo, extensión de video, generación con fotogramas específicos y orientación mediante imágenes.
- Un prompt de video puede dividirse en componentes como sujeto, acción, escenario o contexto, ángulo de cámara y movimiento de cámara.
- Las fuentes no especifican precios, requisitos de cuenta ni límites de generación.
¿Qué aprenderás en esta guía?
Para convertir una imagen arquitectónica en una escena en movimiento, en lugar de limitar el prompt a una descripción general como «un video de una casa moderna», puedes explicar por separado qué aparece en la imagen y cómo debe comportarse la cámara. La guía de Google para crear prompts de video considera el sujeto, la acción, el escenario o contexto, el ángulo de cámara y el movimiento de cámara como componentes fundamentales del prompt. No es obligatorio incluirlos todos en cada prompt, pero saber qué describe cada uno ayuda a expresar la intención con mayor claridad.
Los ejemplos de este tutorial se han creado específicamente para la visualización arquitectónica y las presentaciones de interiores. Los prompts no garantizan un resultado determinado ni que un control de cámara específico vaya a funcionar siempre. Según la guía, algunos ángulos de cámara avanzados no cuentan con soporte oficial y la fiabilidad de los resultados puede variar según el caso de uso.
Requisitos y elección del modelo
Para generar videos, se pueden utilizar las opciones de modelos descritas en la documentación de Google para la Gemini API o en la guía de prompts de video de Vertex AI. Las fuentes no detallan los pasos para crear una cuenta, las tarifas, las cuotas ni los requisitos de una suscripción específica; consulta también la documentación del producto correspondiente para conocer las condiciones de acceso.
La documentación de Google para la Gemini API recomienda Gemini Omni Flash para flujos de trabajo que generan videos cortos a partir de texto e imágenes y permiten editar el resultado en varias rondas. Para esta edición en varias rondas, la documentación menciona la Interactions API. Veo 3.1, por su parte, se asocia con necesidades como la generación de video con audio nativo, la extensión de video, la generación con fotogramas específicos y la orientación mediante imágenes; para estas funciones, la documentación indica la generateContent API. Conviene elegir según la necesidad: si el objetivo es mejorar el resultado anterior dentro de una conversación, puede ser adecuado Omni Flash; si necesitas extender un video o generar fotogramas específicos, puedes evaluar Veo 3.1.
Cómo preparar un prompt arquitectónico paso a paso
Define con claridad el sujeto principal. Describe el elemento arquitectónico central de la escena: por ejemplo, una vivienda de una sola planta, una cafetería pequeña o un museo con patio. Incluye también características que quieras mostrar, como materiales o formas. En lugar de una expresión general como «un interior», indica qué espacio quieres representar.
Define la acción. ¿El video mostrará un espacio estático o narrará un cambio? La guía describe la acción como movimientos, interacciones o transformaciones que se producen con el tiempo. En una presentación arquitectónica, por ejemplo, puedes describir cómo la luz del día avanza por una habitación o cómo la cámara recorre un pasillo. La guía también señala que, al describir un proceso muy largo en un solo clip, hay que tener en cuenta la duración del clip.
Describe el espacio y la atmósfera. Explica dónde se encuentra el interior o exterior, a qué hora del día transcurre la escena y qué ambiente tiene. Elementos como «una sala de estar amplia con grandes ventanales, luz matinal y reflejos suaves en el suelo» concretan el contexto. Si tu prompt acumula detalles innecesarios, elimina los que no apoyen la idea principal.
Elige el ángulo y el movimiento de cámara. El plano general puede servir para mostrar el espacio junto con su entorno; la altura de los ojos ofrece una perspectiva más neutra. Indica el movimiento por separado: por ejemplo, una toma fija, un paneo lento o un dolly hacia el interior. El paneo gira la cámara horizontalmente; la inclinación la gira en vertical; el dolly la acerca o aleja físicamente. No son el mismo movimiento. Como punto de partida, una indicación clara como «la cámara se acerca» resulta más comprensible que combinar varios movimientos.
Ejemplo 1: presentar una vivienda en un plano general
Wide establishing shot of a compact courtyard house at golden hour. Warm sunlight falls across pale stone walls and a shaded terrace. The camera makes a slow, steady dolly in toward the entrance.En este ejemplo, el sujeto es una vivienda con patio; el contexto, la hora dorada y la luz del sol; el ángulo de cámara, un plano general; y el movimiento, un dolly lento de acercamiento. Prueba primero estos elementos en conjunto y evalúa el resultado; después, si es necesario, cambia solo uno de ellos.
Ejemplo 2: mostrar los materiales de un interior
A calm contemporary living room with oak cabinetry, a light stone floor, and a large window. Soft morning light moves across the room. Static eye-level shot, with subtle reflections on the floor.Aquí, la acción consiste en el cambio de la luz dentro del espacio, mientras la cámara permanece fija. La guía define la toma estática como un tipo de movimiento en el que la cámara se queda en su lugar. Una indicación de cámara fija es un buen punto de partida cuando quieres destacar los materiales y los efectos de iluminación de la escena.
Ejemplo 3: avanzar por el pasillo de una galería
A quiet art gallery corridor with white walls, a polished concrete floor, and evenly spaced framed works. A slow tracking shot moves forward through the corridor, keeping the architecture in view.Este prompt describe el espacio y el avance de la cámara. Si prefieres sustituir «tracking shot» por una descripción más explícita basada en los nombres de movimientos explicados en la fuente, puedes probar un dolly que indique que la cámara avanza por la escena. El resultado del movimiento puede variar; conviene revisar el prompt de forma controlada.
Ejemplo 4: mostrar el patio desde arriba
Bird's-eye view of a small landscaped courtyard between low-rise buildings. A narrow path curves around a shallow reflecting pool, with planting beds along the edges. The camera slowly cranes upward to reveal the full layout.En este ejemplo se usa bird’s-eye view para indicar un ángulo desde el que la cámara mira directamente hacia abajo; el movimiento de grúa busca elevar el encuadre para revelar el patio completo. La guía advierte que el soporte oficial y la fiabilidad de algunos ángulos avanzados pueden variar. Por eso, comprueba el resultado cuando solicites una vista desde arriba y, si es necesario, vuelve a intentarlo con un plano general más sencillo.
Errores frecuentes
Usar una descripción demasiado general: «Un video de un edificio elegante» ofrece poca información sobre el sujeto, el contexto y la cámara. Primero, concreta el espacio y lo que ocurrirá en el video.
Pedir movimientos que se confunden entre sí: paneo, inclinación, dolly y zoom son movimientos de cámara distintos. En lugar de enumerar muchos en un mismo prompt, empieza por uno y evalúa el resultado.
Describir una transformación larga en un clip: la guía recomienda tener en cuenta la duración del clip al describir procesos que requieren mucho tiempo. Reduce el evento a una acción breve y comprensible.
Añadir todos los componentes a cada prompt: no es obligatorio incluir el sujeto, la acción, el contexto, el ángulo y el movimiento a la vez. No añadas elementos que no necesites.
Dar por sentado que el resultado es seguro: un ángulo o movimiento de cámara indicado en el prompt no garantiza el mismo resultado en cada intento. Revisa las salidas, sobre todo cuando uses ángulos avanzados.
Ignorar los filtros de seguridad: Google indica que Gemini Omni Flash y Veo aplican filtros de seguridad. Los prompts que infrinjan las normas sobre contenido no permitido pueden bloquearse.
Efectos en los flujos de trabajo de arquitectura y visualización
Este enfoque permite estructurar mejor los prompts, especialmente a los equipos de visualización, arquitectos de interiores y estudiantes que quieran complementar una presentación arquitectónica estática con una escena breve en movimiento. Pensar por separado en el espacio, las acciones como la luz o el movimiento y las indicaciones de cámara puede facilitar la comparación entre distintas pruebas. Sin embargo, las fuentes no describen un flujo de trabajo para importar desde un software 3D específico, compatibilidad con archivos de modelos ni conversión de un render existente a video.
La elección del modelo debe responder a la función de video que se necesita; por ejemplo, hay que distinguir entre la edición en varias rondas y necesidades como extender una escena. Antes de generar contenido, consulta la API que vayas a utilizar y sus condiciones de acceso; ten presente que las fuentes no incluyen información sobre presupuesto ni requisitos de hardware. Además, si vas a utilizar las indicaciones de cámara y los resultados en presentaciones de proyectos reales, comprueba por separado que representen fielmente las decisiones de diseño del espacio.
Próximos pasos
Empieza con un prompt breve y elige un único movimiento de cámara principal. Después, haz una nueva prueba cambiando solo un elemento: por ejemplo, describe el mismo espacio con un paneo lento en lugar de una toma fija. Consulta la documentación de las API correspondientes para revisar el flujo de edición en varias rondas de Omni Flash y las necesidades de extensión o generación con fotogramas específicos de Veo 3.1, mencionadas en la fuente. Si el resultado no cumple tus expectativas, revisar por separado los componentes de sujeto, acción, escena y cámara puede ayudarte a detectar dónde falta claridad.
Fuentes y licencia
Este tutorial se ha adaptado al turco a partir de las descripciones de modelos y los componentes de prompts incluidos en los documentos de Google «Video generation in the Gemini API» y «Video generation prompt guide». Ambas fuentes tienen licencia CC BY 4.0.
Fuentes
2 fuentesNo republicamos los textos de las fuentes; las citas breves van marcadas y el resto es resumen y comentario propios.
Para los estudios de arquitectura y los equipos de visualización en Turquía, pensar por separado en el sujeto, el espacio y la descripción de la cámara puede ayudar a planificar mejor el proceso de pruebas para videos breves de presentación. Los estudiantes que quieran complementar imágenes estáticas con una narración en movimiento también pueden usar este enfoque como punto de partida.
Aun así, las fuentes no detallan los precios, los requisitos de hardware ni las condiciones de acceso a la API; por eso, antes de empezar a producir, conviene consultar la documentación de los servicios correspondientes y comprobar los costos. También es necesario evaluar los resultados para verificar la coherencia de los movimientos de cámara y la correcta representación del diseño.
Preguntas frecuentes
¿Cuál es la diferencia entre Gemini Omni Flash y Veo 3.1?
Gemini Omni Flash se destaca para generar videos cortos y trabajar con flujos de edición en varias rondas. Veo 3.1 ofrece audio nativo, extensión de video, generación con fotogramas específicos y orientación mediante imágenes.
¿Qué información debe incluir un prompt de video arquitectónico?
El sujeto, la acción, el escenario o contexto, el ángulo de cámara y el movimiento de cámara son componentes que puedes usar para crear un prompt. No es necesario incluirlos todos en cada solicitud.
¿Cuánto cuestan Gemini Omni Flash y Veo 3.1?
La documentación de las fuentes no incluye información sobre precios. Consulta la documentación de los productos correspondientes para conocer las tarifas y las condiciones de acceso.



