En resumen
- Gemini Omni y Veo pueden usar una imagen como fotograma inicial del video.
- La documentación indica opciones de duración de 3–10 segundos para Gemini Omni 1.1 Flash Preview.
- El prompt puede prepararse de forma más controlada dividiéndolo en descripciones del sujeto, el movimiento, el espacio y la cámara.
- Para usar la API REST se necesitan un proyecto de Google Cloud, Agent Platform API y autenticación.
¿Qué aprenderá en esta guía?
Al convertir una imagen arquitectónica en un video corto, el objetivo no es solo añadir movimiento a la escena, sino también conservar la legibilidad del diseño. En esta guía explicamos cómo usar una imagen existente como fotograma inicial, solicitar movimientos con indicaciones breves y claras, definir el comportamiento de la cámara y comprender los ajustes básicos del ejemplo de la API. Los ejemplos están pensados para visualizaciones de interiores residenciales, fachadas y paisajes.
Según la documentación de Google, Gemini Omni y Veo pueden generar videos a partir de una imagen existente. Esta función está disponible a través de Gemini Enterprise Agent Platform Media Studio o de la API de generación de video. Como los resultados pueden variar de un prompt a otro, conviene que las primeras pruebas sean breves y se centren en una sola idea de movimiento.
Requisitos: cuenta, modelo e imagen
Para trabajar desde Media Studio o mediante la API se necesita una cuenta de Google Cloud y un proyecto de Google Cloud seleccionado o creado. Si se opta por la API, es necesario habilitar Agent Platform API y enviar las solicitudes con autenticación. La documentación también indica que quienes utilicen el ejemplo REST en un entorno de desarrollo local deben instalar Google Cloud CLI y autenticarse mediante la CLI. En cambio, para acceder desde la consola no se requiere una configuración adicional de autenticación.
Entre los modelos documentados para generar video a partir de una imagen se encuentran gemini-omni-1.1-flash-preview y varios modelos de Veo 3.0 y Veo 3.1. Los pasos siguientes se basan en el ejemplo de la API de Gemini Omni, que describe explícitamente la imagen de entrada y los ajustes. En la solicitud a la API, la imagen de entrada se indica mediante un URI de Cloud Storage; el tipo MIME del ejemplo es image/png. Por eso, antes de empezar, compruebe que la imagen que va a utilizar sea accesible desde el proyecto y que la solicitud incluya la ubicación correcta.
El ejemplo de la API ofrece valores enteros de entre 3 y 10 segundos para la duración, y las opciones 16:9 o 9:16 para la relación de aspecto. Si no se especifica la resolución, la salida es de 720p de forma predeterminada; la documentación enumera las opciones 360p, 720p, 1080p y 4K para gemini-omni-1.1-flash-preview. Si se utiliza otro modelo, hay que comprobar por separado los ajustes compatibles. Las fuentes no incluyen información sobre precios.
Paso a paso: preparar un prompt de video para una imagen arquitectónica
Defina un único objetivo. Elija qué aspecto de la imagen quiere animar: por ejemplo, el cambio de la luz natural en un interior, un desplazamiento lento de la cámara a lo largo de una fachada o el leve movimiento de las hojas en un patio. En lugar de describir varios sucesos importantes en un mismo prompt, utilice una sola acción principal.
Describa el sujeto y el contexto. La guía de prompts define el sujeto, la acción y el contexto de la escena como componentes separados. En un proyecto arquitectónico, el sujeto puede ser una habitación, una fachada, una escalera o un patio. Describa brevemente los materiales, la hora del día y la calidad de la luz para establecer el contexto. Pedir que se añadan nuevos elementos arquitectónicos que no aparecen en la imagen puede entrar en conflicto con el objetivo de preservar el diseño.
Describa el movimiento con moderación. En la primera prueba, solicite un movimiento sutil: por ejemplo, que la luz avance lentamente por una pared o que las cortinas y las plantas se muevan apenas. La guía de referencia subraya que la acción describe lo que ocurre en el video. Por tanto, especifique qué se mueve y cómo, en lugar de recurrir a expresiones genéricas como «que sea cinematográfico».
Elija el comportamiento de la cámara. Puede indicar una toma fija, un paneo horizontal lento o un dolly. El movimiento de cámara influye en la percepción del espacio que muestra la imagen; por eso, no combine varios movimientos de cámara en un mismo prompt. Google señala que no garantiza oficialmente la compatibilidad con algunos ángulos de cámara avanzados y que la fiabilidad de los resultados puede variar.
Los siguientes ejemplos se han preparado para usos arquitectónicos en esta guía; no son prompts reproducidos literalmente de la fuente.
A calm architectural interior visualization of a contemporary living room, soft morning daylight slowly moving across the pale stone floor, sheer curtains gently shifting in a light breeze, preserve the room layout and materials, static wide shot, subtle natural motionEn este prompt, el único cambio principal es el avance de la luz del día por el suelo; el movimiento de las cortinas se mantiene secundario y sutil. La toma fija y amplia se centra en mostrar la distribución general del interior.
A contemporary timber house seen from the garden, leaves on nearby trees moving gently in the breeze, soft overcast daylight, preserve the façade design and proportions, slow truck right along the garden edge, restrained architectural visualizationEn este ejemplo de fachada, la cámara se desplaza lentamente hacia la derecha mientras las hojas de los árboles se mueven suavemente. Solicitar que se conserven las proporciones de la fachada pone en primer plano la función de la imagen como presentación del diseño; aun así, es necesario revisar el resultado.
A quiet courtyard in a contemporary residential project at golden hour, subtle movement in ornamental grasses, warm light changing gently on the paving, preserve the original landscape composition, static wide shot, realistic restrained motionEl prompt preparado para el patio describe un movimiento limitado en el paisaje y un cambio de luz. La cámara fija puede probarse en presentaciones en las que se quiera dar más protagonismo a la composición que al movimiento.
Envíe la imagen junto con los ajustes. En el ejemplo de la API, la solicitud incluye tanto el prompt de texto como la imagen de entrada, y la tarea se indica como
image_to_video. También se pueden añadir a la solicitud la relación de aspecto, la resolución y la duración. Para una prueba rápida se puede optar por 16:9 y una duración breve; son solo ajustes de ejemplo, no opciones necesariamente adecuadas para todos los trabajos.Espere a que termine el proceso y revise el resultado. La documentación indica que la generación de video puede tardar más de un minuto. Cuando termina una solicitud síncrona, la salida se obtiene en la respuesta; en las solicitudes asíncronas que se ejecutan en segundo plano, el resultado se consulta más adelante mediante el ID de interacción. Se indica que las solicitudes asíncronas se conservan durante un máximo de 14 días.
Errores frecuentes
Solicitar demasiados movimientos: Describir al mismo tiempo cambios de luz, movimientos de cámara, personas en movimiento y fenómenos meteorológicos puede dificultar la evaluación del resultado. Primero genere una versión con un solo movimiento; si funciona, añada otro elemento en una segunda prueba.
Describir la cámara de forma imprecisa: En lugar de «mueve la cámara», elija un movimiento concreto, como una toma fija, un paneo o un dolly. Los ángulos de cámara avanzados pueden no funcionar con la misma fiabilidad en todos los casos.
No comprobar la duración y la resolución: El ejemplo de la API establece una duración de entre 3 y 10 segundos. Antes de enviar la solicitud, compruebe las resoluciones y relaciones de aspecto que admite el modelo; la documentación indica que la resolución predeterminada es 720p si no se especifica.
Tratar el resultado como un documento de diseño: La generación de video anima una imagen, pero las fuentes no garantizan la precisión arquitectónica ni que los elementos del diseño permanezcan sin cambios en todos los fotogramas. Revise el clip generado como un borrador de narrativa visual, no como un dibujo técnico ni como un registro definitivo del proyecto.
Uso en flujos de trabajo de arquitectura y visualización
Este método puede probarse en estudios de arquitectura, entre arquitectos de interiores y artistas de visualización que quieran preparar un clip breve de presentación a partir de una imagen fija de un interior o una fachada. En las conversaciones sobre el diseño, un borrador animado puede ayudar a comunicar la luz, la atmósfera o la sensación espacial. Sin embargo, las fuentes disponibles no garantizan la precisión de los resultados en presentaciones profesionales ni que se conserven los detalles arquitectónicos en todas las escenas. Por ello, hay que comparar el resultado con las imágenes del proyecto y, si hace falta, volver a generarlo.
En el flujo de trabajo destacan dos aspectos prácticos: los requisitos de configuración, como el proyecto en la nube y el acceso a la API, y los ajustes de duración, resolución y relación de aspecto admitidos por el modelo. Las fuentes no explican los precios ni los requisitos de hardware local; en lugar de hacer suposiciones sobre estos aspectos, conviene consultar las condiciones vigentes del servicio y la configuración del proyecto antes de generar el video. El ejemplo de la API, que envía la imagen de entrada desde Cloud Storage, muestra que la ubicación del archivo también forma parte del proceso.
Próximos pasos
En la primera prueba, utilice la misma imagen y los mismos ajustes, y cambie únicamente la descripción del movimiento en el prompt. Así podrá comparar si influyen más en el resultado el movimiento de la cámara o la descripción de la luz. A continuación, pruebe la versión que considere adecuada con otros ajustes de duración o relación de aspecto. Si trabaja mediante REST, tenga presente la diferencia entre una solicitud síncrona, que devuelve el resultado de inmediato, y el método asíncrono, en el que el ID de interacción se consulta más adelante.
Fuentes y licencia
Este tutorial se ha adaptado al turco a partir de las guías oficiales de Google Cloud tituladas «Video generation prompt guide» y «Generate videos from an image». Ambas fuentes se ofrecen bajo la licencia CC BY 4.0. Los ejemplos de prompts arquitectónicos se han creado específicamente para este artículo.
Fuentes
2 fuentesNo republicamos los textos de las fuentes; las citas breves van marcadas y el resto es resumen y comentario propios.
El enfoque de convertir una imagen arquitectónica en un clip corto ofrece una forma práctica de experimentar, sobre todo para comunicar la atmósfera en presentaciones conceptuales. Sin embargo, las fuentes no garantizan que las decisiones de diseño de la imagen se conserven exactamente en todos los fotogramas; por eso, es mejor considerar el resultado un borrador narrativo controlado y no una validación del proyecto.
Para los estudios y estudiantes de Turquía, conviene tener en cuenta antes de empezar requisitos como un proyecto de Google Cloud, el acceso a la API y la disponibilidad del archivo de imagen en la nube. Como las fuentes no explican los precios ni los requisitos de hardware local, no se deben hacer suposiciones sobre los costos; hay que consultar las condiciones del servicio antes de generar el contenido.
Preguntas frecuentes
¿Se puede generar un video a partir de una imagen arquitectónica con Gemini Omni?
Sí. Según la documentación de Google Cloud, Gemini Omni y Veo pueden usar una imagen existente como primer fotograma del video.
¿Qué duraciones admite Gemini Omni para generar videos a partir de imágenes?
El ejemplo de la API indica una duración de entre 3 y 10 segundos, expresada como un valor entero.
¿Qué se necesita para generar videos con la API de Gemini Omni?
Se necesita una cuenta y un proyecto de Google Cloud, Agent Platform API habilitada y autenticación. El ejemplo de solicitud envía la imagen mediante un URI de Cloud Storage.



