En resumen
- Gemini Omni y algunos modelos de Veo pueden usar una imagen existente como primer fotograma de un video.
- La duración de video indicada para Gemini Omni 1.1 Flash Preview se puede elegir entre 3 y 10 segundos.
- En una solicitud a la API se puede especificar una relación de aspecto de 16:9 o 9:16; si no se indica la resolución, el valor predeterminado es 720p.
- El prompt se puede estructurar con descripciones del sujeto, el movimiento, la escena y la cámara.
¿Qué aprenderás en esta guía?
Aprenderás a usar un render de interiores o una imagen arquitectónica como fotograma inicial de un video corto y, después, a describir con texto qué debe cambiar en el video. Según la documentación de Google, Gemini Omni y Veo admiten la generación de videos a partir de imágenes existentes. Este flujo de trabajo está pensado para arquitectos, diseñadores de interiores y artistas de visualización que quieran animar directamente una imagen.
Hay una diferencia fundamental: en lugar de limitarte a escribir un prompt de video, proporcionas una imagen existente como fotograma inicial y describes el movimiento por separado. El prompt puede explicar qué aparece, qué hace, dónde y cuándo transcurre la escena y cómo se comporta la cámara. No es necesario incluir todos estos elementos en cada prompt, pero considerarlos por separado ayuda a comunicar con más claridad qué quieres que cambie.
Requisitos y selección del modelo
Es necesario iniciar sesión con una cuenta de Google Cloud y seleccionar o crear un proyecto de Google Cloud. Si se trabaja mediante la API, también hay que habilitar Agent Platform API y configurar la autenticación del entorno. La documentación indica que no es necesario configurar la autenticación por separado si se usa la consola; para los ejemplos REST, se pueden usar las credenciales de Google Cloud CLI.
La generación de videos a partir de imágenes está disponible a través de Gemini Enterprise Agent Platform Media Studio o de la API de generación de videos. En esta guía usamos gemini-omni-1.1-flash-preview, cuyo nombre de modelo se indica explícitamente. Entre las demás opciones que la documentación enumera como compatibles con esta función se encuentran Veo 3.1 Lite, Veo 3.1, Veo 3.1 Fast, Veo 3.0 y Veo 3.0 Fast. Para obtener información no especificada aquí sobre acceso a modelos, condiciones de la cuenta y costos de uso, consulta la información actualizada de los productos de Google Cloud.
En el ejemplo de la API, la imagen de entrada se proporciona mediante una dirección de Cloud Storage y el tipo MIME se muestra como image/png. Para Gemini Omni 1.1 Flash Preview, las resoluciones disponibles son 360p, 720p, 1080p y 4K; las relaciones de aspecto disponibles son 16:9 y 9:16. Si no se indica una resolución, el valor predeterminado es 720p. La duración del video se puede ajustar en segundos enteros, entre 3 y 10. Estos son parámetros de la API descritos en la documentación; no debe suponerse que las mismas opciones están disponibles en otros modelos o interfaces.
Generación de videos a partir de imágenes arquitectónicas, paso a paso
Elige la imagen inicial. Selecciona la imagen arquitectónica que quieras usar. Puede ser, por ejemplo, una perspectiva de un interior o una visualización de la fachada de un edificio. La imagen se utilizará como primer fotograma del video. Anota de antemano qué elementos quieres que se muevan: árboles, cortinas, la superficie del agua o la cámara, por ejemplo.
Elige el método de generación. Usa Media Studio si vas a trabajar desde la interfaz, o la API si quieres configurar un flujo de trabajo programático. Para usar la API, debes seleccionar un proyecto y habilitar Agent Platform API. También hay que configurar la autenticación para usar REST. En el ejemplo de la API para generar videos a partir de imágenes, la solicitud se envía con la tarea
image_to_video.Divide el prompt en componentes. La guía de prompts de Google aborda elementos como el sujeto, la acción, la escena o el contexto, el ángulo de cámara y el movimiento de cámara. En una escena arquitectónica, el “sujeto” puede ser el espacio o el edificio; la “acción” describe el movimiento que esperas ver. Después, añade detalles de la escena, como la luz diurna, el clima y el entorno, así como indicaciones de cámara, por ejemplo, un plano fijo o un movimiento lento.
Usa el siguiente ejemplo como punto de partida. Prueba cada prompt por separado para evaluar qué descripción da un resultado más coherente con la imagen.
A calm architectural interior, sheer curtains moving gently in a light breeze, soft morning daylight shifting across the timber floor, wide shot, static camera, preserve the original room layout and material paletteEn este ejemplo, el espacio es el sujeto; el movimiento de las cortinas, la acción; la luz matinal, la descripción de la escena; y el plano amplio y la cámara fija, las decisiones de encuadre. El prompt se centra en generar un movimiento pequeño y controlado a partir de una presentación arquitectónica estática.
Limita el movimiento en exteriores. Describir el movimiento del entorno en lugar del edificio aclara qué elemento de la escena debe animarse.
A contemporary house in a landscaped garden, leaves and tall grasses moving gently in the wind, late afternoon light, a slow dolly in toward the entrance, wide establishing shotAquí se describen por separado el movimiento de las plantas, la luz y el acercamiento de la cámara al edificio. “Dolly in” se refiere al desplazamiento físico de la cámara hacia el sujeto; no debe confundirse con el zoom, que solo amplía la imagen.
Ajusta los parámetros de la API según el resultado que buscas. En la solicitud se especifican el identificador del modelo, el prompt de texto y la imagen de entrada; se define el tipo de salida como video y se selecciona la tarea
image_to_video. Para una presentación horizontal, se puede usar la opción 16:9 indicada en la documentación; para compartir en formato vertical, la opción 9:16. Indica una duración de entre 3 y 10 segundos. Si no especificas la resolución de salida, en el ejemplo de la API se usa 720p como valor predeterminado.Sigue la generación y revisa el resultado. Google indica que la generación de videos puede tardar más de un minuto. En una solicitud síncrona, el video se puede descargar cuando está listo; en una solicitud asíncrona se utiliza un parámetro de fondo y el resultado se puede consultar más tarde mediante un identificador de interacción. Se indica que las solicitudes asíncronas se conservan hasta 14 días. Antes de usar el resultado en una presentación, comprueba que las formas arquitectónicas, los materiales y los movimientos sean coherentes con la imagen inicial.
Errores frecuentes
Reducir el prompt a una sola frase ambigua: Una descripción general como “crea un video arquitectónico bonito” no especifica por separado el sujeto, el movimiento, el entorno ni las decisiones de cámara. En su lugar, indica claramente qué elemento debe moverse y si la cámara debe permanecer fija o desplazarse.
Usar indicaciones de cámara incompatibles: Pedir en el mismo prompt que la cámara permanezca fija y que se acerque al edificio puede generar una contradicción. Primero elige un único comportamiento de cámara y, después de ver el resultado, prueba otra opción.
Olvidar la duración y la relación de aspecto: En la API, la duración se elige entre 3 y 10 segundos; la documentación indica que, si no se especifica la relación de aspecto, esta se puede inferir del prompt. Aun así, si el resultado debe ser horizontal o vertical, indicarlo explícitamente permite hacer una prueba más controlada.
Dar por hecho que el resultado será idéntico a la imagen de origen: La documentación explica cómo usar una imagen como primer fotograma y guiar la generación con un prompt; no garantiza que la geometría arquitectónica o los materiales se conserven exactamente en todas las circunstancias. Por ello, revisa detenidamente el video generado antes de una presentación importante o de entregarlo a un cliente.
Próximos pasos: ¿dónde encaja en un flujo de trabajo arquitectónico?
Este método puede probarse en equipos de arquitectura e interiorismo que quieran crear alternativas de presentación añadiendo movimiento ambiental breve a una imagen estática. Es posible generar distintos prompts para explorar el movimiento de cámara, los cambios de iluminación o el movimiento de elementos de la escena, como plantas y cortinas. Sin embargo, hay que verificar que la imagen de origen y el video respeten la geometría del proyecto; no consideres el resultado un plano técnico, una medición ni un documento de diseño definitivo.
Estudiantes y artistas de visualización pueden probar diferentes indicaciones de movimiento y cámara a partir del mismo fotograma inicial. En las oficinas, conviene evaluar de antemano con qué cuenta y servicio se procesarán las imágenes del proyecto, las condiciones de acceso y los posibles costos de uso. Como las fuentes no incluyen información sobre precios, hay que consultar las condiciones actuales del producto para calcular el presupuesto. Si se opta por la API, también deben incorporarse al flujo de trabajo los pasos de configuración del proyecto, habilitación de la API y autenticación.
Fuente y licencia
Esta guía se ha adaptado al turco a partir de la información de las páginas “Video generation prompt guide” y “Generate videos from an image” de Google Cloud. Ambas fuentes se publican con licencia CC BY 4.0.
Fuentes
2 fuentesNo republicamos los textos de las fuentes; las citas breves van marcadas y el resto es resumen y comentario propios.
Para los estudios de arquitectura e interiorismo, la utilidad práctica de este enfoque es poder generar alternativas breves de presentación a partir de un render existente. Describir mediante el prompt el movimiento de cámara y del entorno puede ser útil para los equipos que quieran probar otra forma de presentar una imagen estática. Sin embargo, no debe suponerse que el resultado conserva exactamente la geometría del diseño y las decisiones sobre materiales; es imprescindible revisarlo antes de entregarlo.
Los estudios y estudiantes de Turquía deben aclarar el acceso a Google Cloud, los pasos de configuración de la API y las tarifas de uso vigentes antes de empezar a hacer pruebas. Las fuentes no incluyen información sobre precios. Además, que exista una opción 4K no significa que sea necesaria en todos los flujos de trabajo; la resolución y la duración deben elegirse según el uso previsto.
Preguntas frecuentes
¿Se puede generar un video a partir de una imagen con Gemini Omni?
Sí. Según la documentación de Google, Gemini Omni permite generar un video usando una imagen existente como primer fotograma. Esta función está disponible a través de Media Studio o de la API.
¿Cuántos segundos puede durar un video de Gemini Omni 1.1 Flash Preview?
En la documentación de la API, la duración se puede ajustar entre 3 y 10 segundos, en segundos enteros.
¿Qué resoluciones están disponibles para generar videos a partir de imágenes?
Para Gemini Omni 1.1 Flash Preview se enumeran las opciones 360p, 720p, 1080p y 4K. Si no se especifica la resolución, el valor predeterminado es 720p.


