En resumen
- Wan 2.2 es un modelo de código abierto que genera vídeo a partir de texto e imagen; su variante TI2V-5B puede producir vídeo a 720p y 24 fotogramas por segundo.
- El modelo TI2V-5B puede generar un vídeo de 5 segundos en 720p en menos de 9 minutos en una tarjeta gráfica de consumo como la RTX 4090.
- Los modelos MoE con 14B de parámetros activos, como T2V-A14B e I2V-A14B, requieren al menos 80GB de VRAM en una sola GPU o una configuración multi-GPU/en la nube.
- FLUX Krea Dev es una variante del modelo FLUX que, según se indica, produce imágenes de mejor calidad que el FLUX Dev estándar, mediante una configuración basada en SwarmUI y ComfyUI.
Qué aprenderá en este artículo
Aprenderá a instalar el modelo de generación de vídeo de código abierto Wan 2.2 y el modelo de generación de imágenes FLUX Krea Dev mediante la interfaz SwarmUI y la infraestructura ComfyUI, para producir imágenes conceptuales y animaciones cortas con movimiento de cámara. Esta guía se basa en el manual de instalación de licencia abierta elaborado por Furkan Gözükara (MonsterMMORPG) y en la documentación oficial del modelo de Wan-AI. En las fuentes originales se mencionan como usos de estas herramientas el arte digital, la publicidad, la previsualización cinematográfica, el desarrollo de videojuegos y el contenido para redes sociales; los ejemplos de prompts centrados en arquitectura e interiorismo de este artículo han sido adaptados específicamente para los lectores de 3dsınıfı a partir de las técnicas documentadas.
Requisitos
Tarjeta gráfica NVIDIA: para la variante TI2V-5B de Wan 2.2 se recomienda una RTX 4090 con 24GB de VRAM.
Un sistema con Python, Git, CUDA y FFMPEG instalados.
Instalador automático de un solo clic para SwarmUI y ComfyUI (compartido en la guía a través de Patreon).
Cuenta en Hugging Face o ModelScope para descargar los pesos del modelo.
Para los modelos más grandes de Wan 2.2 (T2V-A14B, I2V-A14B): al menos 80GB de VRAM en una sola GPU o una configuración multi-GPU/en la nube.
Opcional: clave de API de Dashscope o un modelo Qwen local para la expansión de prompts.
Instalación paso a paso
Instale los requisitos previos. Instale Python, Git, CUDA y FFMPEG en su sistema.
Instale ComfyUI y SwarmUI. El instalador de un solo clic compartido en la guía incluye soporte para Flash Attention, Sage Attention, xFormers, Triton y DeepSpeed; también son compatibles las tarjetas de la serie RTX 5000.
Conecte el backend de SwarmUI con ComfyUI. En el tutorial en vídeo este paso se trata como un apartado independiente; durante la instalación debe seleccionar el backend de ComfyUI dentro de SwarmUI y completar la conexión.
Descargue los modelos. Según su hardware, elija y descargue TI2V-5B (para una sola GPU de consumo) o T2V-A14B / I2V-A14B (para multi-GPU o la nube).
Importe el paquete de preajustes (presets) listo para usar. Estos preajustes, preparados tras cientos de pruebas de parámetros, permiten obtener resultados de alta calidad sin necesidad de ajustes manuales.
Inicie su primera generación y controle el uso de la GPU observando los registros (logs) de la consola; si detecta un uso bajo de la GPU, aplique los pasos de optimización descritos en la guía.
Ejemplos de prompts para imágenes y animaciones arquitectónicas
Los siguientes prompts se han elaborado específicamente para uso arquitectónico a partir de las técnicas descritas en las fuentes (movimiento de cámara, definición de iluminación, estilo cinematográfico); los textos originales no incluyen ejemplos arquitectónicos directos.
1. Imagen conceptual de interior con FLUX Krea Dev
A modern minimalist living room interior, floor-to-ceiling windows, warm afternoon sunlight, oak flooring, cinematic lighting, photorealistic architectural visualization, ultra detailedEste prompt resalta los detalles de luz y materiales en la generación de texto a imagen de FLUX Krea Dev; permite crear rápidamente una imagen conceptual para presentaciones de interiorismo.
2. Movimiento de cámara con Wan 2.2 Image-to-Video
Slow dolly-in camera movement through a contemporary house entrance hall, soft natural light shifting across concrete walls, gentle motion blur, cinematic color grading, 24fps realistic videoSi alimenta este prompt con una imagen de render existente en modo Image-to-Video, puede obtener una animación con un lento acercamiento de cámara (dolly-in) en el vestíbulo de entrada; el modelo es capaz de aplicar movimientos de cámara como dolly y pan con precisión matemática.
3. Presentación exterior con Wan 2.2 Text-to-Video
A drone shot slowly rising above a glass pavilion surrounded by a garden, golden hour lighting, smooth camera pan, photorealistic rendering, architectural visualization styleEste prompt puede usarse para crear, desde cero mediante generación de texto a vídeo, una animación de presentación exterior; las descripciones de iluminación de hora dorada y movimiento de panorámica lenta activan el control cinematográfico del modelo.
4. Ejemplo de línea de comandos para la expansión de prompts
python generate.py --task t2v-A14B --size 1280*720 --ckpt_dir ./Wan2.2-T2V-A14B --offload_model True --convert_model_dtype --prompt "A drone shot slowly rising above a glass pavilion surrounded by a garden, golden hour lighting"En GPU individuales con poca VRAM, los parámetros --offload_model True y --convert_model_dtype de este comando reducen el uso de memoria; si se activa la expansión de prompts, el modelo enriquece automáticamente las descripciones.
Errores comunes
Intentar ejecutar los modelos A14B en una sola GPU con menos de 80GB de VRAM sin usar los parámetros de offload provoca errores de memoria.
Elegir una resolución inadecuada para el hardware (por ejemplo, 720p directo con T2V-A14B en una tarjeta de consumo) ralentiza enormemente la generación.
No utilizar nunca la expansión de prompts (prompt extension) puede hacer que los detalles de la escena resulten insuficientes.
Continuar generando sin notar que el uso de la GPU se mantiene bajo; la guía recomienda en ese caso seguir los pasos de optimización.
Próximos pasos
Puede probar a personalizar los preajustes según sus propios proyectos, entrenar un LoRA sobre FLUX Krea Dev para el estilo propio de su oficina, y reducir los tiempos de generación con opciones de aceleración como TeaCache.
Fuente y licencia
Esta guía ha sido adaptada al español bajo licencia Apache-2.0 a partir de la documentación oficial del modelo Wan2.2-T2V-A14B del equipo de Wan-AI en Hugging Face y del artículo comunitario "Wan 2.2 & FLUX Krea Full Tutorial", publicado en Hugging Face por Furkan Gözükara (MonsterMMORPG).
Fuentes
3 fuentesNo republicamos los textos de las fuentes; las citas breves van marcadas y el resto es resumen y comentario propios.
Para las oficinas y visualizadores independientes en Turquía, Wan 2.2 y FLUX Krea Dev pueden resultar una opción interesante para quienes quieran probar la generación rápida de imágenes conceptuales y animaciones de presentación cortas; sin embargo, conviene recordar que las fuentes no presentan estas herramientas como un caso de uso específico para arquitectura, sino que sus aplicaciones se describen de forma general como arte digital, publicidad, previsualización cinematográfica y desarrollo de videojuegos. Que TI2V-5B pueda funcionar con una sola RTX 4090 supone una ventaja de costes para oficinas pequeñas que quieran experimentar sin invertir en grandes granjas de renderizado. En cambio, el hecho de que los modelos A14B requieran 80GB de VRAM o multi-GPU llevará a quienes busquen ese nivel de calidad hacia servicios en la nube.
Que sea de código abierto significa que se puede experimentar sin coste de licencia; pero la instalación, que requiere conocimientos técnicos (Python, CUDA, ComfyUI), puede dificultar su integración directa en el flujo de trabajo de presentaciones arquitectónicas. Para las oficinas, probar primero estas herramientas en un pequeño proyecto piloto, en paralelo al flujo de renderizado existente, reducirá la pérdida de tiempo.
Preguntas frecuentes
¿En qué hardware puedo ejecutar Wan 2.2?
El modelo TI2V-5B puede funcionar en una GPU de consumo con 24GB de VRAM, como la RTX 4090, mientras que los modelos MoE como T2V-A14B e I2V-A14B requieren al menos 80GB de VRAM en una sola GPU o una configuración multi-GPU/en la nube.
¿En qué se diferencia FLUX Krea Dev del FLUX Dev estándar?
Según la guía, FLUX Krea Dev es una variante del modelo que produce imágenes notablemente mejores en comparación con el FLUX Dev estándar.
¿Cuántos segundos de vídeo se pueden generar con Wan 2.2?
Wan 2.2 puede generar vídeos de hasta 5 segundos en resoluciones de 480p y 720p; el modelo TI2V-5B puede completar un vídeo de 5 segundos en 720p en menos de 9 minutos en una sola GPU de consumo.



