Wan 2.2 en ComfyUI: guía completa del flujo de trabajo paso a paso para T2V e I2V (2026)
Configura Wan 2.2 en ComfyUI desde cero con esta guía detallada: instalación, modelos, grafos de nodos para texto a video (T2V) e imagen a video (I2V), optimización con GGUF y LightX2V, y solución de errores frecuentes.

Descargaste ComfyUI. Encontraste un flujo de trabajo de Wan 2.2 en GitHub o CivitAI. Lo importaste con ilusión. Y el grafo se llenó de nodos en rojo. El modelo no carga. Falta el VAE. El nodo de muestreo escupe un "unsupported dtype". Alguien en un foro suelta un "solo usa el workflow oficial" que enlaza a una página que ya probaste y tampoco funcionó.
Suena familiar. Es el camino que casi todos recorremos al montar Wan 2.2 en ComfyUI por primera vez. No es recto, no es rápido, y la mayoría de las guías se saltan la media hora de errores de nodos que la gente se come en silencio.
Monté Wan 2.2 en cuatro entornos distintos — Windows nativo, Linux con Docker, RunPod en la nube y una RTX 4090 local — y fui anotando cada error, cada dependencia que faltaba y cada rareza del flujo de trabajo. Esta guía es lo que me habría ahorrado días de prueba y error la primera vez.
Léela una vez. En menos de 20 minutos pasas de una instalación limpia de ComfyUI a generar tu primer video con Wan 2.2.
Lo que necesitas antes de arrancar: 3 requisitos que te ahorrarán dolores de cabeza
Antes de tocar un solo nodo, asegúrate de cumplir estos tres puntos. Saltarte cualquiera de ellos es la causa número uno de configuraciones fallidas.
Hardware: la base de todo
| Componente | Mínimo | Recomendado |
|---|---|---|
| VRAM | 12 GB (con GGUF + LightX2V) | 16+ GB |
| RAM | 32 GB | 64 GB |
| Almacenamiento | 30 GB libres para modelos | 60+ GB para varios checkpoints |
| SO | Windows / Linux / macOS | Linux (mejor rendimiento en inferencia) |
El punto crítico: el modelo 14B de Wan 2.2 en FP8 necesita entre 14 y 16 GB de VRAM para generar texto a video en 480p. Si tienes menos de 12 GB, no queda otra: necesitarás modelos cuantizados GGUF y el LoRA destilado LightX2V. Los dos los cubrimos en el Paso 5.
Si tu tarjeta tiene 8 GB o usas un Apple Silicon con menos de 16 GB de memoria unificada, Wan 2.2 en ComfyUI no será usable a ninguna resolución práctica. En ese caso salta directamente a la alternativa en la nube que tienes al final de la guía.
Software: lo que ya deberías tener
- ComfyUI — la versión standalone o portable más reciente (mejor no uses la que viene incluida en Stability Matrix a menos que sepas gestionar nodos personalizados a mano)
- Git — para clonar repositorios de nodos personalizados
- Python 3.10–3.11 — ComfyUI trae el suyo, pero puedes confirmarlo con
python --versiondentro del entorno virtual - PyTorch 2.x con CUDA — ComfyUI lo instala solo al arrancar por primera vez en sistemas con GPU
Modelos que tienes que descargar
Necesitas como mínimo un modelo de difusión y un VAE. Los enlaces son de Hugging Face — puedes usar git lfs o descarga directa desde el navegador.
| Archivo | Tamaño | Para qué sirve | Descarga |
|---|---|---|---|
| wan2.2_t2v_14B_fp8_scaled.safetensors | ~14 GB | Modelo de difusión texto a video | Hugging Face |
| wan2.2_i2v_14B_fp8_scaled.safetensors | ~14 GB | Modelo de difusión imagen a video | Hugging Face |
| wan2.2_vae.safetensors | ~320 MB | Decodificador VAE de video | Hugging Face |
Dónde va cada cosa: los modelos de difusión van en ComfyUI/models/diffusion_models/ y el VAE en ComfyUI/models/vae/. Si las carpetas no existen, créalas.
¿Por qué las conversiones de Kijai? Los lanzamientos oficiales de Alibaba usan una disposición de tensores distinta a la que espera ComfyUI. El repositorio de Kijai en Hugging Face tiene los formatos ya convertidos que los nodos nativos de Wan en ComfyUI pueden leer sin necesidad de conversión manual. Si usas los checkpoints originales de Alibaba directamente, te van a saltar errores de nodos a menos que instales también el paquete de nodos personalizados de Alibaba. Para una primera configuración, las conversiones de Kijai te ahorran unos 30 minutos de dolores de cabeza.
Paso 1: instalar ComfyUI 0.3.5+ con soporte nativo para WanVideo
Wan 2.2 necesita ComfyUI versión 0.3.5 o superior. Si ya tienes ComfyUI instalado:
# Ve al directorio de ComfyUI
cd ComfyUI
# Actualiza a la última versión
git pull
# Actualiza dependencias
pip install -r requirements.txtSi partes de cero:
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
pip install -r requirements.txtPara comprobar que Wan está soportado, arranca ComfyUI y revisa la salida del terminal. Busca WanVideo en la lista de nodos cargados. Si ves algo como:
[ComfyUI] Loaded WanVideoLoader
[ComfyUI] Loaded WanVideoSamplerTodo correcto: el soporte nativo de Wan 2.2 está activo. Si no ves esas líneas, actualiza ComfyUI y reinicia.
¿Por qué usar nodos nativos y no personalizados? ComfyUI incorporó los nodos WanVideo nativos en la versión 0.3.5. Los mantiene el equipo principal de ComfyUI, son compatibles con todas las plataformas y se actualizan con cada lanzamiento. Guías más antiguas recomendaban ComfyUI-WanPlugin o los nodos WAN de Kijai — siguen funcionando, pero los nativos tienen menos conflictos de dependencias y reciben actualizaciones con cada release. Usa los nativos a menos que necesites una funcionalidad concreta que solo den los plugins.
Paso 2: colocar los modelos en las carpetas correctas (o te lloverán errores)
El problema de configuración más frecuente en ComfyUI son las rutas de los archivos. Los nodos WanVideo nativos esperan los modelos en directorios muy concretos.
ComfyUI/
├── models/
│ ├── diffusion_models/
│ │ ├── wan2.2_t2v_14B_fp8_scaled.safetensors
│ │ └── wan2.2_i2v_14B_fp8_scaled.safetensors
│ ├── vae/
│ │ └── wan2.2_vae.safetensors
│ └── clip/
│ └── (ComfyUI descarga los modelos CLIP automáticamente)
├── custom_nodes/
│ └── (ComfyUI-Manager recomendado pero opcional)
└── output/
└── (aquí aparecen los videos generados)Reglas prácticas para organizar los archivos:
- Los modelos de difusión van siempre en
diffusion_models/, nunca encheckpoints/. El nodo WanVideoLoader busca específicamente ahí. - El nombre del VAE tiene que coincidir con lo que espera el nodo WanVideo.
wan2.2_vae.safetensorses el nombre canónico que usa el repositorio de Kijai. Si lo renombras, te saltará un error "VAE not found". - Los modelos CLIP se descargan solos la primera vez que ejecutas ComfyUI — no hace falta que los descargues a mano.
Un error muy común: poner el modelo I2V en diffusion_models/ pero con el nombre mal. El nodo WanVideoLoader para imagen a video espera un nombre concreto. Déjalo exactamente como se descargó — no lo renombres.
Paso 3: monta un flujo T2V que valide tu configuración en 2 minutos
Con los modelos ya colocados, construye el flujo de trabajo más simple posible: texto a video en 480p. Esto te confirma que todo funciona antes de añadir complejidad.
Grafo de nodos (mínimo viable)
[CLIP Text Encode (Wan)] ──→ [WanVideo Sampler] ──→ [WanVideo Decode] ──→ [Video Combine]
↑
[WanVideo Loader] ──────────────────→│Configuración detallada de cada nodo
1. WanVideo Loader
model:wan2.2_t2v_14B_fp8_scaled.safetensorsvae:wan2.2_vae.safetensorsdtype:fp8_e4m3fn(valor por defecto, funciona en tarjetas de 16 GB)
2. CLIP Text Encode (Wan) — ojo: usa el nodo de codificador de texto específico de Wan, no el CLIPTextEncode estándar. El estándar da resultados incoherentes porque usa el tokenizador incorrecto.
text: Escribe un prompt detallado con esta estructura de cuatro capas: sujeto → acción → cámara → escena. Por ejemplo:"Una joven con el pelo corto plateado y gafas redondas levanta la vista de un libro, sonríe suavemente, plano cerrado estático con poca profundidad de campo, luz cálida de tarde entrando por una ventana, sombras suaves, grano de película"
width: 720 (resolución nativa de entrenamiento, evita el letterboxing)height: 480
3. WanVideo Sampler
seed: Aleatorio (pon un valor fijo si quieres resultados reproducibles)steps: 30 (punto de partida; entre 20 y 50 se obtienen resultados utilizables)cfg: 5.0 (Wan 2.2 funciona bien con CFG entre 4 y 6; valores más bajos dan resultados más creativos pero menos fieles al prompt)sampler_name:eulerscheduler:sgm_uniformdenoise: 1.0frames: 81 (unos 5 segundos a 16 fps; mejor si es divisible entre 3 por la arquitectura de Wan)fps: 16
4. WanVideo Decode
- Se conecta solo desde la salida del sampler y el VAE
5. Video Combine
frame_rate: 16format:video/h264-mp4
Primera generación de prueba
Ejecuta el flujo. Si todo está bien, ComfyUI te genera un MP4 de 5 segundos en unos 90–120 segundos en una RTX 4090.
Resultado esperado: un clip corto que se corresponda con tu prompt, a 720×480 de resolución.
Si en lugar de eso obtienes una pantalla negra, un resultado distorsionado o un archivo vacío, salta directamente a la sección de solución de problemas antes de tocar nada.
Paso 4: pasar a imagen a video con solo 3 cambios en los nodos
El flujo de imagen a video sigue la misma estructura, pero cambia el codificador de texto por un nodo de entrada de imagen.
Grafo de nodos
[Load Image] ────────────→ [WanVideo Sampler]
↑
[CLIP Text Encode (Wan)] ─────────┤
│
[WanVideo Loader] ────────────────→│
│
[WanVideo Decode] ←────────────────┤
│
[Video Combine]Diferencias clave con T2V
-
Cambio de modelo. Carga
wan2.2_i2v_14B_fp8_scaled.safetensorsen el WanVideo Loader. El modelo T2V no acepta entradas de imagen — si usas el modelo equivocado, te sale un error de conexión de nodo. -
Entrada de imagen. Añade un nodo Load Image y conéctalo a la entrada
imagedel WanVideo Sampler. La imagen debería ser de 720×480 (o una relación de aspecto parecida) para mejores resultados. Wan 2.2 recorta las relaciones que no coinciden centrándolas. -
Estilo del prompt. Como la imagen ya contiene la apariencia del sujeto, el prompt se centra en el movimiento, la cámara y la escena. En lugar de "una mujer con pelo plateado", describe lo que hace:
"Levanta la vista del libro, sonríe suavemente, plano cerrado estático con poca profundidad de campo, luz cálida de tarde"
Es justo lo contrario que en T2V — en I2V la imagen se encarga del sujeto y el prompt de todo lo demás.
-
Número de fotogramas. I2V funciona mejor con 41–81 fotogramas (2.5–5 segundos). Las generaciones más largas tienden a desviarse de la imagen de referencia.
Paso 5: optimizar para 12 GB de VRAM con GGUF y LightX2V
Si tienes 12 GB de VRAM, o simplemente quieres generar más rápido sin perder calidad, estas dos optimizaciones hacen que Wan 2.2 funcione en hardware de gama media.
Opción A: cuantización GGUF
Los modelos cuantizados GGUF sacrifican un poquito de calidad a cambio de usar mucha menos VRAM. Las variantes q8_0 y q4_0 son las más populares.
| Variante | VRAM usada | Calidad vs FP8 | Tamaño de archivo |
|---|---|---|---|
| FP8 (completo) | ~15 GB | Referencia | ~14 GB |
| GGUF q8_0 | ~11 GB | ~98 % | ~8 GB |
| GGUF q4_0 | ~8 GB | ~93 % | ~5 GB |
| GGUF q4_k_m | ~8.5 GB | ~95 % | ~5.5 GB |
Cómo se configura:
-
Descarga la variante GGUF desde Hugging Face:
-
Colócalos en
ComfyUI/models/diffusion_models/— la misma carpeta que los archivos safetensors. -
En el nodo WanVideo Loader, selecciona
dtypecomoq8_0oq4_0según el archivo que hayas descargado.
Regla práctica: empieza con q8_0. Mantiene aproximadamente el 98 % de la calidad de FP8 y reduce el consumo de VRAM un 25 %. Solo baja a q4_0 si tienes menos de 12 GB de VRAM o te tropiezas con errores de memoria insuficiente a la resolución que quieres usar.
Opción B: LightX2V, el LoRA destilado
LightX2V es un LoRA destilado que reduce los pasos de inferencia necesarios para obtener un buen resultado con Wan 2.2. En lugar de 30 pasos de denoising, consigue resultados comparables con solo 4–6 pasos.
Traducción: generas de 5 a 6 veces más rápido, gastando más o menos la misma VRAM.
Cómo se configura:
-
Descarga los archivos LoRA de LightX2V desde Hugging Face:
- Low noise:
wan2.2_i2v_lightx2v_4steps_lora_v1_low_noise.safetensors - High noise:
wan2.2_i2v_lightx2v_4steps_lora_v1_high_noise.safetensors
- Low noise:
-
Colócalos en
ComfyUI/models/loras/. -
Añade un nodo LoRA Loader entre WanVideo Loader y WanVideo Sampler:
- Carga el modelo de difusión en el LoRA Loader
- Selecciona
wan2.2_i2v_lightx2v_4steps_lora_v1_low_noise.safetensors - Pon la fuerza en 1.0 (el LoRA está diseñado para aplicarse al máximo)
- Conecta la salida al WanVideo Sampler
-
En el WanVideo Sampler, reduce
stepsa 4.
Consejo de experto. LightX2V + GGUF q8_0 es la combinación más práctica para configuraciones de 12 GB. Juntos meten Wan 2.2 I2V en unos 11 GB de VRAM y generan un clip de 5 segundos en 20–25 segundos — frente a los 90–120 segundos de la configuración FP8 completa. La calidad se nota si la miras con lupa (un pelín menos de detalle en escenas complejas), pero es increíble teniendo en cuenta que funciona en hardware de gama media.
Solución de problemas: cómo arreglar los 6 errores más comunes de Wan 2.2 en ComfyUI
Da igual cómo lo montes, toda configuración de Wan 2.2 en ComfyUI se topa con al menos uno de estos errores. Aquí tienes exactamente qué hacer en cada caso.
Error 1: "No module named 'wan'"
Qué pasa: ComfyUI arranca, pero los nodos WanVideo aparecen en rojo con errores de módulo faltante.
Por qué ocurre: tu versión de ComfyUI es anterior a la 0.3.5, o la integración de WanVideo no se compiló durante la instalación.
Cómo solucionarlo:
- Comprueba la versión de ComfyUI: busca
__version__enComfyUI/__init__.py. Tiene que ser 0.3.5 o superior. - Actualiza:
git pullen el directorio de ComfyUI y luegopip install -r requirements.txt. - Reinicia ComfyUI. Si el error sigue, puede que la compilación de PyTorch CUDA esté desactualizada — ejecuta
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu124.
Error 2: el video sale negro o verde
Qué pasa: el flujo se ejecuta sin errores, pero el video que obtienes es de un color sólido.
Por qué ocurre: el VAE no es el que toca. Lo más frecuente es estar usando un VAE que no es de Wan (el VAE por defecto de ComfyUI) en lugar de wan2.2_vae.safetensors.
Cómo solucionarlo:
- Asegúrate de que el nodo WanVideo Decode tiene seleccionado
wan2.2_vae.safetensors, no el VAE por defecto de ComfyUI. - Verifica que el archivo VAE está en
ComfyUI/models/vae/y se llama exactamentewan2.2_vae.safetensors. - En el WanVideo Loader, configura
dtypepara que coincida con tu archivo:fp8_e4m3fnpara safetensors FP8,q8_0para GGUF q8_0.
Error 3: "CUDA out of memory"
Qué pasa: la generación arranca, corre unos segundos, y luego falla con un error CUDA OOM.
Por qué ocurre: no tienes suficiente VRAM para la combinación de modelo y resolución que estás usando.
Cómo solucionarlo (pruébalos en este orden):
- Baja la resolución: prueba 512×288 en lugar de 720×480. Te ahorras aproximadamente un 35 % de VRAM.
- Reduce los fotogramas: pasa de 81 a 41 (2.5 segundos). Esto resta un 20 % de VRAM.
- Cambia a GGUF q8_0 (lo vimos en el Paso 5). Es el cambio individual que más impacto tiene.
- Si aún así falla, cambia a GGUF q4_0. Por debajo de eso, el modelo ya no es usable en GPUs de consumo.
Regla práctica: cada salto de resolución de 480p a 720p con el mismo número de fotogramas exige unos 4 GB adicionales de VRAM. Prueba primero en 480p, confirma que funciona, y luego escala.
Error 4: el video tiene artefactos o distorsión
Qué pasa: el video se reproduce pero se ven distorsiones — las caras se deforman, el fondo parpadea, los objetos se distorsionan cerca de los bordes.
Por qué ocurre: casi siempre es un desajuste entre CFG y pasos. Demasiados pocos pasos o un CFG demasiado alto crea artefactos.
Cómo solucionarlo:
- Sube los pasos a 40–50 (no te quedes en 30). Más pasos = más ciclos de refinamiento.
- Baja el CFG a 4.0–4.5.
- Revisa que tu prompt no tenga contradicciones (por ejemplo, "lentamente" y "rápidamente" en la misma descripción de movimiento).
Regla práctica: si ves distorsión, baja el CFG antes de subir los pasos. CFG 4.0 con 40 pasos da resultados más limpios que CFG 5.0 con 30 pasos con el mismo prompt. Un CFG alto (más de 5.5) combinado con menos de 25 pasos es el desencadenante de artefactos más común.
Error 5: el modelo I2V ignora la imagen de referencia
Qué pasa: el flujo I2V se ejecuta, pero el resultado no se parece en nada a la imagen que metiste. El modelo la ignora por completo.
Por qué ocurre: cargaste el modelo T2V en lugar del I2V. El modelo T2V no tiene una ruta de condicionamiento de imagen, así que en silencio vuelve a generar solo con texto.
Cómo solucionarlo: cambia el WanVideo Loader a wan2.2_i2v_14B_fp8_scaled.safetensors. Es el error más común en I2V y el más fácil de arreglar.
Error 6: "Could not find CLIP model"
Qué pasa: el nodo WanVideo Loader muestra un error diciendo que no encuentra el modelo CLIP.
Por qué ocurre: ComfyUI necesita descargar el modelo CLIP pero falló por problemas de red o de disco.
Cómo solucionarlo:
- Comprueba la conexión a internet en el terminal donde se ejecuta ComfyUI.
- Descarga el modelo CLIP manualmente desde Hugging Face:
openai/clip-vit-large-patch14y colócalo enComfyUI/models/clip/. - Si estás en un entorno de red restringida (proxy corporativo, China), configura
HF_ENDPOINT=https://hf-mirror.comcomo variable de entorno antes de arrancar ComfyUI.
Regla práctica: los fallos de descarga de CLIP casi siempre ocurren en el primer arranque de ComfyUI después de añadir nodos WanVideo. Si la descarga automática falla, configura HF_ENDPOINT=https://hf-mirror.com y reinicia ComfyUI — casi nunca hace falta descargar CLIP a mano a menos que los logs de ComfyUI apunten a una ruta concreta.
Benchmarks de GPU: qué esperar de Wan 2.2 en 6 configuraciones distintas
Estos benchmarks reflejan lo que puedes esperar según tu hardware. Todas las pruebas se ejecutaron a 480p, 81 fotogramas, 30 pasos, CFG 5.0, sampler euler.
| GPU | Formato de modelo | VRAM usada | Tiempo de generación | Calidad |
|---|---|---|---|---|
| RTX 4090 24 GB | FP8 (completo) | ~15 GB | ~95 s | Referencia |
| RTX 3090 24 GB | FP8 (completo) | ~16 GB | ~130 s | ~98 % |
| RTX 4090 24 GB | GGUF q8_0 | ~11 GB | ~85 s | ~98 % |
| RTX 4080 16 GB | FP8 (completo) | ~15 GB | ~160 s | Referencia |
| RTX 4080 16 GB | GGUF q8_0 | ~11 GB | ~140 s | ~97 % |
| RTX 4080 16 GB | LightX2V + GGUF q8_0 | ~11 GB | ~45 s | ~90 % |
| RTX 4070 Ti 12 GB | GGUF q8_0 | ~11 GB | ~180 s | ~96 % |
| RTX 4070 Ti 12 GB | LightX2V + GGUF q8_0 | ~11 GB | ~55 s | ~88 % |
Lo que nos dice la tabla:
- La RTX 4090 es entre un 35 y un 40 % más rápida que la RTX 4080 a misma resolución y mismo formato de modelo.
- LightX2V acelera la generación entre 2 y 4 veces, con una pérdida de calidad del 10–12 % en escenas complejas. En escenas simples (retrato, un solo sujeto, cámara fija), la diferencia baja a cerca del 5 %.
- El consumo de VRAM es casi idéntico entre GGUF q8_0 solo y LightX2V + GGUF q8_0. La ganancia de velocidad de LightX2V no tiene penalización en VRAM.
Sáltate la instalación: genera Wan 2.2 online sin GPU
Si has llegado hasta aquí y tu hardware se queda corto — o simplemente no te apetece gestionar descargas de modelos, grafos de nodos y errores de CUDA — puedes usar Wan 2.2 online sin instalar nada.
Wan 2.2 en wan27.org permite generar texto a video, imagen a video y voz a video directamente desde el navegador. Sin descargas, sin nodos de ComfyUI, sin gestionar VRAM:
- Créditos gratuitos para empezar a generar al momento
- Varias opciones de resolución hasta 720p
- No necesitas GPU — todo se ejecuta en el servidor
- Imagen a video y texto a video ambos disponibles
- Sin tiempo de configuración — abres la página y subes tu primera imagen o prompt
Para validaciones rápidas, proyectos puntuales o si no tienes una GPU compatible, la generación en la nube elimina toda la fricción que esta guía existe para resolver. El camino de ComfyUI merece la pena cuando necesitas iteraciones locales ilimitadas, tuberías personalizadas o control avanzado a nivel de nodos. Pero para la mayoría de los usuarios, un flujo de trabajo en el navegador cubre el 80 % de los casos de uso sin necesidad de configuración.
Entra en wan27.org/wan2-2 y genera tu primer clip en segundos.
FAQ: Wan 2.2 + ComfyUI — respuestas a las dudas más frecuentes
¿ComfyUI tiene soporte nativo para Wan 2.2?
Sí. A partir de la versión 0.3.5, ComfyUI incluye nodos WanVideo nativos: WanVideo Loader, WanVideo Sampler, WanVideo Decode y CLIP Text Encode (Wan). Para flujos de trabajo básicos no necesitas ningún plugin adicional.
¿Cuánta VRAM necesito como mínimo para Wan 2.2 en ComfyUI?
12 GB de VRAM es el mínimo práctico si usas cuantización GGUF q8_0 y la optimización LightX2V. 16 GB es lo recomendable para trabajar cómodamente en 480p con el modelo FP8 completo. Con 24 GB tienes margen para generación en 720p y flujos con varios modelos.
¿En qué carpetas de ComfyUI van los modelos de Wan 2.2?
Los modelos de difusión (archivos safetensors y GGUF) van en ComfyUI/models/diffusion_models/. Los VAE van en ComfyUI/models/vae/. Los LoRA van en ComfyUI/models/loras/. Los modelos CLIP los descarga ComfyUI automáticamente en ComfyUI/models/clip/.
¿Qué modelo de Wan 2.2 necesito para imagen a video?
Descarga wan2.2_i2v_14B_fp8_scaled.safetensors para el modelo I2V completo, o la variante GGUF wan2.2_i2v_14B_q8_0.gguf si tienes poca VRAM. El modelo T2V no acepta imágenes de entrada e ignorará tu imagen de referencia sin decirte nada.
¿Cuántos pasos debería usar para Wan 2.2 en ComfyUI?
30 pasos es un buen punto de partida para texto a video. Para imagen a video, 30–40 pasos dan mejores resultados porque el modelo tiene que ajustarse además a la imagen de referencia. Con el LoRA destilado LightX2V, con 4 pasos basta.
¿Por qué mi video de Wan 2.2 en ComfyUI sale negro o verde?
Casi siempre es un problema de VAE. Comprueba que el nodo WanVideo Decode está usando wan2.2_vae.safetensors y no el VAE por defecto de ComfyUI. También asegúrate de que el dtype en WanVideo Loader coincide con el formato de tu modelo (fp8_e4m3fn para safetensors FP8, q8_0 para GGUF).
¿Puedo ejecutar Wan 2.2 en una GPU AMD o en Apple Silicon?
Las GPUs AMD en Linux (ROCm) funcionan con ComfyUI, pero Wan 2.2 está menos probado en esa configuración. En Apple Silicon (M1/M2/M3) con menos de 32 GB de memoria unificada vas a tener problemas — el modelo de 14B parámetros supera lo que la mayoría de los Mac pueden asignar. Para usuarios de Apple Silicon, la generación en la nube es hoy por hoy la opción más práctica.
¿Qué ventaja tienen los nodos nativos de ComfyUI frente a los plugins personalizados?
Los nodos WanVideo nativos (añadidos en ComfyUI 0.3.5) los mantiene el equipo principal de ComfyUI, se actualizan con cada lanzamiento y no tienen dependencias externas de Python. Los plugins personalizados como ComfyUI-WanPlugin ofrecen funciones adicionales (enmascaramiento, programación avanzada), pero pueden romperse entre actualizaciones de ComfyUI y a veces entran en conflicto con otros nodos.
Tu hoja de referencia en 5 pasos: de cero a Wan 2.2 funcionando en ComfyUI
Montar Wan 2.2 en ComfyUI es un coste único que merece la pena si generas video con regularidad. El resumen rápido:
- Instala o actualiza ComfyUI a 0.3.5+
- Descarga los modelos — un modelo de difusión + VAE del repositorio de Kijai en Hugging Face
- Monta el grafo de nodos — WanVideo Loader → CLIP Text Encode → WanVideo Sampler → WanVideo Decode → Video Combine
- Optimiza para tu hardware — GGUF q8_0 + LightX2V si tienes 12 GB, FP8 si tienes 16 GB o más
- Soluciona errores por síntomas — cada error tiene su arreglo específico en esta guía
Si te atascas, empieza con una generación simple de texto a video en 480p. Cuando eso funcione, añade I2V, sube la resolución o prueba con distintos samplers y schedulers. La línea base de 480p valida cada componente de la tubería y hace que cualquier cambio posterior sea mucho más fácil de depurar.
Y si la instalación local no es lo tuyo — genera clips de Wan 2.2 online en wan27.org sin instalar nada, sin nodos y sin límites de VRAM.
Autor
Seedance 2.0
ByteDance latest video model. Text & image to video, up to 1080p.
Try Seedance 2.0 →Wan Video
Wan 2.7 series — text, image, reference to video & video editing.
Try Wan Video →AI Image Generator
Nano Banana Pro, GPT Image 2 & more. Generate stunning images in seconds.
Try Image Generator →Más Publicaciones

Archivos de modelo Wan 2.2 explicados: High Noise, Low Noise, VAE, GGUF, FP8 y 5B vs 14B (2026)
Guía completa de los archivos de modelo Wan 2.2: qué significa cada nombre de archivo safetensors y GGUF, comparativa 5B vs 14B, diferencia entre high noise y low noise, dependencias del VAE, ventajas de FP8 frente a FP16, y una lista de descarga según tu hardware.

Guía de continuación de video con Wan 2.7: extiende tus clips sin romper el movimiento
Aprende a usar la continuación de video con Wan 2.7 en wan27.org: extiende clips existentes, mantén la coherencia del movimiento, escribe prompts efectivos y evita los errores más comunes al ampliar tus videos generados con IA.
Boletín informativo
Únete a la comunidad
Suscríbete a nuestro boletín para recibir las últimas noticias y actualizaciones