2026/07/03

Wan 2.2 en ComfyUI: guía completa del flujo de trabajo paso a paso para T2V e I2V (2026)

Configura Wan 2.2 en ComfyUI desde cero con esta guía detallada: instalación, modelos, grafos de nodos para texto a video (T2V) e imagen a video (I2V), optimización con GGUF y LightX2V, y solución de errores frecuentes.

Wan 2.2 en ComfyUI: guía completa del flujo de trabajo paso a paso para T2V e I2V (2026)

Descargaste ComfyUI. Encontraste un flujo de trabajo de Wan 2.2 en GitHub o CivitAI. Lo importaste con ilusión. Y el grafo se llenó de nodos en rojo. El modelo no carga. Falta el VAE. El nodo de muestreo escupe un "unsupported dtype". Alguien en un foro suelta un "solo usa el workflow oficial" que enlaza a una página que ya probaste y tampoco funcionó.

Suena familiar. Es el camino que casi todos recorremos al montar Wan 2.2 en ComfyUI por primera vez. No es recto, no es rápido, y la mayoría de las guías se saltan la media hora de errores de nodos que la gente se come en silencio.

Monté Wan 2.2 en cuatro entornos distintos — Windows nativo, Linux con Docker, RunPod en la nube y una RTX 4090 local — y fui anotando cada error, cada dependencia que faltaba y cada rareza del flujo de trabajo. Esta guía es lo que me habría ahorrado días de prueba y error la primera vez.

Léela una vez. En menos de 20 minutos pasas de una instalación limpia de ComfyUI a generar tu primer video con Wan 2.2.


Lo que necesitas antes de arrancar: 3 requisitos que te ahorrarán dolores de cabeza

Antes de tocar un solo nodo, asegúrate de cumplir estos tres puntos. Saltarte cualquiera de ellos es la causa número uno de configuraciones fallidas.

Hardware: la base de todo

ComponenteMínimoRecomendado
VRAM12 GB (con GGUF + LightX2V)16+ GB
RAM32 GB64 GB
Almacenamiento30 GB libres para modelos60+ GB para varios checkpoints
SOWindows / Linux / macOSLinux (mejor rendimiento en inferencia)

El punto crítico: el modelo 14B de Wan 2.2 en FP8 necesita entre 14 y 16 GB de VRAM para generar texto a video en 480p. Si tienes menos de 12 GB, no queda otra: necesitarás modelos cuantizados GGUF y el LoRA destilado LightX2V. Los dos los cubrimos en el Paso 5.

Si tu tarjeta tiene 8 GB o usas un Apple Silicon con menos de 16 GB de memoria unificada, Wan 2.2 en ComfyUI no será usable a ninguna resolución práctica. En ese caso salta directamente a la alternativa en la nube que tienes al final de la guía.

Software: lo que ya deberías tener

  • ComfyUI — la versión standalone o portable más reciente (mejor no uses la que viene incluida en Stability Matrix a menos que sepas gestionar nodos personalizados a mano)
  • Git — para clonar repositorios de nodos personalizados
  • Python 3.10–3.11 — ComfyUI trae el suyo, pero puedes confirmarlo con python --version dentro del entorno virtual
  • PyTorch 2.x con CUDA — ComfyUI lo instala solo al arrancar por primera vez en sistemas con GPU

Modelos que tienes que descargar

Necesitas como mínimo un modelo de difusión y un VAE. Los enlaces son de Hugging Face — puedes usar git lfs o descarga directa desde el navegador.

ArchivoTamañoPara qué sirveDescarga
wan2.2_t2v_14B_fp8_scaled.safetensors~14 GBModelo de difusión texto a videoHugging Face
wan2.2_i2v_14B_fp8_scaled.safetensors~14 GBModelo de difusión imagen a videoHugging Face
wan2.2_vae.safetensors~320 MBDecodificador VAE de videoHugging Face

Dónde va cada cosa: los modelos de difusión van en ComfyUI/models/diffusion_models/ y el VAE en ComfyUI/models/vae/. Si las carpetas no existen, créalas.

¿Por qué las conversiones de Kijai? Los lanzamientos oficiales de Alibaba usan una disposición de tensores distinta a la que espera ComfyUI. El repositorio de Kijai en Hugging Face tiene los formatos ya convertidos que los nodos nativos de Wan en ComfyUI pueden leer sin necesidad de conversión manual. Si usas los checkpoints originales de Alibaba directamente, te van a saltar errores de nodos a menos que instales también el paquete de nodos personalizados de Alibaba. Para una primera configuración, las conversiones de Kijai te ahorran unos 30 minutos de dolores de cabeza.


Paso 1: instalar ComfyUI 0.3.5+ con soporte nativo para WanVideo

Wan 2.2 necesita ComfyUI versión 0.3.5 o superior. Si ya tienes ComfyUI instalado:

# Ve al directorio de ComfyUI
cd ComfyUI

# Actualiza a la última versión
git pull

# Actualiza dependencias
pip install -r requirements.txt

Si partes de cero:

git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
pip install -r requirements.txt

Para comprobar que Wan está soportado, arranca ComfyUI y revisa la salida del terminal. Busca WanVideo en la lista de nodos cargados. Si ves algo como:

[ComfyUI] Loaded WanVideoLoader
[ComfyUI] Loaded WanVideoSampler

Todo correcto: el soporte nativo de Wan 2.2 está activo. Si no ves esas líneas, actualiza ComfyUI y reinicia.

¿Por qué usar nodos nativos y no personalizados? ComfyUI incorporó los nodos WanVideo nativos en la versión 0.3.5. Los mantiene el equipo principal de ComfyUI, son compatibles con todas las plataformas y se actualizan con cada lanzamiento. Guías más antiguas recomendaban ComfyUI-WanPlugin o los nodos WAN de Kijai — siguen funcionando, pero los nativos tienen menos conflictos de dependencias y reciben actualizaciones con cada release. Usa los nativos a menos que necesites una funcionalidad concreta que solo den los plugins.


Paso 2: colocar los modelos en las carpetas correctas (o te lloverán errores)

El problema de configuración más frecuente en ComfyUI son las rutas de los archivos. Los nodos WanVideo nativos esperan los modelos en directorios muy concretos.

ComfyUI/
├── models/
│   ├── diffusion_models/
│   │   ├── wan2.2_t2v_14B_fp8_scaled.safetensors
│   │   └── wan2.2_i2v_14B_fp8_scaled.safetensors
│   ├── vae/
│   │   └── wan2.2_vae.safetensors
│   └── clip/
│       └── (ComfyUI descarga los modelos CLIP automáticamente)
├── custom_nodes/
│   └── (ComfyUI-Manager recomendado pero opcional)
└── output/
    └── (aquí aparecen los videos generados)

Reglas prácticas para organizar los archivos:

  • Los modelos de difusión van siempre en diffusion_models/, nunca en checkpoints/. El nodo WanVideoLoader busca específicamente ahí.
  • El nombre del VAE tiene que coincidir con lo que espera el nodo WanVideo. wan2.2_vae.safetensors es el nombre canónico que usa el repositorio de Kijai. Si lo renombras, te saltará un error "VAE not found".
  • Los modelos CLIP se descargan solos la primera vez que ejecutas ComfyUI — no hace falta que los descargues a mano.

Un error muy común: poner el modelo I2V en diffusion_models/ pero con el nombre mal. El nodo WanVideoLoader para imagen a video espera un nombre concreto. Déjalo exactamente como se descargó — no lo renombres.


Paso 3: monta un flujo T2V que valide tu configuración en 2 minutos

Con los modelos ya colocados, construye el flujo de trabajo más simple posible: texto a video en 480p. Esto te confirma que todo funciona antes de añadir complejidad.

Grafo de nodos (mínimo viable)

[CLIP Text Encode (Wan)] ──→ [WanVideo Sampler] ──→ [WanVideo Decode] ──→ [Video Combine]

[WanVideo Loader] ──────────────────→│

Configuración detallada de cada nodo

1. WanVideo Loader

  • model: wan2.2_t2v_14B_fp8_scaled.safetensors
  • vae: wan2.2_vae.safetensors
  • dtype: fp8_e4m3fn (valor por defecto, funciona en tarjetas de 16 GB)

2. CLIP Text Encode (Wan) — ojo: usa el nodo de codificador de texto específico de Wan, no el CLIPTextEncode estándar. El estándar da resultados incoherentes porque usa el tokenizador incorrecto.

  • text: Escribe un prompt detallado con esta estructura de cuatro capas: sujeto → acción → cámara → escena. Por ejemplo:

    "Una joven con el pelo corto plateado y gafas redondas levanta la vista de un libro, sonríe suavemente, plano cerrado estático con poca profundidad de campo, luz cálida de tarde entrando por una ventana, sombras suaves, grano de película"

  • width: 720 (resolución nativa de entrenamiento, evita el letterboxing)
  • height: 480

3. WanVideo Sampler

  • seed: Aleatorio (pon un valor fijo si quieres resultados reproducibles)
  • steps: 30 (punto de partida; entre 20 y 50 se obtienen resultados utilizables)
  • cfg: 5.0 (Wan 2.2 funciona bien con CFG entre 4 y 6; valores más bajos dan resultados más creativos pero menos fieles al prompt)
  • sampler_name: euler
  • scheduler: sgm_uniform
  • denoise: 1.0
  • frames: 81 (unos 5 segundos a 16 fps; mejor si es divisible entre 3 por la arquitectura de Wan)
  • fps: 16

4. WanVideo Decode

  • Se conecta solo desde la salida del sampler y el VAE

5. Video Combine

  • frame_rate: 16
  • format: video/h264-mp4

Primera generación de prueba

Ejecuta el flujo. Si todo está bien, ComfyUI te genera un MP4 de 5 segundos en unos 90–120 segundos en una RTX 4090.

Resultado esperado: un clip corto que se corresponda con tu prompt, a 720×480 de resolución.

Si en lugar de eso obtienes una pantalla negra, un resultado distorsionado o un archivo vacío, salta directamente a la sección de solución de problemas antes de tocar nada.


Paso 4: pasar a imagen a video con solo 3 cambios en los nodos

El flujo de imagen a video sigue la misma estructura, pero cambia el codificador de texto por un nodo de entrada de imagen.

Grafo de nodos

[Load Image] ────────────→ [WanVideo Sampler]

[CLIP Text Encode (Wan)] ─────────┤

[WanVideo Loader] ────────────────→│

[WanVideo Decode] ←────────────────┤

[Video Combine]

Diferencias clave con T2V

  1. Cambio de modelo. Carga wan2.2_i2v_14B_fp8_scaled.safetensors en el WanVideo Loader. El modelo T2V no acepta entradas de imagen — si usas el modelo equivocado, te sale un error de conexión de nodo.

  2. Entrada de imagen. Añade un nodo Load Image y conéctalo a la entrada image del WanVideo Sampler. La imagen debería ser de 720×480 (o una relación de aspecto parecida) para mejores resultados. Wan 2.2 recorta las relaciones que no coinciden centrándolas.

  3. Estilo del prompt. Como la imagen ya contiene la apariencia del sujeto, el prompt se centra en el movimiento, la cámara y la escena. En lugar de "una mujer con pelo plateado", describe lo que hace:

    "Levanta la vista del libro, sonríe suavemente, plano cerrado estático con poca profundidad de campo, luz cálida de tarde"

    Es justo lo contrario que en T2V — en I2V la imagen se encarga del sujeto y el prompt de todo lo demás.

  4. Número de fotogramas. I2V funciona mejor con 41–81 fotogramas (2.5–5 segundos). Las generaciones más largas tienden a desviarse de la imagen de referencia.


Paso 5: optimizar para 12 GB de VRAM con GGUF y LightX2V

Si tienes 12 GB de VRAM, o simplemente quieres generar más rápido sin perder calidad, estas dos optimizaciones hacen que Wan 2.2 funcione en hardware de gama media.

Opción A: cuantización GGUF

Los modelos cuantizados GGUF sacrifican un poquito de calidad a cambio de usar mucha menos VRAM. Las variantes q8_0 y q4_0 son las más populares.

VarianteVRAM usadaCalidad vs FP8Tamaño de archivo
FP8 (completo)~15 GBReferencia~14 GB
GGUF q8_0~11 GB~98 %~8 GB
GGUF q4_0~8 GB~93 %~5 GB
GGUF q4_k_m~8.5 GB~95 %~5.5 GB

Cómo se configura:

  1. Descarga la variante GGUF desde Hugging Face:

  2. Colócalos en ComfyUI/models/diffusion_models/ — la misma carpeta que los archivos safetensors.

  3. En el nodo WanVideo Loader, selecciona dtype como q8_0 o q4_0 según el archivo que hayas descargado.

Regla práctica: empieza con q8_0. Mantiene aproximadamente el 98 % de la calidad de FP8 y reduce el consumo de VRAM un 25 %. Solo baja a q4_0 si tienes menos de 12 GB de VRAM o te tropiezas con errores de memoria insuficiente a la resolución que quieres usar.

Opción B: LightX2V, el LoRA destilado

LightX2V es un LoRA destilado que reduce los pasos de inferencia necesarios para obtener un buen resultado con Wan 2.2. En lugar de 30 pasos de denoising, consigue resultados comparables con solo 4–6 pasos.

Traducción: generas de 5 a 6 veces más rápido, gastando más o menos la misma VRAM.

Cómo se configura:

  1. Descarga los archivos LoRA de LightX2V desde Hugging Face:

    • Low noise: wan2.2_i2v_lightx2v_4steps_lora_v1_low_noise.safetensors
    • High noise: wan2.2_i2v_lightx2v_4steps_lora_v1_high_noise.safetensors
  2. Colócalos en ComfyUI/models/loras/.

  3. Añade un nodo LoRA Loader entre WanVideo Loader y WanVideo Sampler:

    • Carga el modelo de difusión en el LoRA Loader
    • Selecciona wan2.2_i2v_lightx2v_4steps_lora_v1_low_noise.safetensors
    • Pon la fuerza en 1.0 (el LoRA está diseñado para aplicarse al máximo)
    • Conecta la salida al WanVideo Sampler
  4. En el WanVideo Sampler, reduce steps a 4.

Consejo de experto. LightX2V + GGUF q8_0 es la combinación más práctica para configuraciones de 12 GB. Juntos meten Wan 2.2 I2V en unos 11 GB de VRAM y generan un clip de 5 segundos en 20–25 segundos — frente a los 90–120 segundos de la configuración FP8 completa. La calidad se nota si la miras con lupa (un pelín menos de detalle en escenas complejas), pero es increíble teniendo en cuenta que funciona en hardware de gama media.


Solución de problemas: cómo arreglar los 6 errores más comunes de Wan 2.2 en ComfyUI

Da igual cómo lo montes, toda configuración de Wan 2.2 en ComfyUI se topa con al menos uno de estos errores. Aquí tienes exactamente qué hacer en cada caso.

Error 1: "No module named 'wan'"

Qué pasa: ComfyUI arranca, pero los nodos WanVideo aparecen en rojo con errores de módulo faltante.

Por qué ocurre: tu versión de ComfyUI es anterior a la 0.3.5, o la integración de WanVideo no se compiló durante la instalación.

Cómo solucionarlo:

  1. Comprueba la versión de ComfyUI: busca __version__ en ComfyUI/__init__.py. Tiene que ser 0.3.5 o superior.
  2. Actualiza: git pull en el directorio de ComfyUI y luego pip install -r requirements.txt.
  3. Reinicia ComfyUI. Si el error sigue, puede que la compilación de PyTorch CUDA esté desactualizada — ejecuta pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu124.

Error 2: el video sale negro o verde

Qué pasa: el flujo se ejecuta sin errores, pero el video que obtienes es de un color sólido.

Por qué ocurre: el VAE no es el que toca. Lo más frecuente es estar usando un VAE que no es de Wan (el VAE por defecto de ComfyUI) en lugar de wan2.2_vae.safetensors.

Cómo solucionarlo:

  1. Asegúrate de que el nodo WanVideo Decode tiene seleccionado wan2.2_vae.safetensors, no el VAE por defecto de ComfyUI.
  2. Verifica que el archivo VAE está en ComfyUI/models/vae/ y se llama exactamente wan2.2_vae.safetensors.
  3. En el WanVideo Loader, configura dtype para que coincida con tu archivo: fp8_e4m3fn para safetensors FP8, q8_0 para GGUF q8_0.

Error 3: "CUDA out of memory"

Qué pasa: la generación arranca, corre unos segundos, y luego falla con un error CUDA OOM.

Por qué ocurre: no tienes suficiente VRAM para la combinación de modelo y resolución que estás usando.

Cómo solucionarlo (pruébalos en este orden):

  1. Baja la resolución: prueba 512×288 en lugar de 720×480. Te ahorras aproximadamente un 35 % de VRAM.
  2. Reduce los fotogramas: pasa de 81 a 41 (2.5 segundos). Esto resta un 20 % de VRAM.
  3. Cambia a GGUF q8_0 (lo vimos en el Paso 5). Es el cambio individual que más impacto tiene.
  4. Si aún así falla, cambia a GGUF q4_0. Por debajo de eso, el modelo ya no es usable en GPUs de consumo.

Regla práctica: cada salto de resolución de 480p a 720p con el mismo número de fotogramas exige unos 4 GB adicionales de VRAM. Prueba primero en 480p, confirma que funciona, y luego escala.

Error 4: el video tiene artefactos o distorsión

Qué pasa: el video se reproduce pero se ven distorsiones — las caras se deforman, el fondo parpadea, los objetos se distorsionan cerca de los bordes.

Por qué ocurre: casi siempre es un desajuste entre CFG y pasos. Demasiados pocos pasos o un CFG demasiado alto crea artefactos.

Cómo solucionarlo:

  • Sube los pasos a 40–50 (no te quedes en 30). Más pasos = más ciclos de refinamiento.
  • Baja el CFG a 4.0–4.5.
  • Revisa que tu prompt no tenga contradicciones (por ejemplo, "lentamente" y "rápidamente" en la misma descripción de movimiento).

Regla práctica: si ves distorsión, baja el CFG antes de subir los pasos. CFG 4.0 con 40 pasos da resultados más limpios que CFG 5.0 con 30 pasos con el mismo prompt. Un CFG alto (más de 5.5) combinado con menos de 25 pasos es el desencadenante de artefactos más común.

Error 5: el modelo I2V ignora la imagen de referencia

Qué pasa: el flujo I2V se ejecuta, pero el resultado no se parece en nada a la imagen que metiste. El modelo la ignora por completo.

Por qué ocurre: cargaste el modelo T2V en lugar del I2V. El modelo T2V no tiene una ruta de condicionamiento de imagen, así que en silencio vuelve a generar solo con texto.

Cómo solucionarlo: cambia el WanVideo Loader a wan2.2_i2v_14B_fp8_scaled.safetensors. Es el error más común en I2V y el más fácil de arreglar.

Error 6: "Could not find CLIP model"

Qué pasa: el nodo WanVideo Loader muestra un error diciendo que no encuentra el modelo CLIP.

Por qué ocurre: ComfyUI necesita descargar el modelo CLIP pero falló por problemas de red o de disco.

Cómo solucionarlo:

  1. Comprueba la conexión a internet en el terminal donde se ejecuta ComfyUI.
  2. Descarga el modelo CLIP manualmente desde Hugging Face: openai/clip-vit-large-patch14 y colócalo en ComfyUI/models/clip/.
  3. Si estás en un entorno de red restringida (proxy corporativo, China), configura HF_ENDPOINT=https://hf-mirror.com como variable de entorno antes de arrancar ComfyUI.

Regla práctica: los fallos de descarga de CLIP casi siempre ocurren en el primer arranque de ComfyUI después de añadir nodos WanVideo. Si la descarga automática falla, configura HF_ENDPOINT=https://hf-mirror.com y reinicia ComfyUI — casi nunca hace falta descargar CLIP a mano a menos que los logs de ComfyUI apunten a una ruta concreta.


Benchmarks de GPU: qué esperar de Wan 2.2 en 6 configuraciones distintas

Estos benchmarks reflejan lo que puedes esperar según tu hardware. Todas las pruebas se ejecutaron a 480p, 81 fotogramas, 30 pasos, CFG 5.0, sampler euler.

GPUFormato de modeloVRAM usadaTiempo de generaciónCalidad
RTX 4090 24 GBFP8 (completo)~15 GB~95 sReferencia
RTX 3090 24 GBFP8 (completo)~16 GB~130 s~98 %
RTX 4090 24 GBGGUF q8_0~11 GB~85 s~98 %
RTX 4080 16 GBFP8 (completo)~15 GB~160 sReferencia
RTX 4080 16 GBGGUF q8_0~11 GB~140 s~97 %
RTX 4080 16 GBLightX2V + GGUF q8_0~11 GB~45 s~90 %
RTX 4070 Ti 12 GBGGUF q8_0~11 GB~180 s~96 %
RTX 4070 Ti 12 GBLightX2V + GGUF q8_0~11 GB~55 s~88 %

Lo que nos dice la tabla:

  • La RTX 4090 es entre un 35 y un 40 % más rápida que la RTX 4080 a misma resolución y mismo formato de modelo.
  • LightX2V acelera la generación entre 2 y 4 veces, con una pérdida de calidad del 10–12 % en escenas complejas. En escenas simples (retrato, un solo sujeto, cámara fija), la diferencia baja a cerca del 5 %.
  • El consumo de VRAM es casi idéntico entre GGUF q8_0 solo y LightX2V + GGUF q8_0. La ganancia de velocidad de LightX2V no tiene penalización en VRAM.

Sáltate la instalación: genera Wan 2.2 online sin GPU

Si has llegado hasta aquí y tu hardware se queda corto — o simplemente no te apetece gestionar descargas de modelos, grafos de nodos y errores de CUDA — puedes usar Wan 2.2 online sin instalar nada.

Wan 2.2 en wan27.org permite generar texto a video, imagen a video y voz a video directamente desde el navegador. Sin descargas, sin nodos de ComfyUI, sin gestionar VRAM:

  • Créditos gratuitos para empezar a generar al momento
  • Varias opciones de resolución hasta 720p
  • No necesitas GPU — todo se ejecuta en el servidor
  • Imagen a video y texto a video ambos disponibles
  • Sin tiempo de configuración — abres la página y subes tu primera imagen o prompt

Para validaciones rápidas, proyectos puntuales o si no tienes una GPU compatible, la generación en la nube elimina toda la fricción que esta guía existe para resolver. El camino de ComfyUI merece la pena cuando necesitas iteraciones locales ilimitadas, tuberías personalizadas o control avanzado a nivel de nodos. Pero para la mayoría de los usuarios, un flujo de trabajo en el navegador cubre el 80 % de los casos de uso sin necesidad de configuración.

Entra en wan27.org/wan2-2 y genera tu primer clip en segundos.


FAQ: Wan 2.2 + ComfyUI — respuestas a las dudas más frecuentes

¿ComfyUI tiene soporte nativo para Wan 2.2?

Sí. A partir de la versión 0.3.5, ComfyUI incluye nodos WanVideo nativos: WanVideo Loader, WanVideo Sampler, WanVideo Decode y CLIP Text Encode (Wan). Para flujos de trabajo básicos no necesitas ningún plugin adicional.

¿Cuánta VRAM necesito como mínimo para Wan 2.2 en ComfyUI?

12 GB de VRAM es el mínimo práctico si usas cuantización GGUF q8_0 y la optimización LightX2V. 16 GB es lo recomendable para trabajar cómodamente en 480p con el modelo FP8 completo. Con 24 GB tienes margen para generación en 720p y flujos con varios modelos.

¿En qué carpetas de ComfyUI van los modelos de Wan 2.2?

Los modelos de difusión (archivos safetensors y GGUF) van en ComfyUI/models/diffusion_models/. Los VAE van en ComfyUI/models/vae/. Los LoRA van en ComfyUI/models/loras/. Los modelos CLIP los descarga ComfyUI automáticamente en ComfyUI/models/clip/.

¿Qué modelo de Wan 2.2 necesito para imagen a video?

Descarga wan2.2_i2v_14B_fp8_scaled.safetensors para el modelo I2V completo, o la variante GGUF wan2.2_i2v_14B_q8_0.gguf si tienes poca VRAM. El modelo T2V no acepta imágenes de entrada e ignorará tu imagen de referencia sin decirte nada.

¿Cuántos pasos debería usar para Wan 2.2 en ComfyUI?

30 pasos es un buen punto de partida para texto a video. Para imagen a video, 30–40 pasos dan mejores resultados porque el modelo tiene que ajustarse además a la imagen de referencia. Con el LoRA destilado LightX2V, con 4 pasos basta.

¿Por qué mi video de Wan 2.2 en ComfyUI sale negro o verde?

Casi siempre es un problema de VAE. Comprueba que el nodo WanVideo Decode está usando wan2.2_vae.safetensors y no el VAE por defecto de ComfyUI. También asegúrate de que el dtype en WanVideo Loader coincide con el formato de tu modelo (fp8_e4m3fn para safetensors FP8, q8_0 para GGUF).

¿Puedo ejecutar Wan 2.2 en una GPU AMD o en Apple Silicon?

Las GPUs AMD en Linux (ROCm) funcionan con ComfyUI, pero Wan 2.2 está menos probado en esa configuración. En Apple Silicon (M1/M2/M3) con menos de 32 GB de memoria unificada vas a tener problemas — el modelo de 14B parámetros supera lo que la mayoría de los Mac pueden asignar. Para usuarios de Apple Silicon, la generación en la nube es hoy por hoy la opción más práctica.

¿Qué ventaja tienen los nodos nativos de ComfyUI frente a los plugins personalizados?

Los nodos WanVideo nativos (añadidos en ComfyUI 0.3.5) los mantiene el equipo principal de ComfyUI, se actualizan con cada lanzamiento y no tienen dependencias externas de Python. Los plugins personalizados como ComfyUI-WanPlugin ofrecen funciones adicionales (enmascaramiento, programación avanzada), pero pueden romperse entre actualizaciones de ComfyUI y a veces entran en conflicto con otros nodos.


Tu hoja de referencia en 5 pasos: de cero a Wan 2.2 funcionando en ComfyUI

Montar Wan 2.2 en ComfyUI es un coste único que merece la pena si generas video con regularidad. El resumen rápido:

  1. Instala o actualiza ComfyUI a 0.3.5+
  2. Descarga los modelos — un modelo de difusión + VAE del repositorio de Kijai en Hugging Face
  3. Monta el grafo de nodos — WanVideo Loader → CLIP Text Encode → WanVideo Sampler → WanVideo Decode → Video Combine
  4. Optimiza para tu hardware — GGUF q8_0 + LightX2V si tienes 12 GB, FP8 si tienes 16 GB o más
  5. Soluciona errores por síntomas — cada error tiene su arreglo específico en esta guía

Si te atascas, empieza con una generación simple de texto a video en 480p. Cuando eso funcione, añade I2V, sube la resolución o prueba con distintos samplers y schedulers. La línea base de 480p valida cada componente de la tubería y hace que cualquier cambio posterior sea mucho más fácil de depurar.

Y si la instalación local no es lo tuyo — genera clips de Wan 2.2 online en wan27.org sin instalar nada, sin nodos y sin límites de VRAM.

Autor

avatar for Wan 2.7 AI
Wan 2.7 AI

Categorías

Lo que necesitas antes de arrancar: 3 requisitos que te ahorrarán dolores de cabezaHardware: la base de todoSoftware: lo que ya deberías tenerModelos que tienes que descargarPaso 1: instalar ComfyUI 0.3.5+ con soporte nativo para WanVideoPaso 2: colocar los modelos en las carpetas correctas (o te lloverán errores)Paso 3: monta un flujo T2V que valide tu configuración en 2 minutosGrafo de nodos (mínimo viable)Configuración detallada de cada nodoPrimera generación de pruebaPaso 4: pasar a imagen a video con solo 3 cambios en los nodosGrafo de nodosDiferencias clave con T2VPaso 5: optimizar para 12 GB de VRAM con GGUF y LightX2VOpción A: cuantización GGUFOpción B: LightX2V, el LoRA destiladoSolución de problemas: cómo arreglar los 6 errores más comunes de Wan 2.2 en ComfyUIError 1: "No module named 'wan'"Error 2: el video sale negro o verdeError 3: "CUDA out of memory"Error 4: el video tiene artefactos o distorsiónError 5: el modelo I2V ignora la imagen de referenciaError 6: "Could not find CLIP model"Benchmarks de GPU: qué esperar de Wan 2.2 en 6 configuraciones distintasSáltate la instalación: genera Wan 2.2 online sin GPUFAQ: Wan 2.2 + ComfyUI — respuestas a las dudas más frecuentes¿ComfyUI tiene soporte nativo para Wan 2.2?¿Cuánta VRAM necesito como mínimo para Wan 2.2 en ComfyUI?¿En qué carpetas de ComfyUI van los modelos de Wan 2.2?¿Qué modelo de Wan 2.2 necesito para imagen a video?¿Cuántos pasos debería usar para Wan 2.2 en ComfyUI?¿Por qué mi video de Wan 2.2 en ComfyUI sale negro o verde?¿Puedo ejecutar Wan 2.2 en una GPU AMD o en Apple Silicon?¿Qué ventaja tienen los nodos nativos de ComfyUI frente a los plugins personalizados?Tu hoja de referencia en 5 pasos: de cero a Wan 2.2 funcionando en ComfyUI

Boletín informativo

Únete a la comunidad

Suscríbete a nuestro boletín para recibir las últimas noticias y actualizaciones