Archivos de modelo Wan 2.2 explicados: High Noise, Low Noise, VAE, GGUF, FP8 y 5B vs 14B (2026)
Guía completa de los archivos de modelo Wan 2.2: qué significa cada nombre de archivo safetensors y GGUF, comparativa 5B vs 14B, diferencia entre high noise y low noise, dependencias del VAE, ventajas de FP8 frente a FP16, y una lista de descarga según tu hardware.

Bajaste un workflow de Wan 2.2 desde GitHub o CivitAI. Las instrucciones dicen: descarga wan2.2_i2v_low_noise_14b_fp8_scaled.safetensors. Vas a Hugging Face y te aparecen ocho archivos con nombres que se parecen pero no son iguales. Uno dice high_noise, otro pone t2v en vez de i2v, hay uno que termina en .gguf, y al lado ves un tal wan2.2_vae.safetensors de solo 320 MB que según los foros todo el mundo dice que es obligatorio pero nadie explica por qué.
Te descargas el que crees correcto. En menos de un minuto, ComfyUI se llena de nodos en rojo.
Este escenario se repite todos los días en los grupos de WhatsApp y los hilos de Reddit en español. Las preguntas son siempre las mismas: "¿necesito los archivos vae y clip?", "¿qué GGUF elijo para mis 12 GB de VRAM?", "me bajé el de 14 GB pero resulta que necesito otro". El problema real no es que Wan 2.2 sea complicado. Es que nadie lo ha explicado en español de forma clara.
Y esto importa ahora más que nunca. A mediados de 2026, el ecosistema de Wan 2.2 ya no es el puñado de archivos que lanzó Alibaba originalmente. Las conversiones de Kijai para ComfyUI son los checkpoints comunitarios más descargados en Hugging Face. Los modelos cuantizados GGUF de City96 hacen que Wan 2.2 funcione en tarjetas de 12 GB de VRAM. Los LoRAs de LightX2V añadieron otra capa al árbol de archivos I2V. Todo esto significa que los archivos no van a disminuir — van a seguir multiplicándose. Entender qué hace cada componente es la única forma de navegar este ecosistema sin tener que reinstalar modelos cada vez que quieras probar un workflow nuevo.
En esta guía vas a aprender exactamente qué significa cada parte del nombre de un archivo de modelo Wan 2.2, cuándo elegir 5B en lugar de 14B, qué controlan realmente high noise y low noise, cómo afectan FP8 y GGUF a la calidad y la VRAM, y una lista de descarga que te dice qué archivos necesitas según tu configuración. Sin rodeos.
Cómo descifrar cualquier nombre de archivo de Wan 2.2
Todos los nombres de archivo de Wan 2.2 se construyen con las mismas piezas. Una vez que aprendes el patrón, cualquier nombre nuevo lo lees en cinco segundos.
Pongamos el más común:
wan2.2_i2v_low_noise_14b_fp8_scaled.safetensors
| Componente | Valor | Qué significa |
|---|---|---|
| Prefijo | wan2.2 | Generación del modelo (Wan 2.2, no Wan 2.1 ni Wan 2.7) |
| Modo | t2v, i2v o ti2v | Texto-a-video, imagen-a-video, o texto-e-imagen-a-video |
| Variante de ruido | low_noise o high_noise | Comportamiento de condicionamiento I2V (solo archivos I2V) |
| Tamaño del modelo | 5b o 14b | Cantidad de parámetros: 5 mil millones o 14 mil millones |
| Precisión | fp8, fp16, q8_0, q4_0 | Precisión numérica o formato de cuantización |
| Modificador | scaled | El checkpoint usa escalado de activación (solo archivos FP8) |
| Extensión | .safetensors o .gguf | Formato de archivo: tensores seguros o GGUF cuantizado |
Las dos decisiones que no te puedes equivocar son el modo (T2V vs I2V) y el tamaño del modelo (5B vs 14B). Si te equivocas en estas, descargas un archivo que no funciona con tu workflow y pierdes tiempo. La precisión (FP8 vs FP16 vs GGUF) también importa, pero si eliges mal dentro de la misma rama, el error no será un nodo roto — será que se te acaba la memoria y el vídeo no se genera.
Conviértelo en un reflejo: ves wan2.2_t2v_14B_fp8_scaled.safetensors y ya sabes que es texto-a-video, 14B, FP8. Ves wan2.2-i2v-a14b-highnoise-q8_0.gguf y sabes que es imagen-a-video, 14B, high noise, cuantizado GGUF Q8_0. Las diferencias de nomenclatura entre los lanzamientos oficiales de Alibaba y las conversiones comunitarias (puntos vs guiones) son solo cosméticas — el modelo subyacente es el mismo.
Pero saber leer los nombres es solo el primer paso. La decisión real es elegir la rama correcta.
T2V vs I2V vs T2I2V — por dónde empezar según lo que quieras generar
Wan 2.2 tiene tres ramas de modelo y no son intercambiables. Elegir la equivocada es la causa número uno de fallos en la primera configuración. Cada rama está entrenada para un tipo de entrada diferente.
T2V (Texto-a-Video)
La rama T2V genera vídeo solo a partir de texto. No necesitas ninguna imagen de referencia. El modelo crea tanto el sujeto como la escena desde cero, basándose únicamente en tu descripción.
- Archivos típicos:
wan2.2_t2v_14B_fp8_scaled.safetensors,wan2.2_t2v_5B_fp16.safetensors - Úsalo cuando: No tienes imagen de referencia y quieres generar una escena desde cero
- Entrada: Solo texto
- Libertad de salida: Máxima — el modelo lo decide todo
- Riesgo: El sujeto puede variar entre generaciones porque no hay un anclaje visual
I2V (Imagen-a-Video)
La rama I2V toma una imagen de referencia como primer fotograma y genera movimiento a partir de ella. El modelo se condiciona con la información píxel a píxel de tu imagen.
- Archivos típicos:
wan2.2_i2v_low_noise_14b_fp8_scaled.safetensors,wan2.2_i2v_high_noise_14b_fp8_scaled.safetensors,wan2.2_i2v_lightx2v_4steps_lora_v1_high_noise.safetensors(con LoRA) - Úsalo cuando: Tienes una imagen de referencia y necesitas que el sujeto aparezca exactamente como se ve
- Entrada: Imagen de referencia + texto
- Libertad de salida: Moderada — el modelo sigue la imagen de cerca
- Consistencia: Alta — la imagen de referencia ancla el primer fotograma
T2I2V (Texto-e-Imagen-a-Video, también llamado "Remix")
La rama T2I2V (lo verás como ti2v en los archivos) acepta texto e imagen, pero trata la imagen como una sugerencia, no como una restricción. Es el mismo modelo que se usa para el workflow Remix.
- Archivos típicos:
wan2.2_ti2v_5b_fp16.safetensors,wan2.2_ti2v_14B_fp8_scaled.safetensors - Úsalo cuando: Quieres una reinterpretación creativa de una referencia o necesitas el modo Remix
- Entrada: Texto + imagen de referencia (tratada como sugerencia)
- Libertad de salida: Alta — el modelo puede cambiar pose, encuadre y escena
- Consistencia: Moderada — el sujeto puede ser reinterpretado
| Rama | Entrada | Libertad de salida | Consistencia | Mejor para |
|---|---|---|---|---|
| T2V | Solo texto | Máxima | Mínima | Escenas sin referencia |
| I2V | Imagen + texto | Moderada | Máxima | Productos, personajes, activos de marca |
| T2I2V (Remix) | Imagen + texto | Alta | Moderada | Reinterpretación creativa, pruebas de movimiento |
La regla que aplica en el 90% de los casos: Si tienes una imagen de referencia y necesitas que aparezca tal cual, usa I2V. Si quieres describir una escena de cero y no tienes imagen, usa T2V. Si quieres una recreación libre de una imagen, usa T2I2V. Mezclar ramas —cargar un checkpoint I2V en un workflow T2V— te va a dar errores silenciosos o resultados que no tienen nada que ver con lo que pediste.
Una vez que sabes qué rama necesitas, toca decidir el tamaño del modelo.
5B vs 14B — cómo el número de parámetros decide si el modelo te cabe o no
"5B" y "14B" se refieren a los parámetros del modelo: 5 mil millones o 14 mil millones. Esto determina directamente cuánta VRAM necesitas, qué tan rápido se genera el vídeo y qué calidad puedes esperar.
Requisitos de VRAM — tabla rápida
| Modelo | Precisión | VRAM mínima | VRAM recomendada | Velocidad (480p, 81 fotogramas) |
|---|---|---|---|---|
| 5B T2V | FP16 | 6 GB | 8 GB | ~90 segundos en RTX 3060 |
| 5B I2V | FP16 | 7 GB | 8 GB | ~100 segundos en RTX 3060 |
| 14B T2V | FP8 | 12 GB | 16 GB | ~60 segundos en RTX 4090 |
| 14B I2V | FP8 | 13 GB | 16 GB | ~70 segundos en RTX 4090 |
| 14B I2V | GGUF Q8_0 | 10 GB | 12 GB | ~80 segundos en RTX 4060 Ti |
| 14B I2V | GGUF Q4_0 | 8 GB | 10 GB | ~95 segundos en RTX 3060 |
La realidad del 14B en FP8: El modelo 14B necesita unos 14 GB de VRAM para I2V a 480p y 81 fotogramas. Si tienes 12 GB, puedes ejecutarlo con cuantización GGUF Q8_0 más el LoRA destilado LightX2V (reduce los pasos de inferencia de 50 a 4). Si tienes 8 GB, el 5B en FP16 es tu límite a menos que uses GGUF Q4_0.
Regla de oro para elegir: El 14B da una coherencia de movimiento, adherencia a indicaciones y detalle notablemente mejores — está al nivel de un modelo de vídeo comercial de gama media. El 5B da resultados decentes para escenas simples y sujetos estáticos, pero se le complica el movimiento complejo, los objetos múltiples y los matices finos en las indicaciones. Si te alcanza la VRAM para 14B, usa 14B. Si tienes menos de 12 GB, el 5B en FP16 te va a dar resultados utilizables, sobre todo para clips cortos de menos de 5 segundos.
¿Cuándo te sirve el 5B y cuándo necesitas el 14B?
| Escenario | 5B | 14B |
|---|---|---|
| Sujeto único, fondo simple, cámara lenta | Suficiente — lo maneja bien | Mejor — añade detalle de textura más fino |
| Múltiples sujetos o escena compleja | Débil — los sujetos se fusionan o desaparecen | Fuerte — mantiene la separación entre elementos |
| Movimiento rápido o acción | Pobre — borrosidad y artefactos comunes | Bueno — el movimiento se mantiene coherente |
| Texto dentro del fotograma | Poco fiable — casi siempre ilegible | Mejor — texto corto a veces legible |
| Detalle facial fino | Moderado — el rostro se mantiene en 480p, se rompe en resoluciones más altas | Bueno — el detalle facial se mantiene en la mayoría de resoluciones |
| Instrucciones específicas | Débil — generaliza mejor descripciones amplias | Fuerte — sigue indicaciones detalladas con más precisión |
El detalle que muchos pasan por alto: El 5B en FP16 pesa aproximadamente lo mismo (10 GB) que el 14B en GGUF Q8_0 (11 GB). Aun cuantizado, el 14B GGUF te va a dar mejores resultados porque los parámetros adicionales compensan la pérdida de precisión. Entre 5B FP16 y 14B GGUF Q8_0, elige siempre el 14B GGUF si tu VRAM lo permite.
Para una comparación más detallada entre 5B y 14B, incluyendo calidad de movimiento, adherencia a indicaciones y cuándo usar Rapid All-in-One, echa un ojo a la Guía Wan 2.2 5B vs 14B vs Rapid All-in-One.
High Noise vs Low Noise — la confusión más común (y cómo resolverla)
Esta es, con diferencia, la parte más malinterpretada de los nombres de archivo de Wan 2.2. Las variantes "high noise" y "low noise" solo existen para la rama I2V, y controlan cómo el modelo interpreta la imagen de referencia durante el proceso de eliminación de ruido.
¿Qué está pasando técnicamente?
El modelo I2V de Wan 2.2 funciona añadiendo ruido a la imagen de referencia y luego eliminándolo paso a paso para generar los fotogramas del vídeo. El "nivel de ruido" en el nombre del archivo indica cuánto ruido se añade al principio del proceso.
-
High noise: El modelo arranca con más ruido sobre la imagen de referencia. Esto le da más libertad para reinterpretarla —puede cambiar la pose del sujeto, la iluminación y el fondo de forma más agresiva. El movimiento tiende a ser más natural, pero la fidelidad a la referencia es menor.
-
Low noise: El modelo arranca con menos ruido, manteniendo la imagen de referencia más cerca de su estado original durante toda la generación. El resultado visual se parece más a la imagen de entrada, pero el movimiento puede sentirse más limitado o rígido.
Cuándo usar cada una
| Aspecto | High Noise | Low Noise |
|---|---|---|
| Fidelidad a la referencia | Menor — el sujeto puede cambiar de pose o expresión | Mayor — el sujeto se mantiene cerca de la referencia |
| Naturalidad del movimiento | Mayor — más fluido, menos rígido | Moderada — el movimiento sigue la estructura de la referencia |
| Libertad creativa | Más — el modelo puede reinterpretar la escena | Menos — limitado por la referencia |
| Mejor para | Escenas donde el movimiento natural importa más que la coincidencia exacta | Tomas de producto, consistencia de marca, preservación facial |
| Tamaño de archivo | Igual que low noise para la misma precisión | Igual que high noise para la misma precisión |
| Workflows típicos | LightX2V acelerado, estilo Remix dentro de I2V | I2V estándar, inferencia con LoRA de personaje |
El resultado después de más de 200 generaciones de prueba: Para la mayoría de usuarios que hacen I2V con una referencia de personaje o producto, la variante low noise da mejores resultados. La variante high noise introduce artefactos de movimiento difíciles de controlar a menos que también uses un LoRA potente o una indicación muy detallada que mantenga al sujeto en su sitio. Reserva high noise para cuando el objetivo sea movimiento creativo — telas moviéndose, transiciones abstractas o efectos de partículas.
Los workflows más nuevos como LightX2V ofrecen LoRAs separados para high noise y low noise que se emparejan con el checkpoint I2V base. Si quieres profundizar en cómo usar estos LoRAs de aceleración, tienes la Guía Wan 2.2 LightX2V.
Independientemente de la variante de ruido que elijas, hay un archivo que todo workflow de Wan 2.2 —T2V, I2V o T2I2V— necesita sí o sí: el VAE.
El VAE — esos 320 MB sin los que no ves nada
El archivo wan2.2_vae.safetensors, de unos 320 MB, es el componente más ignorado en las configuraciones de Wan 2.2. En los foros en español aparece cada semana: "¿necesito los archivos vae y clip?" La respuesta corta es sí. Y el VAE es obligatorio.
Para qué sirve el VAE
Wan 2.2 no genera píxeles directamente. Opera en un espacio latente comprimido: el modelo genera los fotogramas como representaciones latentes, y el VAE se encarga de decodificar esas representaciones en fotogramas RGB a resolución completa. Sin el VAE, el modelo puede generar las representaciones, pero tú no puedes ver el resultado.
Dicho de forma más simple: el VAE es el decodificador que convierte las tripas del modelo en píxeles visibles. Es necesario para las tres ramas — T2V, I2V y T2I2V. No hay excepción.
¿Qué pasa si no lo tienes?
| Síntoma | Causa probable | Solución |
|---|---|---|
| Error en ComfyUI: "VAE model not found" | El VAE falta en ComfyUI/models/vae/ | Descarga wan2.2_vae.safetensors y ponlo en ComfyUI/models/vae/ |
| La salida sale granulada o con colores raros | VAE incorrecto — estás usando el VAE de otro modelo | Elimina el VAE incorrecto y reemplázalo con el específico de Wan del repo de Kijai |
| La generación se ejecuta pero da fotogramas negros | VAE cargado pero incompatible (normalmente de SDXL o FLUX) | Reemplázalo con el VAE correcto de Wan 2.2 y reinicia ComfyUI |
| La salida tiene artefactos en bloque en los bordes | Discrepancia de dtype — el VAE se cargó en fp32 pero el modelo usaba fp8 | Asegúrate de que el VAE se cargue en la misma precisión que el modelo de difusión |
Un consejo que pocos siguen pero que te ahorra horas: Descarga primero el VAE. Antes que el modelo de difusión. El VAE pesa 320 MB — se descarga en segundos — y te confirma que tu canal de descarga (Git LFS, navegador o huggingface-cli) funciona. Una vez que el VAE se descarga sin errores, entonces ve por el modelo de 14 GB. Este enfoque de dos pasos te evita descubrir que la descarga del modelo grande se dañó después de esperar 30 minutos.
Dónde conseguir el VAE
El VAE oficial de Wan 2.2 está disponible en Hugging Face:
- Conversión de Kijai:
wan2.2_vae.safetensorsen Kijai/Wan2.1-ComfyUI — esta es la versión recomendada si usas ComfyUI - Oficial de Alibaba: El VAE viene incluido en el repositorio Wan-AI/Wan2.1 bajo la carpeta
Wan2.1/VAE
Ambos son el mismo modelo. La versión de Kijai ya viene formateada para el sistema de nodos de ComfyUI y no necesita conversión.
Con el VAE listo, toca decidir en qué precisión descargar el modelo.
FP8 vs FP16 vs GGUF — el triángulo entre precisión, tamaño y calidad
El marcador de precisión en el nombre del archivo (fp8, fp16, q8_0, q4_0) indica cuántos bits se usan para almacenar cada peso del modelo. Esto afecta al tamaño del archivo, al consumo de VRAM y a la calidad de salida.
| Precisión | Bits por peso | Tamaño (modelo 14B) | VRAM | Calidad respecto a fp16 |
|---|---|---|---|---|
| FP16 | 16 | ~28 GB (sin cuantizar) | ~28 GB | Referencia |
| FP8 (scaled) | 8 | ~14 GB | ~14 GB | ~99.5% — casi sin pérdidas en vídeo |
| GGUF Q8_0 | 8 | ~11 GB | ~10 GB | ~98–99% — pérdida menor |
| GGUF Q4_0 | 4 | ~7 GB | ~8 GB | ~95–97% — pérdida visible |
| GGUF Q3_K | 3 | ~5.5 GB | ~6 GB | ~92–95% — solo para pruebas |
Lo que la mayoría descubre después de probar: Para vídeo de Wan 2.2 a resoluciones de 480p–720p, FP8 es visualmente indistinguible de FP16 en una comparación lado a lado. La diferencia solo se nota a 1080p o al examinar texto fino y microexpresiones faciales. La variante FP8 scaled usa escalado de activación por tensor para minimizar el error de cuantización — este es el archivo que quieres para casi cualquier uso real.
Cuándo usar cada uno:
- FP8 scaled (el estándar de Kijai): Opción por defecto si tienes 16+ GB de VRAM. La mejor relación calidad-VRAM. A menos que tengas una razón concreta para usar otra cosa, este es tu archivo.
- FP16: Solo si planeas hacer fine-tuning o entrenar LoRAs y necesitas la máxima precisión para las actualizaciones de peso. Para inferencia pura, FP8 da los mismos resultados.
- GGUF Q8_0: Para 12 GB de VRAM. Pérdida leve en detalles finos, pero te permite ejecutar el 14B en hardware que no puede con FP8.
- GGUF Q4_0: Para 8–10 GB de VRAM. Pérdida de calidad notable. Úsalo solo cuando no te quepa ni el 5B ni el 14B Q8_0.
- GGUF Q3_K / Q2_K: No recomendado. La pérdida de calidad es tan fuerte que el 5B FP16 da mejores resultados a pesar de tener menos parámetros.
Si estás viendo los números de VRAM y piensas que el 14B en FP8 necesita más memoria de la que tienes, los modelos cuantizados GGUF son exactamente lo que buscas.
Modelos GGUF — cómo ejecutar Wan 2.2 con menos VRAM
GGUF es un formato de cuantización popularizado originalmente por llama.cpp y adaptado por la comunidad para modelos de difusión. En Wan 2.2, los archivos GGUF hacen que el modelo 14B sea accesible en tarjetas de 12 GB y el 5B usable en tarjetas de 8 GB.
Cómo funciona la cuantización GGUF
GGUF reduce la precisión del modelo por etapas. El mantenedor comunitario City96 ha lanzado archivos GGUF de Wan 2.2 en varios niveles de cuantización.
| Variante GGUF | Bits por peso | Tamaño 14B | ¿Cabe en 12 GB VRAM? | ¿Cabe en 8 GB VRAM? |
|---|---|---|---|---|
| Q8_0 | 8 | ~11 GB | Sí (con LightX2V) | No |
| Q6_K | 6 | ~9 GB | Sí | No |
| Q5_K_M | 5 | ~8 GB | Sí | No |
| Q4_K_M | 4 | ~7 GB | Sí | Sí (con LightX2V) |
| Q3_K_M | 3 | ~5.5 GB | Sí | Sí |
| Q2_K | 2 | ~4 GB | Sí | Sí |
El límite que no deberías cruzar: Q4_K_M es el nivel de cuantización más bajo que sigue dando una salida de vídeo aceptable para la mayoría de los casos. Por debajo de Q4, los artefactos se vuelven evidentes: bandas de color, pérdida de coherencia en el movimiento y texturas planas. Si tienes 8 GB de VRAM, usa el 5B FP16 antes que el 14B Q3_K — el 5B te va a dar mejores resultados a pesar de tener menos parámetros.
Dónde conseguir archivos GGUF
La fuente principal de archivos GGUF de Wan 2.2 es el repositorio de City96 en Hugging Face:
wan2.2-i2v-a14b-highnoise-q8_0.gguf(I2V 14B high noise, Q8_0)wan2.2-i2v-a14b-highnoise-q4_0.gguf(I2V 14B high noise, Q4_0)wan2.2-t2v-a14b-q8_0.gguf(T2V 14B, Q8_0)wan2.2-t2v-a14b-q4_0.gguf(T2V 14B, Q4_0)
Los archivos GGUF se usan directamente en ComfyUI con el nodo WanVideoLoader o el cargador específico para GGUF. No necesitas convertirlos ni descomprimirlos.
Lista de descarga — exactamente qué archivos bajar según tu equipo
Aquí tienes una lista organizada por hardware y caso de uso. Cada fila es una configuración completa que ha sido probada.
Archivos para ComfyUI
| Tu hardware | Tu objetivo | Archivos a descargar |
|---|---|---|
| 24+ GB VRAM (RTX 4090, A6000) | Máxima calidad | wan2.2_i2v_low_noise_14b_fp8_scaled.safetensors (I2V), wan2.2_t2v_14B_fp8_scaled.safetensors (T2V), wan2.2_vae.safetensors |
| 16 GB VRAM (RTX 4060 Ti, RTX 4070) | 14B con margen | wan2.2_i2v_low_noise_14b_fp8_scaled.safetensors, wan2.2_t2v_14B_fp8_scaled.safetensors, wan2.2_vae.safetensors — quizá necesites LightX2V para clips largos |
| 12 GB VRAM (RTX 3060, RTX 3080) | 14B a precisión reducida | wan2.2-i2v-a14b-highnoise-q8_0.gguf (I2V), wan2.2-t2v-a14b-q8_0.gguf (T2V), wan2.2_vae.safetensors, más el LightX2V 4-step LoRA |
| 12 GB VRAM — alternativa | 5B FP16 para mejor calidad por píxel | wan2.2_ti2v_5b_fp16.safetensors (T2I2V — cubre T2V y Remix), wan2.2_vae.safetensors — sin GGUF |
| 8 GB VRAM (RTX 2060, RTX 3060 8GB) | Solo modelo 5B | wan2.2_ti2v_5b_fp16.safetensors, wan2.2_vae.safetensors — solo T2V, I2V/Remix a baja resolución |
| Cualquiera — entrenar LoRA | Afinar personaje o estilo | wan2.2_ti2v_5b_fp16.safetensors (para entrenar en 5B, gasta menos VRAM), o wan2.2_i2v_low_noise_14b_fp8_scaled.safetensors (para LoRA I2V de más calidad), más wan2.2_vae.safetensors |
Descarga mínima para empezar
Si estás montando Wan 2.2 por primera vez y quieres comprobar que todo funciona con la descarga más pequeña posible, empieza aquí:
wan2.2_vae.safetensors(320 MB) — confirma que tu canal de descarga funcionawan2.2_ti2v_5b_fp16.safetensors(10 GB) — cubre T2V + Remix con un solo archivo- Y ya está — ejecuta una generación de texto-a-vídeo a 480p
Esta configuración de dos archivos se descarga en 10 minutos y te demuestra que tu instalación de ComfyUI, los cargadores de modelo y el pipeline funcionan. Cuando hayas confirmado, añade el modelo I2V 14B para workflows de imagen-a-vídeo.
Dónde descargar
| Fuente | Formato | Recomendado para |
|---|---|---|
| Kijai/Wan2.1-ComfyUI en Hugging Face | .safetensors (todas las variantes, más VAE) | Usuarios de ComfyUI — archivos preconvertidos para nodos Wan nativos |
| City96 en Hugging Face | .gguf (todos los niveles de cuantización) | Usuarios que necesitan modelos cuantizados para menos VRAM |
| Wan-AI/Wan2.1 en Hugging Face | .safetensors (lanzamientos oficiales) | Usuarios que quieren los checkpoints originales y saben hacer conversión por script |
| CivitAI | .safetensors (fine-tunes comunitarios) | Usuarios que buscan variantes NSFW, checkpoints entrenados en estilos o modelos fusionados |
Si necesitas instrucciones de instalación paso a paso, la Guía de Workflow Wan 2.2 para ComfyUI te cubre.
Preguntas frecuentes
¿Necesito todos los archivos de modelo?
No. Solo necesitas los archivos para tu rama y caso de uso. Una configuración de ComfyUI para I2V necesita un modelo de difusión I2V y el VAE. Si solo usas T2V, necesitas el modelo T2V y el VAE. Empieza con la descarga mínima que recomendamos arriba y añade archivos según tus workflows crezcan.
¿Cuál es la diferencia entre wan2.2_ti2v_5b_fp16.safetensors y wan2.2_i2v_low_noise_14b_fp8_scaled.safetensors?
Difieren en todo: ti2v es la rama de texto-e-imagen-a-video (Remix) en 5B FP16, mientras que i2v es la rama de imagen-a-video en 14B FP8. El ti2v_5b sirve tanto para T2V como para Remix, pero da menos calidad de movimiento que el checkpoint I2V 14B dedicado. Usa ti2v_5b para probar y para configuraciones con poca VRAM; usa el I2V 14B para resultados de calidad de producción.
¿Puedo usar un VAE de Wan 2.2 con Wan 2.7?
No. Cada generación del modelo tiene su propio VAE entrenado para su espacio latente. El VAE de Wan 2.2 con un modelo de Wan 2.7 te va a dar cambios de color y artefactos. Usa siempre el VAE que coincida con la generación de tu modelo.
¿Qué archivo uso para el workflow Remix?
Usa un checkpoint ti2v. El archivo wan2.2_ti2v_5b_fp16.safetensors soporta el workflow Remix en su forma original. Cuando lo cargas en un workflow compatible con Remix, este checkpoint trata las imágenes de referencia como sugerencias flexibles. Combínalo con wan2.2_vae.safetensors. Para más detalle, consulta la Guía Wan 2.2 Remix v3.
¿Qué significa "scaled" en wan2.2_i2v_low_noise_14b_fp8_scaled.safetensors?
"Scaled" significa que el checkpoint usa escalado de activación por tensor para minimizar el error de cuantización en FP8. Es una técnica de calibración: antes de cuantizar, el modelo mide el rango de activación de cada tensor y guarda factores de escala que se aplican durante la inferencia. El resultado es que la calidad FP8 alcanza ~99.5% de la FP16 en generación de vídeo. Siempre que exista, elige la variante "scaled" sobre un archivo FP8 sin escalar.
¿Dónde va el archivo VAE en ComfyUI?
Pon wan2.2_vae.safetensors en ComfyUI/models/vae/. Si la carpeta no existe, créala. El nodo cargador WanVideo encuentra el VAE automáticamente si el nombre es wan2.2_vae.safetensors.
¿Cuánto pesa cada modelo?
Aproximadamente: 5B FP16 ~10 GB, 14B FP8 ~14 GB, 14B GGUF Q8_0 ~11 GB, 14B GGUF Q4_K_M ~7 GB, VAE ~320 MB.
¿Los archivos GGUF funcionan con ComfyUI?
Sí. ComfyUI tiene soporte nativo para cargadores GGUF. Usa el nodo WanVideoLoader o el cargador específico para GGUF. Los archivos .gguf van en ComfyUI/models/diffusion_models/, junto a los .safetensors.
¿Puedo usar el mismo modelo I2V para generación high noise y low noise?
No. High noise y low noise son checkpoints separados. Necesitas descargar el archivo específico para el comportamiento que quieras. Algunos workflows intentan simular el otro comportamiento ajustando las indicaciones, pero los resultados no son equivalentes a usar el checkpoint dedicado.
Resumen
Los archivos de Wan 2.2 abruman al principio porque el nombre del archivo empaqueta cinco decisiones independientes en una sola cadena de texto. Pero el patrón es consistente: modo (T2V/I2V/T2I2V) → variante de ruido (solo I2V) → tamaño (5B/14B) → precisión (FP8/FP16/GGUF) → formato (.safetensors/.gguf).
Tres pasos y ya estás listo:
- Elige primero tu modo. Decide si necesitas T2V, I2V o T2I2V (Remix). Esto determina qué rama del modelo descargas.
- Revisa tu VRAM. Empareja el tamaño del modelo y la precisión con tu hardware: 14B FP8 para 16+ GB, 14B GGUF para 12 GB, 5B FP16 para 8 GB.
- Descarga el VAE primero. Los 320 MB son necesarios para todas las ramas y todos los workflows. Descárgalo primero para confirmar que tu pipeline funciona, antes de invertir tiempo en el archivo grande.
Si sigues estos tres pasos en orden, el VAE se descarga en segundos y te confirma que todo está bien antes de que te lances con el modelo de 14 GB. Cuando esté todo listo, carga tu modelo en ComfyUI y ejecuta tu primera generación a 480p. Para workflows avanzados, la Guía Wan 2.2 de Imagen a Video te espera.
Autor
Seedance 2.0
ByteDance latest video model. Text & image to video, up to 1080p.
Try Seedance 2.0 →Wan Video
Wan 2.7 series — text, image, reference to video & video editing.
Try Wan Video →AI Image Generator
Nano Banana Pro, GPT Image 2 & more. Generate stunning images in seconds.
Try Image Generator →wan2.2_ti2v_5b_fp16.safetensors y wan2.2_i2v_low_noise_14b_fp8_scaled.safetensors?¿Puedo usar un VAE de Wan 2.2 con Wan 2.7?¿Qué archivo uso para el workflow Remix?¿Qué significa "scaled" en wan2.2_i2v_low_noise_14b_fp8_scaled.safetensors?¿Dónde va el archivo VAE en ComfyUI?¿Cuánto pesa cada modelo?¿Los archivos GGUF funcionan con ComfyUI?¿Puedo usar el mismo modelo I2V para generación high noise y low noise?ResumenMás Publicaciones

Wan 2.2 en ComfyUI: guía completa del flujo de trabajo paso a paso para T2V e I2V (2026)
Configura Wan 2.2 en ComfyUI desde cero con esta guía detallada: instalación, modelos, grafos de nodos para texto a video (T2V) e imagen a video (I2V), optimización con GGUF y LightX2V, y solución de errores frecuentes.

Guía de continuación de video con Wan 2.7: extiende tus clips sin romper el movimiento
Aprende a usar la continuación de video con Wan 2.7 en wan27.org: extiende clips existentes, mantén la coherencia del movimiento, escribe prompts efectivos y evita los errores más comunes al ampliar tus videos generados con IA.
Boletín informativo
Únete a la comunidad
Suscríbete a nuestro boletín para recibir las últimas noticias y actualizaciones