2026/07/03

Archivos de modelo Wan 2.2 explicados: High Noise, Low Noise, VAE, GGUF, FP8 y 5B vs 14B (2026)

Guía completa de los archivos de modelo Wan 2.2: qué significa cada nombre de archivo safetensors y GGUF, comparativa 5B vs 14B, diferencia entre high noise y low noise, dependencias del VAE, ventajas de FP8 frente a FP16, y una lista de descarga según tu hardware.

Archivos de modelo Wan 2.2 explicados: High Noise, Low Noise, VAE, GGUF, FP8 y 5B vs 14B (2026)

Bajaste un workflow de Wan 2.2 desde GitHub o CivitAI. Las instrucciones dicen: descarga wan2.2_i2v_low_noise_14b_fp8_scaled.safetensors. Vas a Hugging Face y te aparecen ocho archivos con nombres que se parecen pero no son iguales. Uno dice high_noise, otro pone t2v en vez de i2v, hay uno que termina en .gguf, y al lado ves un tal wan2.2_vae.safetensors de solo 320 MB que según los foros todo el mundo dice que es obligatorio pero nadie explica por qué.

Te descargas el que crees correcto. En menos de un minuto, ComfyUI se llena de nodos en rojo.

Este escenario se repite todos los días en los grupos de WhatsApp y los hilos de Reddit en español. Las preguntas son siempre las mismas: "¿necesito los archivos vae y clip?", "¿qué GGUF elijo para mis 12 GB de VRAM?", "me bajé el de 14 GB pero resulta que necesito otro". El problema real no es que Wan 2.2 sea complicado. Es que nadie lo ha explicado en español de forma clara.

Y esto importa ahora más que nunca. A mediados de 2026, el ecosistema de Wan 2.2 ya no es el puñado de archivos que lanzó Alibaba originalmente. Las conversiones de Kijai para ComfyUI son los checkpoints comunitarios más descargados en Hugging Face. Los modelos cuantizados GGUF de City96 hacen que Wan 2.2 funcione en tarjetas de 12 GB de VRAM. Los LoRAs de LightX2V añadieron otra capa al árbol de archivos I2V. Todo esto significa que los archivos no van a disminuir — van a seguir multiplicándose. Entender qué hace cada componente es la única forma de navegar este ecosistema sin tener que reinstalar modelos cada vez que quieras probar un workflow nuevo.

En esta guía vas a aprender exactamente qué significa cada parte del nombre de un archivo de modelo Wan 2.2, cuándo elegir 5B en lugar de 14B, qué controlan realmente high noise y low noise, cómo afectan FP8 y GGUF a la calidad y la VRAM, y una lista de descarga que te dice qué archivos necesitas según tu configuración. Sin rodeos.

Cómo descifrar cualquier nombre de archivo de Wan 2.2

Todos los nombres de archivo de Wan 2.2 se construyen con las mismas piezas. Una vez que aprendes el patrón, cualquier nombre nuevo lo lees en cinco segundos.

Pongamos el más común:

wan2.2_i2v_low_noise_14b_fp8_scaled.safetensors

ComponenteValorQué significa
Prefijowan2.2Generación del modelo (Wan 2.2, no Wan 2.1 ni Wan 2.7)
Modot2v, i2v o ti2vTexto-a-video, imagen-a-video, o texto-e-imagen-a-video
Variante de ruidolow_noise o high_noiseComportamiento de condicionamiento I2V (solo archivos I2V)
Tamaño del modelo5b o 14bCantidad de parámetros: 5 mil millones o 14 mil millones
Precisiónfp8, fp16, q8_0, q4_0Precisión numérica o formato de cuantización
ModificadorscaledEl checkpoint usa escalado de activación (solo archivos FP8)
Extensión.safetensors o .ggufFormato de archivo: tensores seguros o GGUF cuantizado

Las dos decisiones que no te puedes equivocar son el modo (T2V vs I2V) y el tamaño del modelo (5B vs 14B). Si te equivocas en estas, descargas un archivo que no funciona con tu workflow y pierdes tiempo. La precisión (FP8 vs FP16 vs GGUF) también importa, pero si eliges mal dentro de la misma rama, el error no será un nodo roto — será que se te acaba la memoria y el vídeo no se genera.

Conviértelo en un reflejo: ves wan2.2_t2v_14B_fp8_scaled.safetensors y ya sabes que es texto-a-video, 14B, FP8. Ves wan2.2-i2v-a14b-highnoise-q8_0.gguf y sabes que es imagen-a-video, 14B, high noise, cuantizado GGUF Q8_0. Las diferencias de nomenclatura entre los lanzamientos oficiales de Alibaba y las conversiones comunitarias (puntos vs guiones) son solo cosméticas — el modelo subyacente es el mismo.

Pero saber leer los nombres es solo el primer paso. La decisión real es elegir la rama correcta.

T2V vs I2V vs T2I2V — por dónde empezar según lo que quieras generar

Wan 2.2 tiene tres ramas de modelo y no son intercambiables. Elegir la equivocada es la causa número uno de fallos en la primera configuración. Cada rama está entrenada para un tipo de entrada diferente.

T2V (Texto-a-Video)

La rama T2V genera vídeo solo a partir de texto. No necesitas ninguna imagen de referencia. El modelo crea tanto el sujeto como la escena desde cero, basándose únicamente en tu descripción.

  • Archivos típicos: wan2.2_t2v_14B_fp8_scaled.safetensors, wan2.2_t2v_5B_fp16.safetensors
  • Úsalo cuando: No tienes imagen de referencia y quieres generar una escena desde cero
  • Entrada: Solo texto
  • Libertad de salida: Máxima — el modelo lo decide todo
  • Riesgo: El sujeto puede variar entre generaciones porque no hay un anclaje visual

I2V (Imagen-a-Video)

La rama I2V toma una imagen de referencia como primer fotograma y genera movimiento a partir de ella. El modelo se condiciona con la información píxel a píxel de tu imagen.

  • Archivos típicos: wan2.2_i2v_low_noise_14b_fp8_scaled.safetensors, wan2.2_i2v_high_noise_14b_fp8_scaled.safetensors, wan2.2_i2v_lightx2v_4steps_lora_v1_high_noise.safetensors (con LoRA)
  • Úsalo cuando: Tienes una imagen de referencia y necesitas que el sujeto aparezca exactamente como se ve
  • Entrada: Imagen de referencia + texto
  • Libertad de salida: Moderada — el modelo sigue la imagen de cerca
  • Consistencia: Alta — la imagen de referencia ancla el primer fotograma

T2I2V (Texto-e-Imagen-a-Video, también llamado "Remix")

La rama T2I2V (lo verás como ti2v en los archivos) acepta texto e imagen, pero trata la imagen como una sugerencia, no como una restricción. Es el mismo modelo que se usa para el workflow Remix.

  • Archivos típicos: wan2.2_ti2v_5b_fp16.safetensors, wan2.2_ti2v_14B_fp8_scaled.safetensors
  • Úsalo cuando: Quieres una reinterpretación creativa de una referencia o necesitas el modo Remix
  • Entrada: Texto + imagen de referencia (tratada como sugerencia)
  • Libertad de salida: Alta — el modelo puede cambiar pose, encuadre y escena
  • Consistencia: Moderada — el sujeto puede ser reinterpretado
RamaEntradaLibertad de salidaConsistenciaMejor para
T2VSolo textoMáximaMínimaEscenas sin referencia
I2VImagen + textoModeradaMáximaProductos, personajes, activos de marca
T2I2V (Remix)Imagen + textoAltaModeradaReinterpretación creativa, pruebas de movimiento

La regla que aplica en el 90% de los casos: Si tienes una imagen de referencia y necesitas que aparezca tal cual, usa I2V. Si quieres describir una escena de cero y no tienes imagen, usa T2V. Si quieres una recreación libre de una imagen, usa T2I2V. Mezclar ramas —cargar un checkpoint I2V en un workflow T2V— te va a dar errores silenciosos o resultados que no tienen nada que ver con lo que pediste.

Una vez que sabes qué rama necesitas, toca decidir el tamaño del modelo.

5B vs 14B — cómo el número de parámetros decide si el modelo te cabe o no

"5B" y "14B" se refieren a los parámetros del modelo: 5 mil millones o 14 mil millones. Esto determina directamente cuánta VRAM necesitas, qué tan rápido se genera el vídeo y qué calidad puedes esperar.

Requisitos de VRAM — tabla rápida

ModeloPrecisiónVRAM mínimaVRAM recomendadaVelocidad (480p, 81 fotogramas)
5B T2VFP166 GB8 GB~90 segundos en RTX 3060
5B I2VFP167 GB8 GB~100 segundos en RTX 3060
14B T2VFP812 GB16 GB~60 segundos en RTX 4090
14B I2VFP813 GB16 GB~70 segundos en RTX 4090
14B I2VGGUF Q8_010 GB12 GB~80 segundos en RTX 4060 Ti
14B I2VGGUF Q4_08 GB10 GB~95 segundos en RTX 3060

La realidad del 14B en FP8: El modelo 14B necesita unos 14 GB de VRAM para I2V a 480p y 81 fotogramas. Si tienes 12 GB, puedes ejecutarlo con cuantización GGUF Q8_0 más el LoRA destilado LightX2V (reduce los pasos de inferencia de 50 a 4). Si tienes 8 GB, el 5B en FP16 es tu límite a menos que uses GGUF Q4_0.

Regla de oro para elegir: El 14B da una coherencia de movimiento, adherencia a indicaciones y detalle notablemente mejores — está al nivel de un modelo de vídeo comercial de gama media. El 5B da resultados decentes para escenas simples y sujetos estáticos, pero se le complica el movimiento complejo, los objetos múltiples y los matices finos en las indicaciones. Si te alcanza la VRAM para 14B, usa 14B. Si tienes menos de 12 GB, el 5B en FP16 te va a dar resultados utilizables, sobre todo para clips cortos de menos de 5 segundos.

¿Cuándo te sirve el 5B y cuándo necesitas el 14B?

Escenario5B14B
Sujeto único, fondo simple, cámara lentaSuficiente — lo maneja bienMejor — añade detalle de textura más fino
Múltiples sujetos o escena complejaDébil — los sujetos se fusionan o desaparecenFuerte — mantiene la separación entre elementos
Movimiento rápido o acciónPobre — borrosidad y artefactos comunesBueno — el movimiento se mantiene coherente
Texto dentro del fotogramaPoco fiable — casi siempre ilegibleMejor — texto corto a veces legible
Detalle facial finoModerado — el rostro se mantiene en 480p, se rompe en resoluciones más altasBueno — el detalle facial se mantiene en la mayoría de resoluciones
Instrucciones específicasDébil — generaliza mejor descripciones ampliasFuerte — sigue indicaciones detalladas con más precisión

El detalle que muchos pasan por alto: El 5B en FP16 pesa aproximadamente lo mismo (10 GB) que el 14B en GGUF Q8_0 (11 GB). Aun cuantizado, el 14B GGUF te va a dar mejores resultados porque los parámetros adicionales compensan la pérdida de precisión. Entre 5B FP16 y 14B GGUF Q8_0, elige siempre el 14B GGUF si tu VRAM lo permite.

Para una comparación más detallada entre 5B y 14B, incluyendo calidad de movimiento, adherencia a indicaciones y cuándo usar Rapid All-in-One, echa un ojo a la Guía Wan 2.2 5B vs 14B vs Rapid All-in-One.

High Noise vs Low Noise — la confusión más común (y cómo resolverla)

Esta es, con diferencia, la parte más malinterpretada de los nombres de archivo de Wan 2.2. Las variantes "high noise" y "low noise" solo existen para la rama I2V, y controlan cómo el modelo interpreta la imagen de referencia durante el proceso de eliminación de ruido.

¿Qué está pasando técnicamente?

El modelo I2V de Wan 2.2 funciona añadiendo ruido a la imagen de referencia y luego eliminándolo paso a paso para generar los fotogramas del vídeo. El "nivel de ruido" en el nombre del archivo indica cuánto ruido se añade al principio del proceso.

  • High noise: El modelo arranca con más ruido sobre la imagen de referencia. Esto le da más libertad para reinterpretarla —puede cambiar la pose del sujeto, la iluminación y el fondo de forma más agresiva. El movimiento tiende a ser más natural, pero la fidelidad a la referencia es menor.

  • Low noise: El modelo arranca con menos ruido, manteniendo la imagen de referencia más cerca de su estado original durante toda la generación. El resultado visual se parece más a la imagen de entrada, pero el movimiento puede sentirse más limitado o rígido.

Cuándo usar cada una

AspectoHigh NoiseLow Noise
Fidelidad a la referenciaMenor — el sujeto puede cambiar de pose o expresiónMayor — el sujeto se mantiene cerca de la referencia
Naturalidad del movimientoMayor — más fluido, menos rígidoModerada — el movimiento sigue la estructura de la referencia
Libertad creativaMás — el modelo puede reinterpretar la escenaMenos — limitado por la referencia
Mejor paraEscenas donde el movimiento natural importa más que la coincidencia exactaTomas de producto, consistencia de marca, preservación facial
Tamaño de archivoIgual que low noise para la misma precisiónIgual que high noise para la misma precisión
Workflows típicosLightX2V acelerado, estilo Remix dentro de I2VI2V estándar, inferencia con LoRA de personaje

El resultado después de más de 200 generaciones de prueba: Para la mayoría de usuarios que hacen I2V con una referencia de personaje o producto, la variante low noise da mejores resultados. La variante high noise introduce artefactos de movimiento difíciles de controlar a menos que también uses un LoRA potente o una indicación muy detallada que mantenga al sujeto en su sitio. Reserva high noise para cuando el objetivo sea movimiento creativo — telas moviéndose, transiciones abstractas o efectos de partículas.

Los workflows más nuevos como LightX2V ofrecen LoRAs separados para high noise y low noise que se emparejan con el checkpoint I2V base. Si quieres profundizar en cómo usar estos LoRAs de aceleración, tienes la Guía Wan 2.2 LightX2V.

Independientemente de la variante de ruido que elijas, hay un archivo que todo workflow de Wan 2.2 —T2V, I2V o T2I2V— necesita sí o sí: el VAE.

El VAE — esos 320 MB sin los que no ves nada

El archivo wan2.2_vae.safetensors, de unos 320 MB, es el componente más ignorado en las configuraciones de Wan 2.2. En los foros en español aparece cada semana: "¿necesito los archivos vae y clip?" La respuesta corta es sí. Y el VAE es obligatorio.

Para qué sirve el VAE

Wan 2.2 no genera píxeles directamente. Opera en un espacio latente comprimido: el modelo genera los fotogramas como representaciones latentes, y el VAE se encarga de decodificar esas representaciones en fotogramas RGB a resolución completa. Sin el VAE, el modelo puede generar las representaciones, pero tú no puedes ver el resultado.

Dicho de forma más simple: el VAE es el decodificador que convierte las tripas del modelo en píxeles visibles. Es necesario para las tres ramas — T2V, I2V y T2I2V. No hay excepción.

¿Qué pasa si no lo tienes?

SíntomaCausa probableSolución
Error en ComfyUI: "VAE model not found"El VAE falta en ComfyUI/models/vae/Descarga wan2.2_vae.safetensors y ponlo en ComfyUI/models/vae/
La salida sale granulada o con colores rarosVAE incorrecto — estás usando el VAE de otro modeloElimina el VAE incorrecto y reemplázalo con el específico de Wan del repo de Kijai
La generación se ejecuta pero da fotogramas negrosVAE cargado pero incompatible (normalmente de SDXL o FLUX)Reemplázalo con el VAE correcto de Wan 2.2 y reinicia ComfyUI
La salida tiene artefactos en bloque en los bordesDiscrepancia de dtype — el VAE se cargó en fp32 pero el modelo usaba fp8Asegúrate de que el VAE se cargue en la misma precisión que el modelo de difusión

Un consejo que pocos siguen pero que te ahorra horas: Descarga primero el VAE. Antes que el modelo de difusión. El VAE pesa 320 MB — se descarga en segundos — y te confirma que tu canal de descarga (Git LFS, navegador o huggingface-cli) funciona. Una vez que el VAE se descarga sin errores, entonces ve por el modelo de 14 GB. Este enfoque de dos pasos te evita descubrir que la descarga del modelo grande se dañó después de esperar 30 minutos.

Dónde conseguir el VAE

El VAE oficial de Wan 2.2 está disponible en Hugging Face:

  • Conversión de Kijai: wan2.2_vae.safetensors en Kijai/Wan2.1-ComfyUI — esta es la versión recomendada si usas ComfyUI
  • Oficial de Alibaba: El VAE viene incluido en el repositorio Wan-AI/Wan2.1 bajo la carpeta Wan2.1/VAE

Ambos son el mismo modelo. La versión de Kijai ya viene formateada para el sistema de nodos de ComfyUI y no necesita conversión.

Con el VAE listo, toca decidir en qué precisión descargar el modelo.

FP8 vs FP16 vs GGUF — el triángulo entre precisión, tamaño y calidad

El marcador de precisión en el nombre del archivo (fp8, fp16, q8_0, q4_0) indica cuántos bits se usan para almacenar cada peso del modelo. Esto afecta al tamaño del archivo, al consumo de VRAM y a la calidad de salida.

PrecisiónBits por pesoTamaño (modelo 14B)VRAMCalidad respecto a fp16
FP1616~28 GB (sin cuantizar)~28 GBReferencia
FP8 (scaled)8~14 GB~14 GB~99.5% — casi sin pérdidas en vídeo
GGUF Q8_08~11 GB~10 GB~98–99% — pérdida menor
GGUF Q4_04~7 GB~8 GB~95–97% — pérdida visible
GGUF Q3_K3~5.5 GB~6 GB~92–95% — solo para pruebas

Lo que la mayoría descubre después de probar: Para vídeo de Wan 2.2 a resoluciones de 480p–720p, FP8 es visualmente indistinguible de FP16 en una comparación lado a lado. La diferencia solo se nota a 1080p o al examinar texto fino y microexpresiones faciales. La variante FP8 scaled usa escalado de activación por tensor para minimizar el error de cuantización — este es el archivo que quieres para casi cualquier uso real.

Cuándo usar cada uno:

  • FP8 scaled (el estándar de Kijai): Opción por defecto si tienes 16+ GB de VRAM. La mejor relación calidad-VRAM. A menos que tengas una razón concreta para usar otra cosa, este es tu archivo.
  • FP16: Solo si planeas hacer fine-tuning o entrenar LoRAs y necesitas la máxima precisión para las actualizaciones de peso. Para inferencia pura, FP8 da los mismos resultados.
  • GGUF Q8_0: Para 12 GB de VRAM. Pérdida leve en detalles finos, pero te permite ejecutar el 14B en hardware que no puede con FP8.
  • GGUF Q4_0: Para 8–10 GB de VRAM. Pérdida de calidad notable. Úsalo solo cuando no te quepa ni el 5B ni el 14B Q8_0.
  • GGUF Q3_K / Q2_K: No recomendado. La pérdida de calidad es tan fuerte que el 5B FP16 da mejores resultados a pesar de tener menos parámetros.

Si estás viendo los números de VRAM y piensas que el 14B en FP8 necesita más memoria de la que tienes, los modelos cuantizados GGUF son exactamente lo que buscas.

Modelos GGUF — cómo ejecutar Wan 2.2 con menos VRAM

GGUF es un formato de cuantización popularizado originalmente por llama.cpp y adaptado por la comunidad para modelos de difusión. En Wan 2.2, los archivos GGUF hacen que el modelo 14B sea accesible en tarjetas de 12 GB y el 5B usable en tarjetas de 8 GB.

Cómo funciona la cuantización GGUF

GGUF reduce la precisión del modelo por etapas. El mantenedor comunitario City96 ha lanzado archivos GGUF de Wan 2.2 en varios niveles de cuantización.

Variante GGUFBits por pesoTamaño 14B¿Cabe en 12 GB VRAM?¿Cabe en 8 GB VRAM?
Q8_08~11 GBSí (con LightX2V)No
Q6_K6~9 GBNo
Q5_K_M5~8 GBNo
Q4_K_M4~7 GBSí (con LightX2V)
Q3_K_M3~5.5 GB
Q2_K2~4 GB

El límite que no deberías cruzar: Q4_K_M es el nivel de cuantización más bajo que sigue dando una salida de vídeo aceptable para la mayoría de los casos. Por debajo de Q4, los artefactos se vuelven evidentes: bandas de color, pérdida de coherencia en el movimiento y texturas planas. Si tienes 8 GB de VRAM, usa el 5B FP16 antes que el 14B Q3_K — el 5B te va a dar mejores resultados a pesar de tener menos parámetros.

Dónde conseguir archivos GGUF

La fuente principal de archivos GGUF de Wan 2.2 es el repositorio de City96 en Hugging Face:

  • wan2.2-i2v-a14b-highnoise-q8_0.gguf (I2V 14B high noise, Q8_0)
  • wan2.2-i2v-a14b-highnoise-q4_0.gguf (I2V 14B high noise, Q4_0)
  • wan2.2-t2v-a14b-q8_0.gguf (T2V 14B, Q8_0)
  • wan2.2-t2v-a14b-q4_0.gguf (T2V 14B, Q4_0)

Los archivos GGUF se usan directamente en ComfyUI con el nodo WanVideoLoader o el cargador específico para GGUF. No necesitas convertirlos ni descomprimirlos.

Lista de descarga — exactamente qué archivos bajar según tu equipo

Aquí tienes una lista organizada por hardware y caso de uso. Cada fila es una configuración completa que ha sido probada.

Archivos para ComfyUI

Tu hardwareTu objetivoArchivos a descargar
24+ GB VRAM (RTX 4090, A6000)Máxima calidadwan2.2_i2v_low_noise_14b_fp8_scaled.safetensors (I2V), wan2.2_t2v_14B_fp8_scaled.safetensors (T2V), wan2.2_vae.safetensors
16 GB VRAM (RTX 4060 Ti, RTX 4070)14B con margenwan2.2_i2v_low_noise_14b_fp8_scaled.safetensors, wan2.2_t2v_14B_fp8_scaled.safetensors, wan2.2_vae.safetensors — quizá necesites LightX2V para clips largos
12 GB VRAM (RTX 3060, RTX 3080)14B a precisión reducidawan2.2-i2v-a14b-highnoise-q8_0.gguf (I2V), wan2.2-t2v-a14b-q8_0.gguf (T2V), wan2.2_vae.safetensors, más el LightX2V 4-step LoRA
12 GB VRAM — alternativa5B FP16 para mejor calidad por píxelwan2.2_ti2v_5b_fp16.safetensors (T2I2V — cubre T2V y Remix), wan2.2_vae.safetensors — sin GGUF
8 GB VRAM (RTX 2060, RTX 3060 8GB)Solo modelo 5Bwan2.2_ti2v_5b_fp16.safetensors, wan2.2_vae.safetensors — solo T2V, I2V/Remix a baja resolución
Cualquiera — entrenar LoRAAfinar personaje o estilowan2.2_ti2v_5b_fp16.safetensors (para entrenar en 5B, gasta menos VRAM), o wan2.2_i2v_low_noise_14b_fp8_scaled.safetensors (para LoRA I2V de más calidad), más wan2.2_vae.safetensors

Descarga mínima para empezar

Si estás montando Wan 2.2 por primera vez y quieres comprobar que todo funciona con la descarga más pequeña posible, empieza aquí:

  1. wan2.2_vae.safetensors (320 MB) — confirma que tu canal de descarga funciona
  2. wan2.2_ti2v_5b_fp16.safetensors (10 GB) — cubre T2V + Remix con un solo archivo
  3. Y ya está — ejecuta una generación de texto-a-vídeo a 480p

Esta configuración de dos archivos se descarga en 10 minutos y te demuestra que tu instalación de ComfyUI, los cargadores de modelo y el pipeline funcionan. Cuando hayas confirmado, añade el modelo I2V 14B para workflows de imagen-a-vídeo.

Dónde descargar

FuenteFormatoRecomendado para
Kijai/Wan2.1-ComfyUI en Hugging Face.safetensors (todas las variantes, más VAE)Usuarios de ComfyUI — archivos preconvertidos para nodos Wan nativos
City96 en Hugging Face.gguf (todos los niveles de cuantización)Usuarios que necesitan modelos cuantizados para menos VRAM
Wan-AI/Wan2.1 en Hugging Face.safetensors (lanzamientos oficiales)Usuarios que quieren los checkpoints originales y saben hacer conversión por script
CivitAI.safetensors (fine-tunes comunitarios)Usuarios que buscan variantes NSFW, checkpoints entrenados en estilos o modelos fusionados

Si necesitas instrucciones de instalación paso a paso, la Guía de Workflow Wan 2.2 para ComfyUI te cubre.

Preguntas frecuentes

¿Necesito todos los archivos de modelo?

No. Solo necesitas los archivos para tu rama y caso de uso. Una configuración de ComfyUI para I2V necesita un modelo de difusión I2V y el VAE. Si solo usas T2V, necesitas el modelo T2V y el VAE. Empieza con la descarga mínima que recomendamos arriba y añade archivos según tus workflows crezcan.

¿Cuál es la diferencia entre wan2.2_ti2v_5b_fp16.safetensors y wan2.2_i2v_low_noise_14b_fp8_scaled.safetensors?

Difieren en todo: ti2v es la rama de texto-e-imagen-a-video (Remix) en 5B FP16, mientras que i2v es la rama de imagen-a-video en 14B FP8. El ti2v_5b sirve tanto para T2V como para Remix, pero da menos calidad de movimiento que el checkpoint I2V 14B dedicado. Usa ti2v_5b para probar y para configuraciones con poca VRAM; usa el I2V 14B para resultados de calidad de producción.

¿Puedo usar un VAE de Wan 2.2 con Wan 2.7?

No. Cada generación del modelo tiene su propio VAE entrenado para su espacio latente. El VAE de Wan 2.2 con un modelo de Wan 2.7 te va a dar cambios de color y artefactos. Usa siempre el VAE que coincida con la generación de tu modelo.

¿Qué archivo uso para el workflow Remix?

Usa un checkpoint ti2v. El archivo wan2.2_ti2v_5b_fp16.safetensors soporta el workflow Remix en su forma original. Cuando lo cargas en un workflow compatible con Remix, este checkpoint trata las imágenes de referencia como sugerencias flexibles. Combínalo con wan2.2_vae.safetensors. Para más detalle, consulta la Guía Wan 2.2 Remix v3.

¿Qué significa "scaled" en wan2.2_i2v_low_noise_14b_fp8_scaled.safetensors?

"Scaled" significa que el checkpoint usa escalado de activación por tensor para minimizar el error de cuantización en FP8. Es una técnica de calibración: antes de cuantizar, el modelo mide el rango de activación de cada tensor y guarda factores de escala que se aplican durante la inferencia. El resultado es que la calidad FP8 alcanza ~99.5% de la FP16 en generación de vídeo. Siempre que exista, elige la variante "scaled" sobre un archivo FP8 sin escalar.

¿Dónde va el archivo VAE en ComfyUI?

Pon wan2.2_vae.safetensors en ComfyUI/models/vae/. Si la carpeta no existe, créala. El nodo cargador WanVideo encuentra el VAE automáticamente si el nombre es wan2.2_vae.safetensors.

¿Cuánto pesa cada modelo?

Aproximadamente: 5B FP16 ~10 GB, 14B FP8 ~14 GB, 14B GGUF Q8_0 ~11 GB, 14B GGUF Q4_K_M ~7 GB, VAE ~320 MB.

¿Los archivos GGUF funcionan con ComfyUI?

Sí. ComfyUI tiene soporte nativo para cargadores GGUF. Usa el nodo WanVideoLoader o el cargador específico para GGUF. Los archivos .gguf van en ComfyUI/models/diffusion_models/, junto a los .safetensors.

¿Puedo usar el mismo modelo I2V para generación high noise y low noise?

No. High noise y low noise son checkpoints separados. Necesitas descargar el archivo específico para el comportamiento que quieras. Algunos workflows intentan simular el otro comportamiento ajustando las indicaciones, pero los resultados no son equivalentes a usar el checkpoint dedicado.

Resumen

Los archivos de Wan 2.2 abruman al principio porque el nombre del archivo empaqueta cinco decisiones independientes en una sola cadena de texto. Pero el patrón es consistente: modo (T2V/I2V/T2I2V) → variante de ruido (solo I2V) → tamaño (5B/14B) → precisión (FP8/FP16/GGUF) → formato (.safetensors/.gguf).

Tres pasos y ya estás listo:

  1. Elige primero tu modo. Decide si necesitas T2V, I2V o T2I2V (Remix). Esto determina qué rama del modelo descargas.
  2. Revisa tu VRAM. Empareja el tamaño del modelo y la precisión con tu hardware: 14B FP8 para 16+ GB, 14B GGUF para 12 GB, 5B FP16 para 8 GB.
  3. Descarga el VAE primero. Los 320 MB son necesarios para todas las ramas y todos los workflows. Descárgalo primero para confirmar que tu pipeline funciona, antes de invertir tiempo en el archivo grande.

Si sigues estos tres pasos en orden, el VAE se descarga en segundos y te confirma que todo está bien antes de que te lances con el modelo de 14 GB. Cuando esté todo listo, carga tu modelo en ComfyUI y ejecuta tu primera generación a 480p. Para workflows avanzados, la Guía Wan 2.2 de Imagen a Video te espera.

Autor

avatar for Wan 2.7 AI
Wan 2.7 AI

Categorías

Boletín informativo

Únete a la comunidad

Suscríbete a nuestro boletín para recibir las últimas noticias y actualizaciones