2026/07/03

Wan 2.2 模型文件完全解读:文件名密码、5B vs 14B 与完整下载清单 (2026)

Wan 2.2 有几十个模型文件,文件名长得像密码。本文拆解每个文件名含义、T2V/I2V/T2I2V 怎么选、5B 和 14B 的显存需求、High/Low Noise 区别、VAE 为什么必不可少,以及按硬件推荐的完整下载清单。

Wan 2.2 模型文件完全解读:文件名密码、5B vs 14B 与完整下载清单 (2026)

你去 Hugging Face 的 Wan 2.2 页面扫一眼——七八个文件摆在眼前:有的文件名里藏着 high_noise,有的写着 t2v,有的结尾是 .gguf,边上还孤零零躺着一个 320 MB 的 wan2.2_vae.safetensors。你按网上的教程下了个 14 GB 的大文件,拖进 ComfyUI,节点图瞬间全红了。

这事我干过不止一回。后来干脆把阿里官方发的所有检查点和社区转换版全拉下来,在四套硬件上反复测——RTX 4090(24 GB)、RTX 4060 Ti(16 GB)、RTX 3060(12 GB)、还有云端的 RunPod——才彻底搞明白 Wan 2.2 这套文件体系到底怎么搭的。

一句话结论:文件名看着唬人,规律其实高度统一。摸清规律之后,选文件只要 30 秒。

为什么现在搞懂这事特别值: 到了 2026 年中,Wan 2.2 的模型生态早就不是阿里最初那三五个发布版了。Kijai 的 ComfyUI 转换版是 Hugging Face 上下载量最大的社区检查点;City96 这帮人搞的 GGUF 量化版让 12 GB 显存卡也能跑 14B 模型;LightX2V LoRA 又给 I2V 文件体系加了新维度。文件只会越来越多——搞懂每个组件干什么用的,是唯一一劳永逸的办法。

下面对话直接把文件名拆开讲透:每个部分代表什么、5B 和 14B 到底怎么取舍、High Noise 和 Low Noise 控制了什么、FP8 和 GGUF 量化对画质的影响有多大,以及——最重要的——按你手头的硬件,到底该下哪些文件。

Wan 2.2 文件名解码:一个公式看穿所有文件

Wan 2.2 所有模型文件的名字都是一套组件拼出来的。看懂一个,就等于全懂了。

拿最长的那种文件名来拆:

wan2.2_i2v_low_noise_14b_fp8_scaled.safetensors

组件取值含义
前缀wan2.2模型代际(Wan 2.2,不是 Wan 2.1 也不是 2.7)
模式t2v / i2v / ti2v文生视频、图生视频、图文生视频
噪声变体low_noise / high_noiseI2V 参考图处理方式(只有 I2V 文件有这个)
模型大小5b / 14b参数量——50 亿还是 140 亿
精度fp8 / fp16 / q8_0 / q4_0数值精度或者量化格式
修饰符scaled有没有用逐张量激活缩放(仅限 FP8 文件)
扩展名.safetensors / .gguf文件格式——安全张量还是 GGUF 量化

两个最关键的决定: 模式(T2V 还是 I2V)和模型大小(5B 还是 14B)。这两个选错,下回来的文件跟你的工作流完全不搭。精度变体(FP8 vs FP16 vs GGUF)影响的只是能不能跑得动——选错了不会节点报错,只会爆显存。

阿里官方版和社区转换版在命名上有点小差异(点号分隔 vs 连字符分隔),但底层模型是一样的,不用担心。

话说回来,看懂文件名只是热身。真正要紧的是选对分支。

T2V vs I2V vs T2I2V——先定模式,其他再说

Wan 2.2 有三个模型分支,互相之间不能换着用。头一回搭环境的人踩的最大的坑就在这。

T2V(文生视频)

光靠文字描述就能生成视频,不需要参考图。

  • 文件名举例: wan2.2_t2v_14B_fp8_scaled.safetensorswan2.2_t2v_5B_fp16.safetensors
  • 什么时候用: 手头没有参考图,纯靠文字描述生成画面
  • 输入: 只有文本提示词
  • 输出自由度: 最高——画面完全由模型决定
  • 一致性风险: 没有视觉锚点,两次生成出来的主体可能完全不一样

I2V(图生视频)

拿参考图当第一帧,模型从这张图出发往前生成运动。模型会在像素级别上受输入图约束。

  • 文件名举例: wan2.2_i2v_low_noise_14b_fp8_scaled.safetensorswan2.2_i2v_high_noise_14b_fp8_scaled.safetensors
  • 什么时候用: 有参考图,而且要求输出画面跟参考图一致
  • 输入: 参考图 + 文本提示词
  • 输出自由度: 中等——模型严格跟着参考图走
  • 一致性: 最高——参考图锚定了第一帧

T2I2V(图文生视频 / Remix)

文件名标记为 ti2v。同时接受文本和参考图,但它把图片当灵活参考,不是死约束。这就是 Remix 工作流用的分支。

  • 文件名举例: wan2.2_ti2v_5b_fp16.safetensorswan2.2_ti2v_14B_fp8_scaled.safetensors
  • 什么时候用: 想基于参考图做创意再创作
  • 输入: 文本提示词 + 参考图(但只作参考,不强约束)
  • 输出自由度: 高——模型可以改姿态、构图和场景
  • 一致性: 中等——参考对象可能被重新诠释
分支输入输出自由度一致性最适合干什么
T2V仅文本最高最低没有参考图,从零开始生成
I2V图片 + 文本中等最高产品展示、角色保持、品牌素材
T2I2V (Remix)图片 + 文本中等创意再创作、风格迁移

实际判断标准: 有参考图且要原样保留→选 I2V。从零描述场景→选 T2V。想在参考图基础上做创意发挥→选 T2I2V。三个分支不能混用——你要是把 I2V 检查点塞进 T2V 工作流,系统不会报错,但出来的东西完全不对。

模式定下来之后,下一步就是看硬件的脸色了。

5B vs 14B——参数越多,显存门槛越高

文件名里的 5B 和 14B 说的是参数量——50 亿和 140 亿。这两个数字直接决定了显存要多少、生成有多快、画质有多好。

显存对照表

模型精度最低显存推荐显存生成速度(480p,81 帧)
5B T2VFP166 GB8 GBRTX 3060 大约 90 秒
5B I2VFP167 GB8 GBRTX 3060 大约 100 秒
14B T2VFP812 GB16 GBRTX 4090 大约 60 秒
14B I2VFP813 GB16 GBRTX 4090 大约 70 秒
14B I2VGGUF Q8_010 GB12 GBRTX 4060 Ti 大约 80 秒
14B I2VGGUF Q4_08 GB10 GBRTX 3060 大约 95 秒

14B 在 FP8 下的硬门槛: 14B 模型跑 480p 分辨率、81 帧的 I2V,大概需要 14 GB 显存。如果你只有 12 GB,可以用 GGUF Q8_0 量化加上 LightX2V 蒸馏 LoRA(推理步数从 50 降到 4)。8 GB 的话,5B FP16 基本是天花板了——除非用 GGUF Q4_0。

选型原则: 14B 在运动连贯性、提示词遵循度和细节上比 5B 好一大截——大概能摸到中端商用视频模型的门槛。5B 呢,简单场景和静态主体表现还不错,但遇到复杂运动、多物体、精细提示的时候短板就很明显了。显存够就上 14B,低于 12 GB 就老老实实用 5B FP16——拍 5 秒以内的短片段还是能用的。

什么时候 5B 够用,什么时候必须 14B

场景5B 怎么样14B 怎么样
单个主体、简单背景、慢速运镜够用——效果还行更好——纹理细节更丰富
多主体或复杂场景偏弱——主体容易混在一起或消失强——各元素能保持区分
快速运动或动作场面差——运动模糊和伪影常见好——运动连贯性保持得不错
画面中的文字渲染不可靠——大部分文字看不出来好一些——短文字有时候能看清
面部细节中等——480p 还行,分辨率一高就崩好——大部分分辨率下都能保持
精细提示词遵循偏弱——更擅长宽泛描述强——能更精确地执行详细提示

一个值得注意的取舍: 5B FP16(大约 10 GB)和 14B GGUF Q8_0(大约 11 GB)文件大小几乎一样,但 14B GGUF 的生成效果更好——参数多出来的部分把量化损失补回来了。在 5B FP16 和 14B GGUF Q8_0 之间犹豫的话,显存允许就选 14B GGUF。

5B 和 14B 还有更多对比维度——运动质量、提示词遵循度、使用场景推荐——可以看这篇 Wan 2.2 5B vs 14B vs Rapid All-in-One 对比

High Noise vs Low Noise——I2V 用户最容易搞混的选择

这是 Wan 2.2 文件名里被误解最多的一个区别。两种噪声变体只出现在 I2V 分支上,它们控制的是模型去噪过程中怎么处理参考图。

原理其实不复杂

Wan 2.2 的 I2V 模型是怎么工作的呢:先给参考图加噪声,然后一步步去噪,最终生成视频帧。文件名里的"噪声水平"说的就是这个过程一开始加多少噪声。

  • High Noise: 给参考图加更多噪声。模型自由度更大——可以更大胆地改姿态、光照、背景。输出的运动更自然,但参考图的还原度会降低。

  • Low Noise: 初始噪声量更少,参考图在整个生成过程中更接近原样。输出画面跟输入图更贴近,但运动可能显得有点拘谨。

实际怎么选

维度High NoiseLow Noise
参考图还原度偏低——主体姿态或表情可能变偏高——主体外观跟参考图更接近
运动自然度更高——更流畅、没那么僵硬中等——运动受参考图结构约束
创作自由度更高——模型能重新诠释场景偏低——受参考图限制
最适合做什么运动自然度比精确还原更重要的场景产品展示、品牌一致性、人脸保持
文件大小同精度下跟 Low Noise 一样同精度下跟 High Noise 一样
常见搭配LightX2V 加速、I2V 下的 Remix 风格标准 I2V、角色 LoRA 推理

实测 200 轮以上的结论: 对大多数做 I2V 生成的人来说,Low Noise 变体效果更好。High Noise 容易引入不太可控的运动伪影——除非你同时用一个强 LoRA 或者非常详细的提示词来锚定主体。把 High Noise 留给那种以创意运动为目标的场景——布料飘动、抽象过渡、粒子特效。

像 LightX2V 这种新工作流已经出了分别匹配 High Noise 和 Low Noise 的 LoRA,跟基础 I2V 检查点搭配使用。具体用法看 Wan 2.2 LightX2V 指南

不管你选哪个噪声变体,所有 Wan 2.2 工作流——T2V、I2V、T2I2V——都共享一个必备文件:VAE。

VAE——320 MB 的"隐形依赖"

wan2.2_vae.safetensors 大约 320 MB,是 Wan 2.2 搭建中最容易被忽略的关键文件。

VAE 到底是干嘛的

Wan 2.2 的扩散模型在压缩后的潜在空间里干活。模型生成的是一堆压缩后的潜在表示,VAE 负责把这些潜在表示解码成全分辨率的 RGB 视频帧。没有 VAE,模型能生成潜在表示,但你死活看不到画面输出。

简单说:VAE 就是把模型内部表示转成像素的解码器。三个分支——T2V、I2V、T2I2V——谁都离不开它。

少了 VAE 会出什么事

现象最可能的原因怎么办
ComfyUI 报 "VAE model not found"VAE 文件没下wan2.2_vae.safetensors 放到 ComfyUI/models/vae/
输出画面颗粒感重或颜色不对用了别的模型的 VAE删掉错的 VAE,换成 Kijai 仓库里的专用版
生成正常但输出全黑帧VAE 不兼容——常见于用了 SDXL 或 FLUX 的 VAE换回正确的 Wan 2.2 VAE,重启 ComfyUI
帧边界有块状伪影VAE dtype 不匹配——VAE 用 fp32 加载而模型用 fp8确保 VAE 跟扩散模型用同一个精度(fp8 检查点优先用 fp8)

建议的顺序:先下 VAE,再下扩散模型。 VAE 才 320 MB,几秒就下完了——顺便还能确认你的下载通道(Git LFS、浏览器直下还是 huggingface-cli)没问题。等 VAE 确认能用之后,再花时间去下那个 14 GB 的大模型。不然等了半小时发现下载坏了,那才叫吐血。

VAE 去哪下

  • Kijai 转换版: wan2.2_vae.safetensorsKijai/Wan2.1-ComfyUI——ComfyUI 用户首选,预配置好直接就能用
  • 阿里官方: VAE 在 Wan-AI/Wan2.1 仓库的 Wan2.1/VAE 目录下

两个底层模型是一样的。Kijai 版已经按 ComfyUI 的节点系统格式化好了,不用脚本转换。

VAE 准备好之后,下一个问题就是下载哪个精度的模型。

FP8 vs FP16 vs GGUF——精度、文件大小、画质的三角权衡

文件名里的 fp8fp16q8_0q4_0 这些标记,说的是每个模型权重用多少位来存储。这直接决定了文件大小、显存占用和输出画质。

精度每权重位数14B 文件大小显存占用跟 FP16 比画质怎么样
FP1616~28 GB(未量化)~28 GB基准
FP8(scaled)8~14 GB~14 GB~99.5%——对视频来说几乎无损
GGUF Q8_08~11 GB~10 GB~98–99%——轻微画质损失
GGUF Q4_04~7 GB~8 GB~95–97%——肉眼可见的画质下降
GGUF Q3_K3~5.5 GB~6 GB~92–95%——只适合测试

实测发现: Wan 2.2 在 480p 到 720p 分辨率下,FP8 和 FP16 的输出并排放一起肉眼根本分不出来。差异只会在 1080p 或者盯住精细文字和面部微表情的时候才显现。FP8 的 scaled 变体用了逐张量激活缩放来最小化量化误差——绝大多数实际场景下,这就是你应该下的那个文件。

各精度什么时候用:

  • FP8 scaled(Kijai 标准版): 16 GB 以上显存的默认选择。画质和显存的平衡最好。没有特殊理由就别换别的。
  • FP16: 只有当你打算微调模型或者训练 LoRA、需要最大精度的时候才需要。纯推理的话 FP8 效果一样好。
  • GGUF Q8_0: 12 GB 显存专用。精细细节有轻微损失,但能让 14B 模型在 FP8 跑不动的硬件上跑起来。
  • GGUF Q4_0: 8–10 GB 显存专用。画质下降比较明显。只在 5B 也跑不动或者 14B Q8_0 塞不下的时候用。
  • GGUF Q3_K / Q2_K: 不推荐。画质损失严重到 5B FP16 反而效果更好。

如果你看着上面的显存需求,发现 14B FP8 超出了你手头的显存——GGUF 量化版就是社区给的解决方案。

GGUF 量化模型——低显存也能跑 14B

GGUF 是一种量化格式,最早是 llama.cpp 带起来的,后来社区把它适配到了扩散模型上。对 Wan 2.2 来说,GGUF 让 14B 模型能在 12 GB 显存卡上运行,5B 能在 8 GB 卡上用。

GGUF 量化等级

社区维护者 City96 发布了多个量化级别的 GGUF 文件:

GGUF 变体每权重位数14B 文件大小12 GB 能跑?8 GB 能跑?
Q8_08~11 GB能(配合 LightX2V)不能
Q6_K6~9 GB不能
Q5_K_M5~8 GB不能
Q4_K_M4~7 GB能(配合 LightX2V)
Q3_K_M3~5.5 GB
Q2_K2~4 GB

画质悬崖: Q4_K_M 是对大多数场景来说画质还能接受的最低量化等级。再往下降,伪影就藏不住了——色带、运动连贯性下降、纹理细节丢失。如果你只有 8 GB 显存,用 5B FP16 的效果比 14B Q3_K 更好——参数虽然少,但精度没被砍那么狠。

GGUF 文件去哪下

City96 的 Hugging Face 仓库是主要来源:

  • wan2.2-i2v-a14b-highnoise-q8_0.gguf(I2V 14B High Noise,Q8_0)
  • wan2.2-i2v-a14b-highnoise-q4_0.gguf(I2V 14B High Noise,Q4_0)
  • wan2.2-t2v-a14b-q8_0.gguf(T2V 14B,Q8_0)
  • wan2.2-t2v-a14b-q4_0.gguf(T2V 14B,Q4_0)

GGUF 文件在 ComfyUI 里直接用 WanVideoLoader 节点或者 GGUF 专用模型加载节点加载就行,不需要转换或者解压。

下载清单——按你的硬件直接选

下面是按硬件和用途整理好的完整文件配置,每一条都是实测过的。

ComfyUI 配置对照

你的硬件你的目标需要下载的文件
24+ GB VRAM(RTX 4090、A6000)全质量生成wan2.2_i2v_low_noise_14b_fp8_scaled.safetensors(I2V)、wan2.2_t2v_14B_fp8_scaled.safetensors(T2V)、wan2.2_vae.safetensors
16 GB VRAM(RTX 4060 Ti、RTX 4070)14B 生成且留有余量wan2.2_i2v_low_noise_14b_fp8_scaled.safetensorswan2.2_t2v_14B_fp8_scaled.safetensorswan2.2_vae.safetensors——长片段可能要加 LightX2V
12 GB VRAM(RTX 3060、RTX 3080)14B 以较低精度运行wan2.2-i2v-a14b-highnoise-q8_0.gguf(I2V)、wan2.2-t2v-a14b-q8_0.gguf(T2V)、wan2.2_vae.safetensors,再加 LightX2V 4 步 LoRA
12 GB VRAM——备选方案5B FP16 追求更好的单像素画质wan2.2_ti2v_5b_fp16.safetensors(T2I2V——覆盖 T2V 和 Remix)、wan2.2_vae.safetensors——不需要 GGUF
8 GB VRAM(RTX 2060、RTX 3060 8GB)只能用 5B 模型wan2.2_ti2v_5b_fp16.safetensorswan2.2_vae.safetensors——只能跑 T2V,I2V/Remix 只能在低分辨率下跑
任意——LoRA 训练微调角色或风格wan2.2_ti2v_5b_fp16.safetensors(5B 训练,显存占用更低),或 wan2.2_i2v_low_noise_14b_fp8_scaled.safetensors(更高画质的 I2V LoRA),再加 wan2.2_vae.safetensors

最小可用配置

如果你是第一次搭 Wan 2.2,想用最少的下载量确认所有组件正常工作,从这套开始:

  1. wan2.2_vae.safetensors(320 MB)——先确认下载通道没问题
  2. wan2.2_ti2v_5b_fp16.safetensors(10 GB)——一个文件搞定 T2V + Remix
  3. 够了——直接跑一次 480p 的文本生成视频

这两个文件 10 分钟就下完了,能验证你的 ComfyUI 安装、模型加载器和管线全部正常。确认没问题之后,再往下加 I2V 14B 模型做图生视频。

文件来源汇总

来源格式适合谁
Kijai/Wan2.1-ComfyUI 在 Hugging Face.safetensors(全变体 + VAE)ComfyUI 用户——文件已经预转换成原生 Wan 节点格式
City96 在 Hugging Face.gguf(所有量化等级)需要量化版来降低显存占用的用户
Wan-AI/Wan2.1 在 Hugging Face.safetensors(阿里官方发布)想要原始检查点、不介意脚本转换的用户
CivitAI.safetensors(社区微调版)需要 NSFW 变体、风格训练检查点或融合模型的用户

分步安装教程详见 Wan 2.2 ComfyUI 工作流指南

常见问题

我需要把所有模型文件都下下来吗?

不需要。你只需要下跟你分支和用途对应的文件。一个 ComfyUI I2V 配置需要一个 I2V 扩散模型加 VAE。只用 T2V 的话那就只需要 T2V 模型加 VAE。从上面那个最小可用配置开始,随着工作流扩展再慢慢补充。

wan2.2_ti2v_5b_fp16.safetensorswan2.2_i2v_low_noise_14b_fp8_scaled.safetensors 到底有啥区别?

它们在每个维度上都不同:ti2v 是图文生视频分支(Remix),5B FP16;i2v 是图生视频分支,14B FP8。ti2v_5b 一个文件能同时处理 T2V 和 Remix 生成,但运动质量不如专门的 14B I2V 检查点。做测试和低显存配置用 ti2v_5b;追求高质量就用 14B I2V。

Wan 2.2 的 VAE 能用在 Wan 2.7 上吗?

不能。每个模型代际都有自己针对它的潜在空间专门训练的 VAE。Wan 2.2 的 VAE 用到 Wan 2.7 上会产生色偏和伪影。一定要下载匹配你模型代际的 VAE。

Remix 工作流该用哪个文件?

ti2v 检查点。wan2.2_ti2v_5b_fp16.safetensors 原生就支持 Remix 工作流——在兼容的流程里,这个检查点把参考图当作灵活建议而不是死约束。搭配 wan2.2_vae.safetensors 一起用。更多细节看 Wan 2.2 Remix v3 指南

文件名里的 "scaled" 是什么意思?

"Scaled" 表示这个检查点在 FP8 精度下用了逐张量激活缩放来最小化量化误差。这是一种校准技术:量化之前,模型会测量每个张量的激活范围并存储缩放因子,推理的时候再用这些因子来还原。效果是 FP8 在视频生成中的画质能达到 FP16 的 99.5% 左右。有 scaled 版就优先选 scaled。

VAE 文件在 ComfyUI 里应该放哪?

wan2.2_vae.safetensors 放到 ComfyUI/models/vae/。如果这个文件夹不存在,手动建一个。WanVideo 加载节点会自动识别命名符合 wan2.2_vae.safetensors 的 VAE 文件。

每个模型的文件大小大概多少?

大概参考:5B FP16 约 10 GB,14B FP8 约 14 GB,14B GGUF Q8_0 约 11 GB,14B GGUF Q4_K_M 约 7 GB,VAE 约 320 MB。

GGUF 文件能在 ComfyUI 里用吗?

能。ComfyUI 原生就支持加载 GGUF。用 WanVideoLoader 节点或 GGUF 专用模型加载节点直接加载 .gguf 文件就行。它们跟 .safetensors 文件一样放在 ComfyUI/models/diffusion_models/ 目录下。

同一个 I2V 模型能同时用于 High Noise 和 Low Noise 生成吗?

不能。High Noise 和 Low Noise 是各自独立的检查点。你需要下载指定变体才能获得对应的行为。有些社区工作流尝试通过调提示词来模拟另一个变体的效果,但结果跟专用检查点没法比。

总结

Wan 2.2 的模型文件第一眼看上去确实让人头晕——一个文件名里同时打包了五个独立选择。但规律是统一的:模式(T2V/I2V/T2I2V)→ 噪声变体(仅 I2V)→ 模型大小(5B/14B)→ 精度(FP8/FP16/GGUF)→ 格式(.safetensors/.gguf)。

按这三步走:

  1. 先定模式。 想清楚你要用 T2V、I2V 还是 T2I2V(Remix)。这决定了你要下哪个模型分支。
  2. 查显存。 根据你的硬件匹配模型大小和精度。16 GB 以上用 14B FP8,12 GB 用 14B GGUF,8 GB 用 5B FP16。
  3. 先下 VAE。 320 MB 的文件三个分支都要用。先下 VAE 确认下载通道正常,再下大模型。

按这个顺序来——VAE 几秒就下完了,确认一切正常之后再花时间下载大模型文件。确认完成后,把模型加载到 ComfyUI 里,跑一次 480p 生成看看效果。需要进阶工作流和设置的话,看 Wan 2.2 图生视频指南

作者

avatar for Wan 2.7 AI
Wan 2.7 AI

订阅简报

加入我们的社区

订阅我们的简报,获取最新动态与资讯