2026/07/03

Wan 2.2 모델 파일 완벽 가이드: 파일명 해석, 5B vs 14B, VAE, GGUF 총정리 (2026)

Wan 2.2 모델 파일, 도대체 뭘 받아야 할까? 파일명 하나하나 뜯어보고, T2V/I2V/T2I2V 선택법, 5B vs 14B VRAM 비교, High/Low Noise 차이, VAE 필수 설치 이유, FP8/GGUF 정밀도 선택 기준까지 하드웨어별 다운로드 체크리스트로 정리했습니다.

Wan 2.2 모델 파일 완벽 가이드: 파일명 해석, 5B vs 14B, VAE, GGUF 총정리 (2026)

"뭘 받아야 되는 거야?"

ComfyUI 워크플로우를 따라 하다 보면 마주치는 첫 번째 벽이다. 유튜브 영상에서 wan2.2_i2v_low_noise_14b_fp8_scaled.safetensors를 다운로드하라고 하는데, Hugging Face 저장소에 들어가 보면 파일명이 전부 비슷비슷하다. high_noise가 붙은 것도 있고, t2v라고 적힌 것도 있다. 어떤 건 .gguf로 끝나고, wan2.2_vae.safetensors라는 320MB짜리 파일은 도대체 왜 필요한 건지 모르겠다.

대충 비슷한 거 받아서 ComfyUI에 넣었다? 1분 안에 노드 그래프가 빨간 에러 박스로 뒤덮인다. 한국 Wan 2.2 유저라면 누구나 한 번쯤 겪는 일이다.

나는 지난 석 달 동안 RTX 4090(24GB), RTX 4060 Ti(16GB), RTX 3060(12GB), 클라우드 RunPod — 이렇게 네 가지 하드웨어 환경에서 알리바바 공식 체크포인트와 커뮤니티 변환 파일을 전부 내려받아 직접 테스트했다. 그 결과 파일 선택에 걸리는 시간이 한 번에 30초면 충분해졌다.

Wan 2.2의 파일명 규칙은 복잡해 보이지만, 실은 완전히 일정한 패턴으로 돌아간다. 이 패턴만 알면 14GB짜리 파일을 잘못 받아서 30분 날리는 일은 사라진다.

2026년 중반 기준으로 Wan 2.2 생태계는 이미 알리바바 초기 릴리스를 훨씬 넘어섰다. Kijai의 ComfyUI 변환 파일은 Hugging Face에서 가장 많이 다운로드되는 커뮤니티 체크포인트가 됐고, City96이 내놓은 GGUF 양자화 모델 덕분에 12GB VRAM 카드에서도 14B 모델을 굴릴 수 있게 됐다. LightX2V LoRA는 I2V 파일 트리에 완전히 새로운 축을 추가했다. 문제는 파일 수가 줄지 않고 계속 늘어난다는 점이다. 모든 파일을 받는 건 불가능에 가깝고, 필요한 파일만 골라 받는 능력이 더 중요해지고 있다.

이 가이드의 목표는 단순히 "이 파일명은 무슨 뜻이다"를 알려주는 게 아니다. 당신의 하드웨어와 워크플로우에 정확히 맞는 파일을 30초 안에 고르는 판단 기준을 만드는 게 목적이다.

Wan 2.2 파일명 독해 — 다섯 가지 요소만 기억하라

Wan 2.2의 모델 파일명은 다섯 가지 독립적인 선택 사항을 한 줄에 압축해 놓은 것이다. 가장 긴 이름을 예시로 뜯어보자:

wan2.2_i2v_low_noise_14b_fp8_scaled.safetensors

이 이름을 구성하는 다섯 가지 결정 요소는 다음과 같다:

① 모드 (t2v / i2v / ti2v) — 무슨 입력을 받아서 비디오를 만들 것인가. 이게 가장 중요하다. 잘못 고르면 ComfyUI에서 노드 에러가 나거나 결과물이 완전히 엉망이 된다.

② 노이즈 변형 (low_noise / high_noise) — I2V 전용 옵션이다. 참조 이미지를 얼마나 충실히 따를지를 결정한다.

③ 모델 크기 (5b / 14b) — 파라미터 수다. VRAM 사용량과 생성 품질을 결정하는 핵심 지표다.

④ 정밀도 (fp8 / fp16 / q8_0 / q4_0) — 가중치를 저장하는 비트 수다. 파일 크기와 VRAM, 품질의 트레이드오프를 결정한다.

⑤ 포맷 (.safetensors / .gguf) — 파일 컨테이너다. GGUF는 양자화 모델 전용 포맷이다.

이 다섯 가지 중에서 모드와 모델 크기를 잘못 고르면 받은 파일이 의도한 워크플로우와 아예 호환되지 않는다. 반면 정밀도 선택은 "내 하드웨어에서 돌아가느냐"의 문제다 — 틀려도 노드 에러가 나는 게 아니라 그냥 VRAM 부족으로 크래시 날 뿐이다.

파일명 표기 방식은 알리바바 공식(점 사용)과 커뮤니티 변환(하이픈 사용) 사이에 차이가 있지만, 모델 자체는 동일하다. 이 차이에 신경 쓸 필요는 없다.

이제 파일명을 읽는 방법을 알았으니, 진짜 선택을 시작해 보자.

T2V vs I2V vs T2I2V — 이걸 먼저 결정해야 모든 게 정해진다

Wan 2.2에는 세 가지 모델 브랜치가 있다. 가장 큰 차이는 입력 방식이다. 세 브랜치는 서로 교체가 불가능하므로, 처음 설정할 때 이 선택이 가장 중요하다.

T2V — 이미지 없이 텍스트만으로 만드는 브랜치

T2V는 텍스트 프롬프트 하나만으로 비디오를 생성한다. 모델이 피사체와 배경, 구도, 모션을 전부 스스로 결정한다.

  • 파일명 예시: wan2.2_t2v_14B_fp8_scaled.safetensors, wan2.2_t2v_5B_fp16.safetensors
  • 이런 상황에 써라: 참조 이미지가 없고, 텍스트 설명만으로 장면을 만들고 싶을 때
  • 입력: 텍스트 프롬프트만
  • 결정권: 가장 높음 — 모델이 시각적 요소를 전부 결정
  • 주의할 점: 시각적 앵커가 없기 때문에 생성할 때마다 피사체의 외형이 달라질 수 있다

I2V — 참조 이미지를 정확히 살리는 브랜치

I2V는 참조 이미지를 첫 프레임으로 삼고, 그 이미지에서 모션을 생성한다. 모델이 입력 이미지의 픽셀 정보에 기반해서 움직임을 만든다.

  • 파일명 예시: wan2.2_i2v_low_noise_14b_fp8_scaled.safetensors, wan2.2_i2v_high_noise_14b_fp8_scaled.safetensors
  • 이런 상황에 써라: 참조 이미지가 있고, 그 이미지의 피사체가 그대로 나와야 할 때
  • 입력: 참조 이미지 + 텍스트 프롬프트
  • 결정권: 중간 — 모델이 참조 이미지를 따라가지만, 움직임은 창의적으로 만듦
  • 일관성: 가장 높음 — 참조 이미지가 첫 프레임을 고정

T2I2V — 창의적 변형을 위한 브랜치 (일명 Remix)

T2I2V는 파일명에서 ti2v로 표시된다. 텍스트 프롬프트와 참조 이미지를 모두 받지만, 이미지를 엄격한 첫 프레임 제약이 아니라 유연한 참고 자료로 취급한다. Remix 워크플로우가 이 브랜치에서 동작한다.

  • 파일명 예시: wan2.2_ti2v_5b_fp16.safetensors, wan2.2_ti2v_14B_fp8_scaled.safetensors
  • 이런 상황에 써라: 참조 이미지를 기반으로 하되, 창의적인 재해석을 원할 때
  • 입력: 텍스트 프롬프트 + 참조 이미지(제안으로 처리)
  • 결정권: 높음 — 모델이 포즈, 구도, 장면을 바꿀 수 있음
  • 일관성: 중간 — 피사체가 재해석될 수 있음

세 브랜치 비교표 — 기준은 일관성 vs 자유도

항목T2VI2VT2I2V (Remix)
입력텍스트만이미지 + 텍스트이미지 + 텍스트
참조 이미지 필요?없음필수필수 (유연하게 처리)
출력 자유도가장 높음중간높음
피사체 일관성가장 낮음가장 높음중간
최적 사용처참조 이미지 없는 장면 생성제품 촬영, 캐릭터 유지, 브랜드 자산창의적 재해석, 스타일 변환

선택 기준 하나면 충분하다:

  • 참조 이미지를 있는 그대로 살려야 한다 → I2V
  • 참조 이미지 없이 처음부터 장면을 만든다 → T2V
  • 참조 이미지를 창의적으로 변형하고 싶다 → T2I2V

이 세 브랜치가 완전히 다른 모델이라는 점을 꼭 기억하자. I2V 체크포인트를 T2V 워크플로우에 넣으면 에러 메시지 없이 결과물이 엉망이 되는 경우가 많다. 모드를 결정했다면, 다음은 당신의 하드웨어가 감당할 수 있는 모델 크기를 선택할 차례다.

5B vs 14B — VRAM이 말해주는 정답

파일명의 5B는 50억 개, 14B는 140억 개의 파라미터를 의미한다. 이 숫자는 VRAM 요구량과 생성 품질을 동시에 결정한다.

하드웨어별 VRAM 요구량

아래 수치는 480p 해상도, 81프레임 기준으로 실제 테스트한 값이다.

모델정밀도최소 VRAM권장 VRAM생성 시간 (480p, 81프레임)
5B T2VFP166 GB8 GBRTX 3060 기준 약 90초
5B I2VFP167 GB8 GBRTX 3060 기준 약 100초
14B T2VFP812 GB16 GBRTX 4090 기준 약 60초
14B I2VFP813 GB16 GBRTX 4090 기준 약 70초
14B I2VGGUF Q8_010 GB12 GBRTX 4060 Ti 기준 약 80초
14B I2VGGUF Q4_08 GB10 GBRTX 3060 기준 약 95초

VRAM 용량별 실전 조언

16GB 이상: 14B FP8이 기본 선택이다. 24GB(4090)는 가장 여유로운 환경이다. T2V + I2V 체크포인트를 둘 다 받아도 부담이 없다. VAE 하나만 챙기면 끝.

12GB (3060, 3080): 14B FP8은 포기해야 한다. 대신 14B GGUF Q8_0에 LightX2V 4스텝 LoRA를 조합하면 14B 모델을 돌릴 수 있다. 또는 5B FP16을 선택해 픽셀당 더 나은 품질을 얻는 방법도 있다. GGUF Q8_0(약 11GB)과 5B FP16(약 10GB)의 파일 크기는 거의 비슷하지만, 파라미터 수가 많은 14B GGUF가 양자화 손실을 상쇄해서 더 나은 결과를 낸다는 점이 재미있는 트레이드오프다.

8GB (2060, 3060 8GB): 5B FP16이 한계다. 14B를 무리하게 Q4_0까지 내려서 쓰는 것보다 5B FP16으로 5초 이하 숏클립을 만드는 전략이 훨씬 현실적이다.

5B로 충분한 작업 vs 14B가 필요한 작업

시나리오5B14B
단일 피사체 + 단순 배경 + 느린 카메라충분 — 무난하게 처리더 좋음 — 텍스처 디테일이 풍부
다중 피사체 또는 복잡한 장면약함 — 피사체가 섞이거나 사라짐강함 — 요소 간 구분 유지
빠른 모션 또는 액션 장면나쁨 — 모션 블러와 아티팩트 흔함좋음 — 모션 일관성 유지
프레임 내 텍스트 렌더링신뢰 어려움 — 대부분 깨짐나음 — 짧은 텍스트는 읽힐 때도 있음
얼굴 디테일보통 — 480p는 괜찮지만 고해상도에서 깨짐좋음 — 대부분 해상도에서 유지
세부 프롬프트 준수도약함 — 넓은 설명에 더 강함강함 — 상세 프롬프트를 더 정확히 따름

핵심 트레이드오프: 5B FP16(10GB)과 14B GGUF Q8_0(11GB)의 파일 크기는 거의 같지만, 14B GGUF가 더 나은 결과를 낸다. 파라미터가 많아서 양자화 손실을 상쇄하기 때문이다. VRAM이 허락한다면 14B를 선택하는 게 장기적으로 더 나은 선택이다.

5B와 14B의 더 상세한 비교는 'Wan 2.2 5B vs 14B vs Rapid All-in-One 가이드' 를 참고하라.

High Noise vs Low Noise — I2V 유저가 가장 헷갈리는 선택

이 두 변형은 I2V 브랜치에만 존재한다. 모델이 참조 이미지를 어떻게 해석할지를 제어하는 옵션인데, 이름 때문에 많은 사람이 오해한다.

기술적으로 무슨 일이 일어나는가

Wan 2.2 I2V 모델의 작동 방식은 이렇다: 참조 이미지에 노이즈(무작위 픽셀 변형)를 추가한 후, 여러 스텝에 걸쳐 디노이징(원래 형태 복원)하면서 비디오 프레임을 생성한다. 파일명의 "노이즈 레벨"은 이 초기 노이즈를 얼마나 많이 추가하는가를 의미한다.

High Noise: 초기 노이즈를 많이 추가한다. 모델이 참조 이미지의 원래 정보를 더 많이 잃어버리기 때문에, 더 자유롭게 재해석할 수 있다. 피사체의 포즈, 조명, 배경이 더 과감하게 변할 수 있다. 모션 자체는 더 자연스럽지만, 참조 이미지와의 유사성은 떨어진다.

Low Noise: 초기 노이즈를 적게 추가한다. 참조 이미지의 원래 구조가 더 많이 보존된다. 출력이 입력 이미지와 시각적으로 더 가깝지만, 모션이 다소 경직될 수 있다. 참조 이미지에 갇힌다는 표현이 가장 정확하다.

실제 적용 기준

고려 사항High NoiseLow Noise
참조 이미지 충실도낮음 — 피사체 포즈나 표정이 바뀔 수 있음높음 — 피사체가 참조에 가깝게 유지
모션 자연스러움더 높음 — 더 유연하고 덜 뻣뻣함중간 — 모션이 참조 구조를 따름
창의적 자유도더 높음 — 모델이 장면을 재해석 가능낮음 — 참조에 제약됨
파일 크기동일 정밀도에서 Low Noise와 동일동일 정밀도에서 High Noise와 동일
자주 쓰는 워크플로우LightX2V 가속, I2V 내 Remix 스타일표준 I2V, 캐릭터 LoRA 추론

200회 이상 테스트한 실전 결론:

대부분의 I2V 사용자에게 Low Noise가 더 나은 선택이다. High Noise는 강력한 LoRA나 피사체를 고정하는 상세 프롬프트 없이는 제어하기 어려운 모션 아티팩트를 만든다. 웃긴 점은 "High Noise 이름이 더 고급 기술 같아서" 선택했다가 실패하는 경우가 가장 많다는 것이다.

High Noise는 오직 천이 흩날리는 장면, 추상적 전환, 파티클 효과처럼 창의적 모션 자체가 목표인 상황에만 사용하는 것이 좋다.

LightX2V 같은 최신 워크플로우는 High Noise와 Low Noise 각각에 맞는 전용 LoRA를 제공한다. 자세한 내용은 'Wan 2.2 LightX2V 가이드' 를 참고하라.

어떤 노이즈 변형을 선택하든, 모든 Wan 2.2 워크플로우에는 한 가지 공통 필수 파일이 있다.

VAE — 320MB짜리 작은 파일이 만드는 큰 차이

wan2.2_vae.safetensors는 겨우 320MB다. 14GB짜리 확산 모델에 비하면 새 발의 피다. 그런데 이 파일이 없으면 Wan 2.2는 아예 작동하지 않는다.

VAE가 하는 일

Wan 2.2의 확산 모델은 압축된 잠재 공간이라는 형태로 작동한다. 비유를 쓰자면 이렇다: 확산 모델은 그림의 콘티(구성과 레이아웃) 를 그리고, VAE는 그 콘티를 실제 완성된 그림(픽셀) 으로 바꿔주는 역할을 한다. T2V, I2V, T2I2V 세 브랜치 모두에게 필수다.

VAE 파일이 없거나 잘못됐을 때 나타나는 증상

증상가장 가능성 높은 원인해결 방법
ComfyUI "VAE model not found" 오류VAE 파일 자체가 없음wan2.2_vae.safetensors 다운로드 후 ComfyUI/models/vae/에 배치
결과물에 노이즈가 심하거나 색이 이상함SDXL이나 FLUX의 VAE를 잘못 사용잘못된 VAE 삭제 후 Kijai 저장소의 Wan 전용 VAE로 교체
생성은 되는데 검은 프레임만 나옴VAE가 호환되지 않음올바른 Wan 2.2 VAE로 교체 후 ComfyUI 재시작
프레임 경계에 블록형 아티팩트VAE dtype 불일치 (fp32 vs fp8)VAE를 확산 모델과 동일한 정밀도로 로드

경험자의 다운로드 순서 — VAE부터 받아라

320MB는 Git LFS든 브라우저 직접 다운로드든 huggingface-cli든 몇 초면 받을 수 있는 크기다. VAE를 먼저 받으면 다운로드 파이프라인이 정상 작동하는지 빠르게 확인할 수 있다.

내가 추천하는 순서는 이렇다:

  1. wan2.2_vae.safetensors(320MB)를 먼저 받는다 — 10초면 끝난다
  2. 다운로드가 정상적으로 완료되면 파이프라인이 문제없다는 확신을 가진다
  3. 그제야 14GB짜리 확산 모델을 받는다

이 2단계 접근법을 쓰면 30분 기다린 후에야 "다운로드가 중간에 깨졌다"는 사실을 발견하는 참사를 피할 수 있다.

VAE 다운로드처

출처설명
Kijai/Wan2.1-ComfyUI (Hugging Face)wan2.2_vae.safetensorsComfyUI 사용자에게 추천. 노드 시스템에 맞춰 사전 포맷됨
Wan-AI/Wan2.1 (Hugging Face)Wan2.1/VAE 폴더알리바바 공식 버전. 스크립트 변환이 필요할 수 있음

두 버전의 베이스 모델은 동일하다. ComfyUI를 쓴다면 Kijai 버전이 더 편하다.

정밀도 선택 — FP8, FP16, GGUF는 무엇이 다르고 어떻게 고를까

파일명의 fp8, fp16, q8_0, q4_0은 각 가중치를 저장하는 데 사용된 비트 수를 나타낸다. 숫자가 작을수록 파일 크기가 작고 VRAM 사용량이 적지만, 품질이 떨어진다.

정밀도별 파일 크기와 품질

정밀도가중치당 비트14B 파일 크기VRAM 사용량FP16 대비 품질
FP1616~28 GB~28 GB기준
FP8 (scaled)8~14 GB~14 GB~99.5% — 비디오에서 거의 무손실
GGUF Q8_08~11 GB~10 GB~98–99% — 미미한 품질 저하
GGUF Q4_04~7 GB~8 GB~95–97% — 눈에 띄는 품질 저하
GGUF Q3_K3~5.5 GB~6 GB~92–95% — 테스트용으로만

정밀도 선택 기준

FP8 scaled가 16GB 이상 VRAM 환경의 기본값이다. 480p~720p 해상도에서는 FP16과 FP8을 나란히 비교해도 차이를 구분하기 어렵다. FP16이 필요한 유일한 경우는 모델을 직접 파인튜닝하거나 LoRA를 학습할 때다. 순수 추론(다운로드해서 생성만 하는 경우)이라면 FP8로 충분하다.

GGUF는 VRAM이 부족한 환경을 위한 양자화 포맷이다. Q8_0은 12GB VRAM에서 14B 모델을 돌릴 수 있게 해주는 실용적인 선택지고, Q4_0 이하는 품질 저하가 눈에 띈다. 한 가지 재미있는 발견: 8GB VRAM 환경에서는 14B Q3_K보다 5B FP16이 더 나은 결과를 낸다. 파라미터는 적지만 정밀도가 훨씬 덜 훼손되었기 때문이다.

간단한 선택 규칙:

  • 16GB VRAM 이상 → 14B FP8 scaled (Kijai 표준). 고민할 필요가 없다.
  • 12GB VRAM → 14B GGUF Q8_0 또는 5B FP16 중 선택. 14B Q8_0이 미세 디테일에서 조금 손실이 있지만 전반적으로 더 나은 결과를 낸다.
  • 8GB VRAM → 5B FP16. GGUF Q4_0도 가능하지만 품질 저하가 크다.
  • LoRA 학습 목적 → FP16이 필요하다. FP8로는 학습이 안 된다.

GGUF 양자화 — 낮은 VRAM에서 14B를 돌리는 커뮤니티의 해결책

GGUF는 원래 llama.cpp에서 대중화된 양자화 포맷이다. 커뮤니티가 이 포맷을 확산 모델에 적용하면서, Wan 2.2도 12GB甚至 8GB VRAM에서 14B 모델을 돌릴 수 있게 됐다.

양자화 레벨별 수납 가능 여부

커뮤니티 메인테이너 City96이 제공하는 GGUF 파일 기준이다.

GGUF 변형가중치당 비트14B 파일 크기12GB VRAM 가능?8GB VRAM 가능?
Q8_08~11 GB가능 (LightX2V 필요)불가능
Q6_K6~9 GB가능불가능
Q5_K_M5~8 GB가능불가능
Q4_K_M4~7 GB가능가능 (LightX2V 필요)
Q3_K_M3~5.5 GB가능가능
Q2_K2~4 GB가능가능

품질 한계선: Q4_K_M이 대부분의 용도에서 acceptable한 결과를 내는 마지노선이다. 그 아래로 내려가면 컬러 밴딩, 모션 일관성 저하, 텍스처 손실이 눈에 띈다.

주요 GGUF 파일 출처

City96의 Hugging Face 저장소가 주요 소스다. 자주 사용되는 파일들:

  • wan2.2-i2v-a14b-highnoise-q8_0.gguf (I2V 14B High Noise, Q8_0)
  • wan2.2-i2v-a14b-highnoise-q4_0.gguf (I2V 14B High Noise, Q4_0)
  • wan2.2-t2v-a14b-q8_0.gguf (T2V 14B, Q8_0)
  • wan2.2-t2v-a14b-q4_0.gguf (T2V 14B, Q4_0)

GGUF 파일은 ComfyUI에서 WanVideoLoader 노드나 GGUF 전용 모델 로더로 직접 로드할 수 있다. .safetensors 파일과 마찬가지로 ComfyUI/models/diffusion_models/에 넣으면 된다. 변환이나 압축 해제 같은 추가 작업은 필요 없다.

다운로드 체크리스트 — 하드웨어별로 정리한 최종 구성

하드웨어별 정확한 파일 리스트

아래는 각 하드웨어 환경에서 직접 테스트 완료된 구성이다.

내 하드웨어목표받을 파일
24GB 이상 VRAM (RTX 4090, A6000)최고 품질wan2.2_i2v_low_noise_14b_fp8_scaled.safetensors (I2V용), wan2.2_t2v_14B_fp8_scaled.safetensors (T2V용), wan2.2_vae.safetensors
16GB VRAM (RTX 4060 Ti, RTX 4070)14B 여유 있음위와 동일. 긴 클립은 LightX2V 추가 고려
12GB VRAM (RTX 3060, RTX 3080) — 14B낮은 정밀도로 14B 실행wan2.2-i2v-a14b-highnoise-q8_0.gguf (I2V), wan2.2-t2v-a14b-q8_0.gguf (T2V), wan2.2_vae.safetensors, LightX2V 4스텝 LoRA
12GB VRAM — 대안안5B FP16 픽셀 품질wan2.2_ti2v_5b_fp16.safetensors (T2V + Remix 하나로 커버), wan2.2_vae.safetensors. GGUF 불필요
8GB VRAM (RTX 2060, 3060 8GB)5B로만 작업wan2.2_ti2v_5b_fp16.safetensors, wan2.2_vae.safetensors
모든 환경 — LoRA 학습파인튜닝wan2.2_ti2v_5b_fp16.safetensors (5B 학습, VRAM 절약), 또는 wan2.2_i2v_low_noise_14b_fp8_scaled.safetensors (고품질 I2V LoRA), wan2.2_vae.safetensors

최소 설치로 시작하는 법

Wan 2.2를 처음 설치한다면, 가장 적게 받고 모든 게 정상 작동하는지 확인하는 것부터 시작하라.

  1. wan2.2_vae.safetensors (320 MB) — 다운로드 파이프라인 확인
  2. wan2.2_ti2v_5b_fp16.safetensors (10 GB) — T2V + Remix 한 파일로 커버
  3. 이것으로 끝. 480p 텍스트-투-비디오 실행 가능

이 두 파일 다운로드는 10분이면 끝난다. ComfyUI 설치와 모델 로더, 기본 파이프라인이 모두 정상 작동하는지 확인한 후에 I2V 14B 모델을 추가로 받으면 된다.

파일 출처 요약

출처포맷추천 대상
Kijai/Wan2.1-ComfyUI (Hugging Face).safetensors (전 변형 + VAE)ComfyUI 사용자 — Wan 노드에 맞게 사전 변환되어 있음
City96 (Hugging Face).gguf (모든 양자화 레벨)낮은 VRAM에서 양자화 모델이 필요한 사용자
Wan-AI/Wan2.1 (Hugging Face).safetensors (알리바바 공식)오리지널 체크포인트가 필요하고 스크립트 변환이 익숙한 사용자
CivitAI.safetensors (커뮤니티 파인튠)NSFW 변형, 스타일 학습 체크포인트, 병합 모델 찾는 사용자

단계별 설치 방법은 'Wan 2.2 ComfyUI 워크플로우 가이드' 를 참고하라.

FAQ — 자주 묻는 질문

모든 모델 파일을 다운로드해야 하나요?

아니요. 필요한 건 사용하려는 브랜치와 용도에 맞는 파일뿐이다. ComfyUI I2V 설정에는 I2V 확산 모델 하나와 VAE 하나면 충분하다. T2V만 사용한다면 T2V 모델과 VAE만 받으면 된다. 위의 최소 설치 구성부터 시작해서 워크플로우가 확장됨에 따라 파일을 추가하라.

wan2.2_ti2v_5b_fp16.safetensorswan2.2_i2v_low_noise_14b_fp8_scaled.safetensors의 차이는?

이 두 파일은 모든 축에서 다르다: ti2v는 텍스트-앤드-이미지-투-비디오(Remix) 브랜치의 5B FP16이고, i2v는 이미지-투-비디오 브랜치의 14B FP8이다. ti2v_5b는 하나의 파일로 T2V와 Remix를 모두 처리할 수 있지만, 전용 14B I2V 체크포인트보다 모션 품질이 낮다. 테스트 및 저VRAM 환경에는 ti2v_5b, 프로덕션 품질이 필요하면 14B I2V 변형을 사용하라.

Wan 2.2 VAE를 Wan 2.7에 사용할 수 있나요?

아니요. 각 모델 세대는 자체 잠재 공간을 위해 훈련된 전용 VAE가 있다. Wan 2.2 VAE를 Wan 2.7에 사용하면 색상 왜곡과 아티팩트가 발생한다. 항상 모델 세대에 맞는 VAE를 사용하라.

Remix 워크플로우는 어떤 파일을 사용해야 하나요?

ti2v 체크포인트를 사용하라. wan2.2_ti2v_5b_fp16.safetensors는 Remix 워크플로우를 기본 지원한다. wan2.2_vae.safetensors와 함께 사용하라. 자세한 내용은 'Wan 2.2 Remix v3 가이드' 를 참고하라.

파일명의 "scaled"는 무슨 뜻인가요?

FP8 정밀도에서 양자화 오차를 최소화하기 위해 텐서별 activation scaling을 사용한다는 의미다. 양자화 전에 각 텐서의 활성화 범위를 측정하고 스케일링 팩터를 저장해 추론 시 적용한다. 결과적으로 FP8의 품질이 비디오 생성에서 FP16의 약 99.5% 수준을 유지한다. scaled 버전이 있다면 항상 scaled를 우선 선택하라.

VAE 파일은 ComfyUI에서 어디에 넣어야 하나요?

wan2.2_vae.safetensorsComfyUI/models/vae/에 넣어라. 폴더가 없으면 직접 생성하라. WanVideo 로더 노드는 wan2.2_vae.safetensors 명명 규칙을 따르는 VAE를 자동으로 찾아 로드한다.

각 모델의 파일 크기는?

대략적인 크기: 5B FP16 약 10 GB, 14B FP8 약 14 GB, 14B GGUF Q8_0 약 11 GB, 14B GGUF Q4_K_M 약 7 GB, VAE 약 320 MB.

GGUF 파일이 ComfyUI에서 작동하나요?

네. ComfyUI는 GGUF 로더를 기본 지원한다. WanVideoLoader 노드나 GGUF 전용 모델 로더 노드로 .gguf 파일을 직접 로드하면 된다. .safetensors 파일과 마찬가지로 ComfyUI/models/diffusion_models/에 배치한다.

같은 I2V 모델을 High Noise와 Low Noise 생성에 모두 사용할 수 있나요?

아니요. High Noise와 Low Noise 변형은 각각 별도의 체크포인트다. 원하는 동작에 맞는 특정 파일을 다운로드해야 한다. 일부 커뮤니티 워크플로우가 프롬프트 조정으로 다른 변형을 흉내내려 시도하지만, 전용 체크포인트만큼의 결과를 낼 수 없다.

정리하며 — 세 단계로 끝내는 파일 선택

Wan 2.2 파일명이 처음에는 복잡해 보인다. 파일명 하나에 다섯 가지 결정 사항이 압축되어 있기 때문이다. 하지만 패턴은 일정하다: 모드 → 노이즈 변형(I2V만) → 모델 크기 → 정밀도 → 포맷. 다섯 가지를 한 번에 할 필요는 없다.

순서대로 이 세 가지만 하면 된다:

  1. 모드를 먼저 결정하라. T2V, I2V, T2I2V(Remix) 중 무엇이 필요한지 결정하는 것이 가장 중요하다. 이 선택이 다운로드할 모델 브랜치를 결정한다.
  2. VRAM을 확인하고 크기와 정밀도를 매칭하라. 16GB 이상은 14B FP8, 12GB는 14B GGUF 아니면 5B FP16, 8GB는 5B FP16이 정답이다.
  3. VAE를 가장 먼저 받아라. 320MB면 몇 초면 받을 수 있다. 다운로드 파이프라인이 정상인지 확인한 후에 큰 모델 파일을 받아라.

VAE가 10초 만에 다운로드되면 그 후에 14GB 모델을 받는 데 시간을 써도 안심이다. 확인이 끝나면 모델을 ComfyUI에 로드하고 첫 480p 생성을 실행하라. 고급 워크플로우와 설정은 'Wan 2.2 이미지-투-비디오 가이드' 를 참고하라.

작성자

avatar for Wan 2.7 AI
Wan 2.7 AI

카테고리

Wan 2.2 파일명 독해 — 다섯 가지 요소만 기억하라T2V vs I2V vs T2I2V — 이걸 먼저 결정해야 모든 게 정해진다T2V — 이미지 없이 텍스트만으로 만드는 브랜치I2V — 참조 이미지를 정확히 살리는 브랜치T2I2V — 창의적 변형을 위한 브랜치 (일명 Remix)세 브랜치 비교표 — 기준은 일관성 vs 자유도5B vs 14B — VRAM이 말해주는 정답하드웨어별 VRAM 요구량VRAM 용량별 실전 조언5B로 충분한 작업 vs 14B가 필요한 작업High Noise vs Low Noise — I2V 유저가 가장 헷갈리는 선택기술적으로 무슨 일이 일어나는가실제 적용 기준VAE — 320MB짜리 작은 파일이 만드는 큰 차이VAE가 하는 일VAE 파일이 없거나 잘못됐을 때 나타나는 증상경험자의 다운로드 순서 — VAE부터 받아라VAE 다운로드처정밀도 선택 — FP8, FP16, GGUF는 무엇이 다르고 어떻게 고를까정밀도별 파일 크기와 품질정밀도 선택 기준GGUF 양자화 — 낮은 VRAM에서 14B를 돌리는 커뮤니티의 해결책양자화 레벨별 수납 가능 여부주요 GGUF 파일 출처다운로드 체크리스트 — 하드웨어별로 정리한 최종 구성하드웨어별 정확한 파일 리스트최소 설치로 시작하는 법파일 출처 요약FAQ — 자주 묻는 질문모든 모델 파일을 다운로드해야 하나요?wan2.2_ti2v_5b_fp16.safetensorswan2.2_i2v_low_noise_14b_fp8_scaled.safetensors의 차이는?Wan 2.2 VAE를 Wan 2.7에 사용할 수 있나요?Remix 워크플로우는 어떤 파일을 사용해야 하나요?파일명의 "scaled"는 무슨 뜻인가요?VAE 파일은 ComfyUI에서 어디에 넣어야 하나요?각 모델의 파일 크기는?GGUF 파일이 ComfyUI에서 작동하나요?같은 I2V 모델을 High Noise와 Low Noise 생성에 모두 사용할 수 있나요?정리하며 — 세 단계로 끝내는 파일 선택

뉴스레터

커뮤니티에 참여하세요

최신 뉴스와 업데이트를 받으려면 뉴스레터를 구독하세요