Wan Dancer

把一张人像和一段音乐,变成 720p、30fps、随节奏起舞的跳舞视频,连贯性远超绝大多数模型 20 秒就崩坏的极限。Wan Dancer(Wan-Dancer-14B)是阿里巴巴通义实验室开源的音乐驱动跳舞模型,以 Apache-2.0 协议发布。

在线生成器即将上线

720p

30fps 视频输出

1 分钟+

突破 20 秒瓶颈

5

种舞蹈风格

Apache-2.0

开源权重,可自部署

什么是 Wan Dancer

阿里巴巴通义实验室的音乐驱动人像跳舞视频模型。

Wan-Dancer-14B 用一张参考图和一段音乐,就能生成随节奏起舞的跳舞视频,无需动作捕捉,也不需要参考舞蹈视频。

Wan Dancer 由阿里巴巴通义实验室发布,模型名为 Wan-Dancer-14B,是一款音乐驱动的跳舞视频模型。你只需提供一张人像参考图和一段音乐,Wan Dancer 就会为画面中的人编排并渲染出随音乐起舞的动作,输出 720p、30fps 的视频。大多数视频模型在约 20 秒后就会漂移或崩坏,而 Wan Dancer 能保持一分钟以上的连贯。

它的关键在于先规划、再渲染。全局阶段读取整段音乐,把长时段的舞蹈以关键帧的方式排布出来;随后局部阶段逐帧细化关键帧之间的动作。这套建立在 Wan 图生视频底座之上的两阶段设计,正是它能从一张静态图和一首歌走到完整跳舞片段、而不是只有几秒动作的原因。在线生成器即将上线,在此之前,本页会讲清模型的工作方式与适用场景。

适合谁用

音乐视频与歌词片段、抖音与 Reels 的舞蹈翻跳、虚拟达人与 VTuber 开场、品牌推广循环,以及任何想让一张照片跟着某首歌起舞的场景。

使用流程

从照片和音乐到跳舞,只需三个阶段。

Wan Dancer 把规划和渲染分开 —— 生成器还未上线,但这就是模型遵循的工作流程。

01

给它一张人像和一段音乐

提供一张清晰的人物参考图(竖版全身照效果最好),再加上一个音乐或音频文件,以及一句描述舞蹈风格的提示词。干净、低噪的音频和轮廓清晰的主体,能带来最稳定的效果。

02

全局阶段规划编舞

Wan Dancer 读取整段音乐,为整套动作排布关键帧,先确定长时段的结构,让舞蹈从头到尾都串得起来。从整段音乐来规划,正是突破 20 秒连贯瓶颈的关键。

03

局部阶段渲染动作

第二阶段把关键帧之间的画面细化为流畅、踩点的动作,输出 720p、30fps,并生成最终的 MP4 跳舞视频。动作速度控制让快节奏段落也能保持细节清晰。

核心功能

以音频驱动编舞,同时保持人物一致。

一款为长时段、锁节拍、单人编舞打造的音乐转跳舞视频生成器。

音乐驱动的舞蹈生成

Wan Dancer 直接从你的音频生成舞蹈,编舞跟随真实音乐,而不是套用通用循环动作。你在一开始就把音乐交给它,而不是事后再把音乐对到一段无声视频上,还能用文本提示词进一步引导风格和情绪。

分钟级时序连贯

全局到局部的流程让结构在约 20 秒这个多数扩散模型崩坏的节点之后依然稳定,生成时长超过一分钟的舞蹈 —— 足够撑起一整段副歌或记忆点。

单张照片锁定身份

一张人像就够了。Wan Dancer 会把参考人物的脸、发型和服装贯穿整套动作,让舞者从第一帧到最后一帧都保持可辨认。

720p 30fps 输出

Wan Dancer 以流畅的每秒 30 帧渲染高清视频,直接可用于抖音、Reels、Shorts 上的短视频和音乐视频剪辑。

五种舞蹈风格

覆盖中国古典舞、K-Pop、街舞、踢踏舞和拉丁舞的训练,让 Wan Dancer 能用同一张参考图匹配多种音乐风格,你通过提示词来选择风格。

开源权重,支持 ComfyUI

Wan-Dancer-14B 以 Apache-2.0 协议在 Hugging Face 和 ModelScope 发布,提供推理代码、ComfyUI 集成,以及用于自定义编舞的 LoRA 微调,可自部署并用于商业用途。

应用场景

照片转跳舞模型的用武之地。

把一张人像和一段音乐,变成短视频阵地需要的跳舞视频。

音乐与歌词视频

为歌词视频、视觉化 MV 和音乐视频插段生成跟随音乐的舞蹈片段,适合独立音乐人和推广预告,无需实拍。

抖音与 Reels 跳舞片段

把一张人像变成贴合热门歌曲的跳舞短片,再批量产出多个版本,投放抖音、Reels 与 Shorts,动作真实踩点。

虚拟达人与 VTuber

用贴合曲风的编舞,为虚拟达人或 VTuber 形象做一段随音乐起舞的开场、转场或循环,无需绑定或动捕流程。

品牌跳舞广告

让品牌形象或代言人跟随广告音频起舞,用于社媒广告、落地页和产品发布。

创作者怎么说

为什么 Wan Dancer 能留在工作流里。

Trustpilot

受到音乐、舞蹈和短视频创作者的青睐 —— 以 Apache-2.0 开源。

Lena Marsh, 音乐视频剪辑师

Lena Marsh

音乐视频剪辑师

"音乐优先的方式改变了我的流程。我把曲子丢进去,拿到的就是贴合它的编舞,而不是事后再把无声片段对到鼓点上。"

Amara Sy, 舞蹈内容制作人

Amara Sy

舞蹈内容制作人

"一张参考图搞定五种舞种,意味着我今天做拉丁、明天做街舞,都不用重拍任何东西。"

Nadia Hult, 动态设计师

Nadia Hult

动态设计师

"踩点在整段片子里都稳。动作落在节奏上,这正是先出无声、再对音的工具从没做好的地方。"

Yara Kwon, 虚拟达人运营

Yara Kwon

虚拟达人运营

"做虚拟达人内容,身份一致非常重要。舞者从头到尾都是同一个可辨认的角色。"

Diego Ramos, 短视频创作者

Diego Ramos

短视频创作者

"突破 20 秒这道坎对我来说才是关键。一支能连贯跳满一分钟的舞,终于能真正用进视频里了。"

Jonas Pearl, 流程技术总监

Jonas Pearl

流程技术总监

"开源权重和 ComfyUI 支持打动了我们团队。我们用 LoRA 微调编舞,全部在自己的流程里跑。"

探索更多 AI 视频与图像模型

常见问题

Wan Dancer 常见问题

Wan Dancer 是什么?

Wan Dancer(Wan-Dancer-14B)是阿里巴巴通义实验室开源的音乐驱动跳舞视频模型。它用一张人像照片和一段音乐,生成画面中的人随音乐起舞的视频,输出 720p、30fps。

Wan Dancer 是怎么生成跳舞视频的?

它采用两阶段流程。全局阶段读取整段音乐、把舞蹈规划成关键帧,局部阶段再细化关键帧之间的动作。这种先规划的设计,正是让长段舞蹈保持连贯的关键。

Wan Dancer 生成的视频能有多长?

Wan Dancer 面向分钟级生成,能在约 20 秒这个多数扩散视频模型崩坏的节点之后依然保持连贯。项目演示视频时长超过两分钟;开源版本面向更短的音乐输入。

使用 Wan Dancer 需要准备什么?

一张人物参考图(竖版全身照效果最好)、一个音乐或音频文件,以及一句描述舞蹈风格的提示词。干净、低噪的音频能带来最稳定的效果。

Wan Dancer 支持哪些舞蹈风格?

它在五种舞种上训练:中国古典舞、K-Pop、街舞、踢踏舞和拉丁舞。你通过文本提示词配合音乐来选择风格。

Wan Dancer 是开源的吗?

是的。Wan-Dancer-14B 以 Apache-2.0 协议在 Hugging Face 和 ModelScope 开源,提供推理代码、ComfyUI 集成以及 LoRA 微调支持。

现在能在本站直接用 Wan Dancer 吗?

wan27.org 上的在线 Wan Dancer 生成器即将上线。在此之前,本页面会讲清模型的工作方式,开源权重也已在 Hugging Face 和 ModelScope 提供。

Wan Dancer 和 Wan Animate 有什么区别?

Wan Dancer 由音乐驱动,从音频编排出一支舞。Wan Animate 则由参考视频驱动,负责角色动画和角色替换。二者是同一实验室的姐妹模型,但解决的是不同任务。