720p
30fps 视频输出
把一张人像和一段音乐,变成 720p、30fps、随节奏起舞的跳舞视频,连贯性远超绝大多数模型 20 秒就崩坏的极限。Wan Dancer(Wan-Dancer-14B)是阿里巴巴通义实验室开源的音乐驱动跳舞模型,以 Apache-2.0 协议发布。
在线生成器即将上线
720p
30fps 视频输出
1 分钟+
突破 20 秒瓶颈
5
种舞蹈风格
Apache-2.0
开源权重,可自部署
什么是 Wan Dancer
Wan-Dancer-14B 用一张参考图和一段音乐,就能生成随节奏起舞的跳舞视频,无需动作捕捉,也不需要参考舞蹈视频。
Wan Dancer 由阿里巴巴通义实验室发布,模型名为 Wan-Dancer-14B,是一款音乐驱动的跳舞视频模型。你只需提供一张人像参考图和一段音乐,Wan Dancer 就会为画面中的人编排并渲染出随音乐起舞的动作,输出 720p、30fps 的视频。大多数视频模型在约 20 秒后就会漂移或崩坏,而 Wan Dancer 能保持一分钟以上的连贯。
它的关键在于先规划、再渲染。全局阶段读取整段音乐,把长时段的舞蹈以关键帧的方式排布出来;随后局部阶段逐帧细化关键帧之间的动作。这套建立在 Wan 图生视频底座之上的两阶段设计,正是它能从一张静态图和一首歌走到完整跳舞片段、而不是只有几秒动作的原因。在线生成器即将上线,在此之前,本页会讲清模型的工作方式与适用场景。
适合谁用
音乐视频与歌词片段、抖音与 Reels 的舞蹈翻跳、虚拟达人与 VTuber 开场、品牌推广循环,以及任何想让一张照片跟着某首歌起舞的场景。
使用流程
Wan Dancer 把规划和渲染分开 —— 生成器还未上线,但这就是模型遵循的工作流程。
提供一张清晰的人物参考图(竖版全身照效果最好),再加上一个音乐或音频文件,以及一句描述舞蹈风格的提示词。干净、低噪的音频和轮廓清晰的主体,能带来最稳定的效果。
Wan Dancer 读取整段音乐,为整套动作排布关键帧,先确定长时段的结构,让舞蹈从头到尾都串得起来。从整段音乐来规划,正是突破 20 秒连贯瓶颈的关键。
第二阶段把关键帧之间的画面细化为流畅、踩点的动作,输出 720p、30fps,并生成最终的 MP4 跳舞视频。动作速度控制让快节奏段落也能保持细节清晰。
核心功能
一款为长时段、锁节拍、单人编舞打造的音乐转跳舞视频生成器。
Wan Dancer 直接从你的音频生成舞蹈,编舞跟随真实音乐,而不是套用通用循环动作。你在一开始就把音乐交给它,而不是事后再把音乐对到一段无声视频上,还能用文本提示词进一步引导风格和情绪。
全局到局部的流程让结构在约 20 秒这个多数扩散模型崩坏的节点之后依然稳定,生成时长超过一分钟的舞蹈 —— 足够撑起一整段副歌或记忆点。
一张人像就够了。Wan Dancer 会把参考人物的脸、发型和服装贯穿整套动作,让舞者从第一帧到最后一帧都保持可辨认。
Wan Dancer 以流畅的每秒 30 帧渲染高清视频,直接可用于抖音、Reels、Shorts 上的短视频和音乐视频剪辑。
覆盖中国古典舞、K-Pop、街舞、踢踏舞和拉丁舞的训练,让 Wan Dancer 能用同一张参考图匹配多种音乐风格,你通过提示词来选择风格。
Wan-Dancer-14B 以 Apache-2.0 协议在 Hugging Face 和 ModelScope 发布,提供推理代码、ComfyUI 集成,以及用于自定义编舞的 LoRA 微调,可自部署并用于商业用途。
应用场景
把一张人像和一段音乐,变成短视频阵地需要的跳舞视频。
为歌词视频、视觉化 MV 和音乐视频插段生成跟随音乐的舞蹈片段,适合独立音乐人和推广预告,无需实拍。
把一张人像变成贴合热门歌曲的跳舞短片,再批量产出多个版本,投放抖音、Reels 与 Shorts,动作真实踩点。
用贴合曲风的编舞,为虚拟达人或 VTuber 形象做一段随音乐起舞的开场、转场或循环,无需绑定或动捕流程。
让品牌形象或代言人跟随广告音频起舞,用于社媒广告、落地页和产品发布。
创作者怎么说
受到音乐、舞蹈和短视频创作者的青睐 —— 以 Apache-2.0 开源。

Lena Marsh
音乐视频剪辑师
"音乐优先的方式改变了我的流程。我把曲子丢进去,拿到的就是贴合它的编舞,而不是事后再把无声片段对到鼓点上。"

Amara Sy
舞蹈内容制作人
"一张参考图搞定五种舞种,意味着我今天做拉丁、明天做街舞,都不用重拍任何东西。"

Nadia Hult
动态设计师
"踩点在整段片子里都稳。动作落在节奏上,这正是先出无声、再对音的工具从没做好的地方。"

Yara Kwon
虚拟达人运营
"做虚拟达人内容,身份一致非常重要。舞者从头到尾都是同一个可辨认的角色。"

Diego Ramos
短视频创作者
"突破 20 秒这道坎对我来说才是关键。一支能连贯跳满一分钟的舞,终于能真正用进视频里了。"

Jonas Pearl
流程技术总监
"开源权重和 ComfyUI 支持打动了我们团队。我们用 LoRA 微调编舞,全部在自己的流程里跑。"
常见问题
Wan Dancer(Wan-Dancer-14B)是阿里巴巴通义实验室开源的音乐驱动跳舞视频模型。它用一张人像照片和一段音乐,生成画面中的人随音乐起舞的视频,输出 720p、30fps。
它采用两阶段流程。全局阶段读取整段音乐、把舞蹈规划成关键帧,局部阶段再细化关键帧之间的动作。这种先规划的设计,正是让长段舞蹈保持连贯的关键。
Wan Dancer 面向分钟级生成,能在约 20 秒这个多数扩散视频模型崩坏的节点之后依然保持连贯。项目演示视频时长超过两分钟;开源版本面向更短的音乐输入。
一张人物参考图(竖版全身照效果最好)、一个音乐或音频文件,以及一句描述舞蹈风格的提示词。干净、低噪的音频能带来最稳定的效果。
它在五种舞种上训练:中国古典舞、K-Pop、街舞、踢踏舞和拉丁舞。你通过文本提示词配合音乐来选择风格。
是的。Wan-Dancer-14B 以 Apache-2.0 协议在 Hugging Face 和 ModelScope 开源,提供推理代码、ComfyUI 集成以及 LoRA 微调支持。
wan27.org 上的在线 Wan Dancer 生成器即将上线。在此之前,本页面会讲清模型的工作方式,开源权重也已在 Hugging Face 和 ModelScope 提供。
Wan Dancer 由音乐驱动,从音频编排出一支舞。Wan Animate 则由参考视频驱动,负责角色动画和角色替换。二者是同一实验室的姐妹模型,但解决的是不同任务。