阿里 Wan2.1 本地部署教程 – 8G 显存可文生视频

今天我们来聊聊如何在本地搭建一套能生成 AI 视频的系统,特别适合那些不想被高昂费用困扰的创作者。目前 AI 视频生成技术已相当成熟,但高昂的按秒计费以及不确定的出片率,确实让不少用户望而却步。
好消息是,GitHub 上一个名为“阿里 Wan2.1”的项目,为我们提供了一个绝佳的解决方案。它允许用户在最低仅需 8GB 显存的配置下,实现本地化视频生成,相信这已经能满足市面上大部分电脑的硬件要求。
01. 项目概览
Wan2.1 是由阿里通义团队精心打造的一套全面的视频生成基础模型套件。您可以从 这里 访问其项目地址。
与许多仅专注于单一功能的模型不同,Wan2.1 的强大之处在于其多功能性,它不仅支持文生视频(Text-to-Video),还涵盖了图生视频(Image-to-Video)、首尾帧补间、视频编辑、参考主体生成以及文生图等多种任务。尽管后续推出了 Wan2.2,但 Wan2.1 在低显存环境下的运行表现尤为出色,是进行本地实验和二次开发的理想选择。
Wan2.1 更像是一个功能丰富的视频模型工具箱,每个模型都针对特定的任务进行了优化:
- 对于文生视频,可以从 Wan2.1-T2V-1.3B 入手,它主打 480P 分辨率,非常适合本地测试和低显存设备。
- 若追求更精细的画面细节和流畅的表现,可以考虑 Wan2.1-T2V-14B,它支持 480P 和 720P 分辨率。
- 图生视频任务则由 Wan2.1-I2V-14B 承担,官方提供了 480P 和 720P 两种版本。
- 如果您需要精确控制视频的起始和结束画面,Wan2.1-FLF2V-14B-720P 将是您的得力助手。
- 专注于视频创作和编辑,尤其是 480P 场景,Wan2.1-VACE-1.3B 提供了更低的门槛。
- 而 Wan2.1-VACE-14B,支持 480P 和 720P,则适用于参考主体生成、局部修改、视频换主体等更复杂的编辑需求。
官方提供了多种接入方式,包括 Hugging Face、ModelScope、Diffusers、ComfyUI 和 Gradio 等。在本次教程中,我们将重点关注 Wan2.1-T2V-1.3B,它在 8GB 显存下即可流畅运行。在 RTX 4090 显卡上,生成约 5 秒的 480P 视频,官方参考时间约为 4 分钟。虽然 1.3B 模型也可尝试 720P,但官方提示其稳定性可能不如 480P。
Wan2.1 的工作原理是,首先通过 T5 编码器将用户输入的提示词转化为语义向量,这些向量能够精确描述画面内容、主体动作、场景设定、镜头运用、画面风格、光影效果和色彩搭配。接着,在 Transformer Block 的每一次迭代中,通过交叉注意力机制(Cross-Attention)将这些文本语义巧妙地融入视频生成过程。Wan2.1 的一大亮点是支持多语言输入,尤其在中英文提示词的理解和生成能力上表现出色。
此外,Wan2.1 还具备提示词扩写功能。例如,当您输入“一只猫在厨房做蛋糕”时,模型能够自动丰富细节,如猫的毛发颜色、厨房的布置、制作蛋糕的具体动作、镜头视角、光线条件、画面风格以及动作的顺序等。
在实际编写提示词时,建议遵循“主体 + 动作 + 场景 + 镜头 + 光线 + 风格 + 节奏”的结构。例如:“一名身着黄色雨衣的女孩静立在雨夜的街头,她缓缓转过头,目光投向镜头。远处,车辆呼啸而过,霓虹灯的光芒在积水中闪烁。镜头从中景缓缓向前推进,采用浅景深效果,呈现出写实的电影风格,整体色调偏向冷蓝色。”
Wan2.1 采用了 Diffusion Transformer 架构,其生成过程可以大致理解为:首先生成一段随机噪声,然后模型根据提示词判断噪声中应包含的内容,并经过多次迭代去噪,逐步构建出主体、背景和动作。最后,VAE(Variational Autoencoder)将潜变量解码为最终的视频画面。
02. 实操演练
在运行 Wan2.1 之前,请确保您已配置好相应的 Python 环境。官方推荐的依赖项包括:
- PyTorch ≥ 2.4.0
- torchvision ≥ 0.19.0
- Diffusers ≥ 0.31.0
- Transformers ≥ 4.49.0
- Accelerate
- Flash Attention
- Gradio
- OpenCV
- NumPy 1.x
以下是在 Windows PowerShell 中进行基础安装的步骤示例:
1 Set-Location "您想安装 Wan 2.1 的文件夹路径"
2 git clone https://github.com/Wan-Video/Wan2.1.git
3 Set-Location .\Wan2.1
4
5 python -m venv .venv
6 .\.venv\Scripts\python.exe -m pip install --upgrade pip
7 .\.venv\Scripts\python.exe -m pip install -r requirements.txt
这里的 `.venv` 是 Wan2.1 项目自带的 Python 虚拟环境。为了避免影响系统 Python 环境,建议后续所有安装依赖和运行脚本的操作,都使用此虚拟环境中的 Python 解释器。
接下来,下载 1.3B 模型:
1 Set-Location "Wan 2.1 的文件夹路径"
2 .\.venv\Scripts\python.exe -m pip install "huggingface_hub[cli]"
3
4 .\.venv\Scripts\huggingface-cli.exe download Wan-AI/Wan2.1-T2V-1.3B `
5 --local-dir .\Wan2.1-T2V-1.3B
安装完成后,激活 Wan2.1 项目目录下的 `.venv` 虚拟环境。在 PowerShell 中,按照以下格式执行命令:
Set-Location "Wan 2.1 的文件夹路径"
# 进入 Wan2.1 项目根目录。后续所有路径、脚本执行都将基于此目录。
New-Item -ItemType Directory -Force .\outputs
# 创建 outputs 目录用于保存生成的视频。如果目录已存在,-Force 参数会忽略报错。
.\.venv\Scripts\python.exe generate.py `
# 使用虚拟环境中的 Python 解释器运行 generate.py 脚本。末尾的 ` 表示命令将延续到下一行。
--task t2v-1.3B `
# 指定任务为文生视频(t2v),并选择 13 亿参数的模型(1.3B)。
--size 832*480 `
# 设置视频分辨率为 832 像素宽,480 像素高,即 480P 横屏。
--frame_num 65 `
# 设置生成视频的帧数。Wan2.1 通常以 16 FPS 导出,65 帧大约对应 4 秒视频。
--ckpt_dir .\Wan2.1-T2V-1.3B `
# 指定模型权重文件的存储目录,即您下载好的 Wan2.1-T2V-1.3B 文件夹。
--offload_model True `
# 启用模型卸载功能,将暂时不用的模型部分移至 CPU 内存,以降低显存占用,但会增加处理时间。
--t5_cpu `
# 将 T5 文本编码器置于 CPU 上运行,以节省显存。T5 负责解析提示词。
--sample_steps 20 `
# 设置采样步数。更高的步数通常能带来更稳定的画面,但会延长生成时间。20 步在质量和速度之间取得了较好的平衡。
--sample_shift 8 `
# 控制采样过程中的时间分布。对于 1.3B 模型,通常选择 8 到 12 之间的值,8 是一个稳健的默认选项。
--sample_guide_scale 6 `
# 调整提示词的引导强度。数值越高,模型越倾向于遵循提示词,但过高可能导致画面僵硬或失真。对于 1.3B 模型,6 是一个较稳妥的设置。
--save_file .\outputs\moonlit_train_window.mp4 `
# 指定输出视频的文件名及保存路径,此处将保存至 outputs 文件夹。
--prompt "在此处输入您的视频提示词"
# 视频提示词。请遵循“主体 + 动作 + 场景 + 镜头 + 光线 + 风格 + 节奏”的格式进行描述。
在初次测试时,建议先尝试较少的帧数,逐步摸索您机器的最大承载能力。
Wan2.1 默认导出的视频帧率为 16 FPS,因此:65 帧 ÷ 16 FPS ≈ 4 秒。常见的帧数参考如下:33 帧 ≈ 2 秒;49 帧 ≈ 3 秒;65 帧 ≈ 4 秒;81 帧 ≈ 5 秒。
案例 1:33 帧,采样步数 12
在 PowerShell 中输入以下命令:
Set-Location “D:\360MoveData\Users\win\Desktop\蒸馏\Wan2.1”
.\.venv\Scripts\python.exe generate.py `
–task t2v-1.3B `
–size 832*480 `
–frame_num 33 `
–ckpt_dir .\Wan2.1-T2V-1.3B `
–offload_model True `
–t5_cpu `
–sample_steps 12 `
–sample_shift 8 `
–sample_guide_scale 6 `
–save_file .\outputs\quick_test.mp4 `
–prompt “A small robot walking through a rainy neon street, cinematic lighting.”
从生成的视频来看,33 帧、12 步的设置下,主体(机器人)的形态已基本清晰,霓虹街道和湿地反光也初步呈现。然而,画面略显空旷,雨感不强,机器人的动作也显得有些僵硬。
案例 2:33 帧,采样步数 20
PowerShell 输入:
.\.venv\Scripts\python.exe generate.py `
–task t2v-1.3B `
–size 832*480 `
–frame_num 33 `
–ckpt_dir .\Wan2.1-T2V-1.3B `
–offload_model True `
–t5_cpu `
–sample_steps 20 `
–sample_shift 8 `
–sample_guide_scale 6 `
–save_file .\outputs\robot_neon_street.mp4 `
–prompt “A small friendly robot walking alone through a rainy neon street at night, wet asphalt reflecting red and blue signs, soft steam rising from street vents, cinematic cyberpunk atmosphere, low-angle tracking shot, slow camera movement, detailed metal body, glowing eyes, realistic rain, volumetric lighting, shallow depth of field, high detail, smooth motion, 35mm film look”
相较于前一个案例,此处的画面质量有了显著提升。红蓝霓虹灯、湿滑的路面、夜晚的氛围感都更加稳定,机器人处于画面,主体识别度很高。但 2 秒的视频时长仍然偏短,动作幅度不够明显,机器人更像是静止在街上轻微晃动,而非真正“走过”。
案例 3:49 帧,采样步数 20
PowerShell 输入:
Set-Location “D:\360MoveData\Users\win\Desktop\蒸馏\Wan2.1”
.\.venv\Scripts\python.exe generate.py `
–task t2v-1.3B `
–size 832*480 `
–frame_num 49 `
–ckpt_dir .\Wan2.1-T2V-1.3B `
–offload_model True `
–t5_cpu `
–sample_steps 20 `
–sample_shift 8 `
–sample_guide_scale 6 `
–save_file .\outputs\robot_neon_street_v2.mp4 `
–prompt “A cinematic 3-second video of a small friendly robot walking alone through a rain-soaked neon street at night. The robot has a compact metal body, round glowing eyes, and subtle reflections on its wet surface. Red, blue, and purple neon signs reflect on the asphalt. Light rain falls through the frame, steam rises from street vents, and distant shop lights glow softly in the background. Low-angle tracking shot, slow forward camera movement, realistic rain, volumetric lighting, shallow depth of field, smooth walking motion, detailed cyberpunk street, moody atmosphere, 35mm film look, high detail.”
这一版本的视频在空间感上有了显著进步。雾气、地面反射、远景店铺的灯光都更加完整,机器人与环境的融合也更为自然。3.06 秒的视频时长,使得动作的流畅度有所提升,整个画面更像一个连贯的镜头。
案例 4:65 帧,采样步数 20
PowerShell 输入:
Set-Location “D:\360MoveData\Users\win\Desktop\蒸馏\Wan2.1”
.\.venv\Scripts\python.exe generate.py `
–task t2v-1.3B `
–size 832*480 `
–frame_num 65 `
–ckpt_dir .\Wan2.1-T2V-1.3B `
–offload_model True `
–t5_cpu `
–sample_steps 20 `
–sample_shift 8 `
–sample_guide_scale 6 `
–save_file .\outputs\moonlit_train_window.mp4 `
–prompt “A cinematic 4-second video seen from inside an old night train. A young traveler sits beside a rain-covered window, watching a quiet countryside pass by under moonlight. Reflections of warm carriage lamps shimmer on the glass. Outside the window, distant trees, small houses, and silver mist slide slowly across the frame. The camera begins with a close-up of raindrops on the window, then gently shifts focus to the traveler’s calm face and the moving landscape beyond. Soft film grain, realistic rain, warm interior light, cool blue moonlight outside, slow emotional camera movement, shallow depth of field, natural motion, detailed train cabin, quiet poetic atmosphere, 35mm film look, high detail.”
随着视频时长的增加,叙事感也得到了显著提升。车厢内的暖光、窗外的冷蓝色月光、雨滴以及旅人的侧脸都得到了恰当的呈现。人物没有出现明显的形变,整体画面保持了相当的稳定性。然而,生成过程耗时较长,这表明我的机器性能已接近其极限。
03. 深度探索
AI 视频生成已不再仅仅是技术尝鲜的工具。
根据高盛的预测,创作者经济的规模有望从目前的约 2500 亿美元飙升至 2027 年的 4800 亿美元。视频内容的市场需求持续增长,但对于创作者而言,成本、试错次数以及生产速度始终是巨大的挑战。
尽管 Wan2.1 无法完全取代专业的视频制作团队,也无法保证每一次生成都能一蹴而就,但 Wan2.1-T2V-1.3B 的出现,成功地将过去按秒计费、受制于平台的文生视频体验,转变为可以在本地显卡上反复测试、低成本迭代的工作流程。这意味着您可以更地调整提示词、优化参数,并显著降低失败的成本。
Grand View Research 的报告显示,全球 AI 视频生成市场的规模预计将从 2025 年的 7.885 亿美元增长至 2033 年的 34.416 亿美元,年复合增长率高达约 20.3%。
Wan2.1 的应用场景非常适合整合到真实的生产流程前端:您可以利用它以较低的成本生成样片、验证镜头创意、测试不同的提示词和风格,然后基于这些初步成果,再决定哪些片段值得进行更精细的打磨,例如通过剪辑、补帧,或者交给更专业的商业级模型进行深度处理。
总而言之,Wan2.1 将过去高昂、低频、依赖预算支撑的视频内容试错过程,转变为普通电脑用户也能参与的日常生产环节。


