ViiTorVoice-NAR实测

AI教程10小时前更新 AI工具集
0 0 0

ViiTorVoice-NAR实测 – 开源免费的语音克隆工具

ViiTorVoice-NAR实测

今天我们来聊聊一个非常适合进行声音复刻的工具。 在当前的 AI 语音生成领域,最令人头疼的问题莫过于,当你只想修改音频中几个词语时,却不得不重新录制、重新配音、重新剪辑,这无疑大大增加了工作量和时间成本。

而今天我们要介绍的 GitHub 项目 ViiTorVoice-NAR,恰好能完美解决这类场景。 它能够接收一段原始音频和对应的文本,然后直接修改音频中的局部内容,同时还能精准地保留原有的声线、语气和节奏感。

01. 项目概览

ViiTorVoice-NAR 是由 viitor-ai 团队开源的一套非自回归语音生成系统,其主要功能涵盖了语音克隆、局部语音编辑、情感控制以及副语言控制。

项目地址:https://github.com/viitor-ai/viitor-voice-nar

ViiTorVoice-NAR 的核心创新之处在于,它将语音生成的过程从传统的逐个 token 串联,转变为一种离散音频 token 的填空模式。 与那些需要按顺序生成音频 token 的自回归 TTS 系统不同,ViiTorVoice-NAR 采用了一种类似掩码语言模型(masked language model)的方式,在离散的代码本(codebook)空间中,对被掩盖(mask)的音频片段进行补全。

这种架构非常适合进行语音的局部编辑。 例如,当你想将一句话中的“星期五”替换为“星期一”时,只需定位并重新合成被修改的局部区域即可,无需对整段音频进行重新生成。

ViiTorVoice-NAR 的主要能力包括:

  • 语音克隆:输入一段参考音频,模型便能生成目标文本对应的语音,并尽可能地模仿参考音频中的说话人音色。
  • 局部语音编辑:提供原始音频、原始文本以及编辑后的完整文本,系统会先进行文本差异比对,再结合对齐结果,精确找到需要替换的音频区域,最终仅重新合成该局部片段。
  • 情感与副语言控制:在文本条件中可以嵌入情感标签或副语言标签,例如情绪、笑声、停顿、语气等,以实现更丰富的语音表达。
  • 低延迟推理:该项目支持“首块”推理模式,模型可以先生成第一段音频 token,从而显著缩短首帧的等待时间。

02. 项目实测体验

要运行此项目,您需要安装 git、uv,并且拥有一块英伟达显卡。 8GB 的显存即可运行,而 12GB 显存将带来更流畅的使用体验。

在环境配置完成后,您只需将项目克隆到英文路径下:

1  cd D:\
2  git clone https://github.com/viitor-ai/viitor-voice-nar.git viitor-voice-nar
3  cd D:\viitor-voice-nar

接着,创建 Python 3.12 虚拟环境并安装所需的依赖:

1  uv venv --python 3.12
2  uv pip install --python .venv\Scripts\python.exe -r requirements-grpc.txt
3  uv pip install --python .venv\Scripts\python.exe -r requirements-alone.txt
4  uv pip install --python .venv\Scripts\python.exe protobuf==4.25.3

下载模型文件,请注意模型文件较大,超过 10GB,请预留足够的存储空间:

1  New-Item -ItemType Directory -Force local_models
2  $env:PYTHONIOENCODING="utf-8"
3  .venv\Scripts\hf.exe download ZzWater/ViiTorVoice-NAR --local-dir local_models

最后,启动服务即可开始使用:

1  cd D:\viitor-voice-nar
2  .\run_grpc_v2.ps1 start all -- --no-warmup

案例一:语音克隆

1  Copy-Item "被克隆的语音位置" "D:\viitor-voice-nar\input_voice_clone.mp3" -Force
2  
3  curl.exe -X POST http://127.0.0.1:7861/v1/voice-clone `
4    -F "ref_audio=@D:\viitor-voice-nar\input_voice_clone.mp3" `
5    -F "text=你好,这是一次语音克隆测试。" `
6    -F "language=zh" `
7    -F "allow_missing_ref_text=true" `
8    -F "output_format=wav" `
9    -F "num_steps=32" `
10   --output "语音克隆输出位置" `
11   --write-out "HTTP %{http_code} size %{size_download}`n"

原始音频:

克隆音频:

可以看到,克隆出的音频不仅在音色上十分接近,还带上了一丝说唱的韵味。

案例二:局部词语替换

1  Copy-Item "被克隆的语音位置""D:\viitor-voice-nar\input_liziming.mp3" -Force
2  
3  curl.exe -X POST http://127.0.0.1:7861/v1/text-local-edit `
4    -F "source_audio=@D:\viitor-voice-nar\input_liziming.mp3" `
5    -F "original_text=请注意三年六班李子明,李子明同学,你妈妈拿了两罐旺仔牛奶要给你。" `
6    -F "edited_text=请注意三年六班克劳德,克劳德同学,你妈妈拿了两份迪普斯科要给你。" `
7    -F "language=zh" `
8    -F "input_format=wav" `
9    -F "output_format=wav" `
10   -F "align_granularity=word" `
11   -F "expand_mask_ratio=1.5" `
12   -F "num_steps=32" `
13   --output "语音克隆输出的位置" `
14   --write-out "HTTP %{http_code} size %{size_download}`n"

原始音频:

修改后的音频:

可以看到,除了需要修改的部分,音频的其他区域几乎没有发生任何变化。

案例三:情感控制

1  Copy-Item "被克隆的语音位置""D:\viitor-voice-nar\input_sad_ref.wav" -Force
2  
3  $Text = "你好,这是一次悲伤情绪的语音生成测试。"
4  
5  curl.exe -X POST http://127.0.0.1:7861/v1/voice-clone `
6    -F "ref_audio=@D:\viitor-voice-nar\input_sad_ref.wav" `
7    --form-string"text=<|emotion-sad|>$Text" `
8    -F "language=zh" `
9    -F "allow_missing_ref_text=true" `
10   -F "emotion_guidance_scale=6.0" `
11   -F "nvv_guidance_scale=2.0" `
12   -F "output_format=wav" `
13   -F "num_steps=32" `
14   --output "语音克隆输出的位置" `
15   --write-out "HTTP %{http_code} size %{size_download}`n"

原始音频:

悲伤情绪版音频:

情感表达非常到位,并且在情绪变化的同时,音色并未受到影响。

03. 深入探索

AI 语音技术正在逐步触及内容生产中最耗时且成本高昂的环节:内容修改。 根据 Monotype 在 2025 年对 1008 名创意专业人士的调研显示,57% 的创意团队每周会将超过四分之一的时间投入到非创意性的工作中,例如素材管理、合规性检查以及流程中的瓶颈处理。

无论是短视频的配音、广告素材的制作、在线课程的旁白、游戏角色的对话,还是客服播报,我们常常只需要修改一个人名、日期、品牌词或价格。 然而,传统的流程却要求我们重新录音、重新剪辑、甚至重新审核,这无疑是一种巨大的资源浪费。

ViiTorVoice-NAR 的语音克隆功能可以用于生成全新的内容,其局部语音编辑能力则能高效地修改旧音频中的少量词语,而情感控制功能则可以补充语气变化,使得内容修改过程变得更加轻松便捷。

这不仅能节省大量的配音费用,更能大幅缩短沟通、排期和反复剪辑的时间。 对于个人创作者而言,这可以用于音频的趣味性创作和口播内容的修改;对于企业而言,则可以将其作为内部配音工具,甚至围绕授权的声音资产构建一套成本效益更高的生产流程。

AI 语音技术真正融入生产流程的关键,并非在于一次性生成内容的惊艳程度,而在于每一次内容修改都能带来更少的折腾和更高效的体验。

阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...