AuK

AI工具10小时前更新 AI工具集
0 0 0

AuK 是什么

AuK 是腾讯混元团队开源的 15 亿参数语音生成与编辑基础模型。它没有沿用主流的自回归路线,而是采用流匹配扩散架构,通过一套统一的自然语言指令接口,完成零样本/指令式 TTS、语音内容编辑、声学调节、副语言编辑、降噪与人声分离等 16 种语音任务。项目同步提供了轻量版 AuK-Flash,仅需 4 步推理,速度提升约 4.5 倍。模型由腾讯混元联合上海交通大学等机构共同推出,权重与技术报告均已公开。

AuKAuK 项目官网首页

对内容创作者、音频后期从业者来说,过去想完成”改一个字但保持音色不变””把朗读改成耳语”这类需求,往往要拼接多个工具反复处理;AuK 把这些能力收敛到一个模型里,用一句指令直接完成,这也是它受到关注的核心原因。

AuK 的主要功能

AuK 的能力覆盖从语音生成到后期处理的完整链路,16 种任务都通过统一的自然语言指令调用:

  1. 零样本与指令式 TTS:既可以用短时参考音频快速克隆目标音色,也可以仅凭文字描述指定风格直接生成语音,无需训练专属模型。
  2. 语音内容编辑:对已有录音进行替换、插入、删字等修改,且不破坏原有的音色与语调,改完听感依然自然连贯。
  3. 声学调节:支持对音高、语速做量化调节,还可以转换情感色彩(如平静转激动)、修正口音。
  4. 副语言编辑:能够自然地增删呼吸、笑声等副语言元素,并在正常语音与耳语模式之间无缝切换。
  5. 降噪与人声分离:内置背景降噪与人声/伴奏分离能力,音频修复和二次创作可以在同一模型内完成。
  6. 歌词重写等扩展任务:面向音乐场景提供歌词改写等处理,覆盖更多创作需求。

这 16 种任务共享同一个指令格式:用户用自然语言描述”要做什么、对哪段音频、做成什么效果”,模型直接返回结果。相比过去”合成用一个工具、剪辑用一个软件、分离再找一个服务”的碎片化流程,AuK 把整条语音生产链路收敛到了一个模型里,也降低了不同工具之间来回导出导入的音质损耗。

AuK 的技术架构:流匹配扩散与三段式流水线

从技术架构上看,AuK 采用三段式流水线设计:首先由多模态大模型负责解析自然语言指令中的语义条件;然后音频 VAE 将波形映射到 50Hz 的声学隐空间;核心部分则是由 10 层双流 MMDiT 与 20 层单流 DiT 构成的混合 Transformer,负责在隐空间中完成生成与编辑。

流匹配扩散架构带来的最大优势体现在编辑任务上:模型以原始音频的隐表示作为去噪起点,只对需要变动的部分进行微调,未编辑区域的音色、语调和环境音得以完整保留。这正是”改一个字不伤整段录音”成为可能的关键。

在训练层面,AuK 经过了海量指令对齐训练,并辅以人类偏好强化学习,因此对复杂指令的执行力和生成语音的自然度都有较好表现。追求效率的用户可以选择轻量版 AuK-Flash:它把推理压缩到 4 步,速度提升约 4.5 倍,适合对实时性要求更高的场景。

如何使用 AuK

AuKAuK 的 GitHub 开源仓库

AuK 已在 GitHub 与 Hugging Face 完全开源,本地部署的基本流程如下:

  1. 准备硬件:建议使用显存不低于 24GB 的 NVIDIA 显卡,例如 RTX 3090 或 RTX 4090。
  2. 从 GitHub 克隆 Tencent-Hunyuan/AuK 仓库,按官方指南配置 Python 环境。
  3. 下载 AuK 模型权重,以及配套的 Qwen2.5-Omni-3B 模型。
  4. 通过命令行交互输入自然语言指令与音频素材,执行推理。
  5. 根据实际效果反复微调指令描述与参数,直到得到满意的输出。

如果只想快速了解模型效果,可以先浏览官网首页的演示样例,再决定是否本地部署。需要注意的是,指令式生成的效果与指令描述的精细程度直接相关,建议把情感、语速、口音等要求写清楚再推理;仓库还提供了 ComfyUI 集成等进阶玩法,熟悉工作流的用户可以把 AuK 接入现有的音频处理管线中。

AuK 的使用场景

  1. 影视与播客后期制作:台词改动、口音修正、增删呼吸与笑声,无需重录整段音频。
  2. 有声书与知识付费:用零样本克隆固定讲师音色,批量生产章节内容,删改稿子后局部重生成。
  3. 短视频与广告配音:指令式 TTS 直接按情感、语速要求出片,配合降噪处理嘈杂素材。
  4. 音乐 Remix 与二创:人声分离后做歌词重写与人声处理,服务于音频二次创作。
  5. 智能硬件与虚拟人:统一指令接口便于集成到语音交互链路,AuK-Flash 的低步数推理对实时场景友好。

从这些场景可以看出 AuK 的定位:它更像一个面向开发者和专业创作者的”语音底座”,而不是开箱即用的在线配音页面。愿意动手部署的用户,能拿到比在线工具更细的控制粒度——从改一个字的发音,到整体的情感与节奏,都可以用指令精确描述。

如果你更关注轻量在线工具,也可以看看站内这些同类产品:文本转语音在线工具文本转语音 (TTS)SAM TTS 语音合成器TTS Free Online免费文本转语音,以及主打声音复刻的 Voicv语音克隆免费语音克隆,它们与 AuK 在克隆与合成环节可以互为补充。

AuK 与 CosyVoice 3 的对比

目前开源语音阵营里,阿里通义的 CosyVoice 3 是常被拿来对比的模型。二者的路线差异可以概括为:AuK 更偏深度编辑与多功能整合,CosyVoice 3 更偏流式合成。下面这张表做一个直观对照:

对比维度AuKCosyVoice 3
架构路线流匹配扩散,非自回归偏流式合成路线
任务覆盖16 种任务,统一自然语言指令接口以语音合成为核心
编辑深度内容替换/插入/删字、声学调节、副语言编辑深度编辑并非主打方向
附加能力降噪、人声分离一体化聚焦合成本身
适合场景后期制作、影视修音、有声书、音频 Remix流式合成类需求

简单来说:如果需求是”对着一段已有录音反复精修”,AuK 的优势更明显;如果核心诉求是在线流式输出语音,两者可以按场景各取所需。

AuK 的常见问题解答

AuK 本地部署需要什么硬件配置?
官方建议准备显存至少 24GB 的 NVIDIA 显卡(如 RTX 3090 或 RTX 4090),并下载 AuK 权重与配套的 Qwen2.5-Omni-3B 模型后按仓库指南运行。
AuK 与 AuK-Flash 有什么区别?
AuK 是完整版基础模型;AuK-Flash 是轻量版,只需 4 步推理即可完成生成,速度提升约 4.5 倍,更适合对响应速度敏感的场景。
AuK 编辑录音时会不会破坏原音色?
不会刻意破坏。编辑时模型以原始音频的隐表示作为去噪起点,只改变需要变动的部分,未编辑区域的音色与语调能够得到保留。

AuK 官网网址

AuK 官网:https://auk-project.github.io/

代码仓库:https://github.com/Tencent-Hunyuan/AuK

模型权重:https://huggingface.co/tencent/AuK

技术论文:https://arxiv.org/pdf/2609.08936

OpenI AI时代点评

从 OpenI 的观察来看,AuK 的价值在于把”生成”和”编辑”真正放进了一个模型:16 种语音任务共用一套自然语言指令接口,避免了过去每类任务单独部署一个模型的繁琐;而”以原始音频隐表示为起点、只改变动部分”的编辑方式,切中了语音后期最痛的保真需求。配合 AuK-Flash 的 4 步快速推理,从专业修音到实时交互场景都有了想象空间。

当然,它对硬件有一定门槛:想本地跑完整版,基本要准备一张 24GB 显存的显卡;对没有这张卡的普通用户来说,轻量在线工具仍然是更低成本的选择,这也是开源模型与在线服务长期并存的原因。对语音 AI 感兴趣的开发者,可以先到 AuK 官网 试听官方样例,再决定是否投入一张 24GB 显卡本地部署。

阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...