dots.tts

AI工具14小时前更新 AI工具集
0 0 0

dots.tts – 小红书联合上海交大开源的语音合成基座模型

dots.tts,一个由小红书dots团队携手上海交大X-LANCE实验室共同打造的语音合成基石模型,以其20亿参数的强大实力,在语音合成领域掀起了新的浪潮。该模型独树一帜,直接在连续隐空间中逐块生成48kHz的音频,并在Seed-TTS-Eval等权威评测中,在音色相似度和内容准确度上均达到了业界领先(SOTA)水平。更令人瞩目的是,它还支持零样本克隆、流式输出以及低延迟的双工对话,为语音交互带来了前所未有的灵活性和效率。

dots.tts揭秘

dots.tts,正是小红书dots团队与上海交大X-LANCE实验室联手开源的20亿参数全连续自回归语音合成基石模型。其核心优势在于直接在连续隐空间中按块生成48kHz音频,在Seed-TTS-Eval等基准测试中,音色还原度和内容精确度均达到SOTA水平。该项目不仅全面开源了代码和模型权重,还拓展了dots.tts.edit的精确语音编辑功能,为用户提供了更丰富的应用可能。

dots.tts的强大功能

  • 瞬时音色复刻:只需3至10秒的参考音频,即可精准模仿该音色朗读任意新文本,甚至支持跨语言克隆。在Seed-TTS-Eval基准上,内容准确度和说话人相似度均达到SOTA表现。
  • 高品质文本转语音:无论是随机音色采样还是指定说话人,都能生成高质量语音。基于2B参数的连续自回归模型,直接输出48kHz音频。
  • 流畅交互,低延迟体验:天然支持流式输出,文本输入后即可逐块生成音频。在1T1A双流模式下,上游LLM每输出一个文本Token,语音侧即刻响应,音频首包延迟低至54.4毫秒,完美契合实时语音Agent和双工对话需求。
  • 精细化语音编辑:支持对已有录音进行文本替换、情绪调整、音高和语速修改,以及停顿的增删。更重要的是,多项操作可一次性完成,且未编辑区域保持原样。
  • 多语种驾驭能力:覆盖24种语言,在MiniMax多语言评测中,平均说话人相似度高达83.9,其中19个语种荣获单项第一。
  • 灵活的推理速度选择:提供Base、SOAR、MeanFlow(4步)、两步sCM、单步DMD等多种检查点,用户可根据音质和速度需求选择。

dots.tts的技术内核

  • 全连续自回归架构:dots.tts摒弃了传统语音量化为离散Token的做法,整个生成过程完全在连续隐空间中运行。模型以自回归方式逐块预测声学片段,并通过BigVGAN风格解码器还原为48kHz波形,从根本上避免了离散量化带来的信息损失和音色细节的缺失。
  • 语义化连续表征:模型采用基于HoliTok设计的AudioVAE,将原始波形压缩为25FPS的连续潜变量。编码器通过语义化训练,在重建保真度和隐空间结构化之间取得了精妙的平衡,使得重建后的说话人相似度高达0.969,为后续的自回归生成保留了丰富的音色和声学细节上限。
  • 误差控制机制:针对连续自回归中前步微小偏差易于累积的问题,dots.tts引入了因果语义编码器。它能将已生成的VAE patch实时压缩为紧凑的语义历史并回馈给大语言模型。通过剥离高方差的局部声学变化,仅保留长程语义摘要,有效抑制了长序列生成中的误差传播、啸叫和音色漂移。
  • 生成流程详解:生成过程以大语言模型为核心,该模型基于Qwen2.5-1.5B初始化,直接处理BPE文本Token并输出每步的隐藏状态。随后,自回归流匹配头(18层DiT)在LLM隐藏状态和自回归前缀的条件下,对下一个声学patch执行去噪生成,并由冻结的CAM++说话人编码器提供的全局x-vector确保音色一致性。
  • 后训练加速技术:团队通过SOAR自纠正对齐,使模型在训练时模拟真实推理中的偏差状态并学习自我修正,无需奖励模型即可提升稳定性。MeanFlow蒸馏将教师模型的多步轨迹压缩为平均速度,实现4步高质量生成。经简化一致性模型(sCM)压缩至2步。利用奖励感知分布匹配蒸馏(DMD)配合双时间尺度更新策略,得到了自然清晰的高质量单步模型。

关注微信公众号,回复“开源”,加入AI开源项目交流群。

如何驾驭dots.tts

  • 安装简便:执行 pip install dots.tts 即可轻松安装。也可从GitHub克隆源码,通过 pip install -e . 进行本地开发安装。高并发场景下,可额外部署SGLang Omni以获得CUDA Graph加速与连续批处理支持。
  • 命令行合成:使用 dots.tts 入口,并指定 --model-name-or-path--text 以及目标 --prompt-audio--prompt-text,即可实现零样本音色克隆。若省略 --prompt-text,则退化为x-vector克隆;若省略 --prompt-audio,则进行随机音色采样。
  • 命令行编辑:利用 dots.tts.edit 入口,提供 --source-audio 和XML风格的 --instruction,即可对已有录音执行文本替换、情绪或韵律修改等精确编辑。
  • Python API基础调用:通过 DotsTtsRuntime.from_pretrained() 加载模型后调用 generate(),传入文本与可选的参考音频,即可获取合成音频张量并保存为文件。
  • Python API流式输出:调用 generate_stream() 可逐块获取音频张量,实时推送到播放器或WebSocket,实现边生成边播放的低延迟体验。
  • Python API双流对话:使用 DotsTtsRuntimeDoubleStreaming 启动会话后逐Token推送文本,语音侧即刻开始生成,音频首包延迟可低至54.4毫秒,是实时语音Agent的理想选择。
  • 模型微调:运行 accelerate launch scripts/train_dots_tts.py 并配置自有数据路径,即可在公开检查点基础上进行音色或领域适配微调。
  • 蒸馏加速:通过 scripts/train_dots_tts_meanflow.py 以SOAR检查点为教师进行MeanFlow蒸馏,可获得4步、2步或1步的高质量学生模型,以满足不同延迟与并发需求。
  • Web界面体验:运行 python apps/gradio/app.py 启动可视化合成界面,或运行 apps/edit_playground/app.py 启动Edit Playground,在浏览器中上传音频、标注编辑区间并实时预览结果。

dots.tts的核心竞争力

  • 全连续隐空间建模:摒弃离散声学Token,直接在连续隐空间自回归生成,最大程度保留频谱质感与气声等丰富音色细节,重建说话人相似度高达0.969。
  • SOTA合成品质:在Seed-TTS-Eval基准上,同时荣获内容准确度和音色相似度SOTA。MiniMax 24语种评测平均SIM达83.9,综合性能超越主流方案。
  • 原生流式低延迟:1T1A双流模式下,音频首包延迟低至54.4毫秒。配合SGLang Omni,单卡H100可实现16路并发吞吐量达4.76 req/s,满足实时语音Agent的严苛需求。
  • 统一编辑能力:dots.tts.edit基于同一基石模型,支持XML结构化指令进行文本、情绪、韵律和停顿的精确编辑,在doteBench评测中整体领先其他开源系统。

dots.tts的项目链接

  • GitHub仓库:https://github.com/studio-dots-ai/dots.tts
  • arXiv技术论文:https://arxiv.org/pdf/2608.02673

dots.tts与同类竞品对比

对比维度dots.ttsCosyVoice 3
技术路线全连续隐空间自回归,无离散Token离散与连续混合表征,依赖声学Token
参数量2B1.5B
Seed-TTS-Eval 平均 WER/CER2.95%3.06%
Seed-TTS-Eval 平均 SIM79.275.3
多语言评测MiniMax 24语种平均SIM 83.9,19个语种第一侧重中英双语,未公开24语种结果
实时交互原生流式 + 1T1A双流,首包低至 54.4ms并行生成,延迟优化有限
推理加速MeanFlow 4步 / sCM 2步 / DMD 单步标准多步生成
开源范围Apache 2.0开源6个检查点 + 训练/微调/蒸馏全套代码模型与推理代码开源

dots.tts的应用场景

  • 实时语音Agent:1T1A双流模式首包延迟低至54.4毫秒,为LLM驱动的实时双工对话和语音助手提供了坚实基础。
  • 零样本音色克隆:仅需数秒参考音频即可复刻任意音色,支持跨语言克隆,广泛应用于有声书、配音及个性化内容创作。
  • 多语言内容生成:覆盖24种语言并保持高说话人相似度,为全球化产品的多语种语音播报和本地化服务提供了强大支持。
  • 精确语音编辑:通过dots.tts.edit,可对现有录音进行文本替换、情绪调节、韵律修改和停顿调整,适用于播客后期处理和音频内容精修。
  • 直播与实时播报:结合LLM的流式输出,实现边生成边播放,完美契合新闻播报、直播带货和实时信息播报等场景。
阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...