Luna-TTS

Luna-TTS – 宇生月伴推出的文本转语音大模型

在人工智能语音合成领域,来自上海交大背景的初创团队宇生月伴(VUI Labs),近期凭借其自研的 Luna-TTS 模型成功打破了行业技术壁垒。该模型摒弃了目前主流的自回归生成范式,转而采用前沿的 Masked Diffusion(掩码扩散)架构,并以 Qwen3-0.6B 作为底层骨干模型,配合自主研发的 Luna-Codec 编解码器,在涵盖中、英、日、韩四种语言的百万小时海量数据中完成了深度预训练。凭借卓越的性能,Luna-TTS 在 Hugging Face TTS Arena V2 盲听测试中问鼎全球榜首,在 Artificial Analysis 权威榜单上也高居第三,其表现甚至超越了谷歌同类技术。

Luna-TTS 的核心优势在于其深厚的技术底蕴与创新设计:

  • 突破性的 Masked Diffusion 架构:与传统自回归模型不同,Luna-TTS 将语音 RVQ Token 网格视作整体,通过多次迭代并行预测被掩码的部分,这种动态生成机制彻底消除了误差随前缀累积的风险。
  • 定制化 Luna-Codec:该编解码器能将 24kHz 波形高效压缩至 2.2kbps,通过因果编码实现帧同步与流式输出,在保证音质的同时极大降低了传输成本。
  • Qwen3 深度赋能:模型基于 Qwen3-0.6B 微调,Realtime 版本更是通过块级因果注意力与 KV Cache 优化,实现了极速响应。
  • 强化学习优化:通过将 GRPO 强化学习算法应用于扩散去噪路径,模型在内容准确度与说话人音色稳定性上达到了行业领先水平。

在功能表现上,Luna-TTS 展现了极高的专业度。它不仅支持四种语言的自然合成,还具备对 neutral、sad、surprised 等多种情绪的细腻刻画能力,甚至能精准还原呼吸、叹气、笑声等副语言细节。针对长文本任务,它能确保音色始终如一,不会出现漂移。特别值得一提的是,其 Realtime 版本在流式生成中表现抢眼,首块音频延迟仅为 41.6ms,端到端 RTF 低至 0.024,真正实现了实时语音交互。

Luna-TTS 与行业标杆 ElevenLabs Eleven v3 的对比数据揭示了其强劲的竞争力。在 TTS Arena V2 盲听测试中,Luna-TTS 以 1574 分位列第一,大幅领先对手。此外,其 80 美元/百万字符的定价策略也比 ElevenLabs 更具性价比。目前,Luna-TTS 已在多个领域展现出广泛的应用前景:从提升智能客服的拟人化体验,到为有声书和播客提供高品质长文本朗读,再到在线教育的个性化教学、车载设备的低延迟交互,以及跨语言会议的实时同声传译,Luna-TTS 正在重新定义语音交互的边界。

如需进一步探索技术细节,可访问项目官网:https://vuilabs-ai.github.io/luna-tts/,或查阅 arXiv 技术论文:https://arxiv.org/pdf/2608.11593。

阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...