FireRedTTS3

FireRedTTS3 是什么

FireRedTTS3 是小红书 FireRed 团队(Xiaohongshu RedLab)于 2026 年 8 月 13 日发布并开源的新一代统一语音生成与编辑模型,采用对商用友好的 Apache 2.0 协议。它在一个框架内同时打通了三件过去需要三套系统才能完成的事:多语言、多方言的零样本音色克隆,用自然语言描述”凭空捏造”新声音的语音设计,以及对现有音频进行”手术刀”式局部修改的语音编辑。凭借 RedAE 语义增强连续表示与 LLM-DiT 架构,该模型在 Seed-TTS-Eval、MiniMax-MLS-Test、InstructTTSEval 等多个主流公开评测中全面领先,是当前开源 TTS 阵营中表现最亮眼的选手之一。

FireRedTTS3

FireRedTTS3 的主要功能

  1. 零样本音色复刻:仅需数秒参考音频,即可精准捕捉说话人音色特征,并将其迁移至 24 种语言(含粤语、日语、法语、语等)与 21 种中文方言(四川、河南、山东、粤语、吴语、闽南话等)的语音合成中。
  2. 自然语言声音设计:无需任何参考素材,只需输入”年轻女性的温柔嗓音,语速稍慢,带一点俏皮”这类描述,模型会先将指令解析为约 12 个维度的结构化声学属性计划(性别、年龄、语速、情绪等),再按计划生成全新音色,可解释且不易跑偏。
  3. 精准语音编辑:支持语义编辑(增删改词,如把”赞助商”换成”合作伙伴”)与声学编辑(调整语速、音高、音量),只动圈出的那一处,其余分毫不改、音色不飘。
  4. 克隆与可控编辑叠加:先克隆某个人的声音,再用 Instruct 指令为其加上”语速变慢、情绪愤怒”等描述,克隆与可控编辑在同一底座内协同完成。

FireRedTTS3 的技术架构

  • RedAE 语义增强表示:在连续表征训练阶段引入一个被冻结的预训练 Audio Encoder 充当”语义教师”,通过特征蒸馏把语义信息注入连续潜空间,既保留了丰富的声学细节,又压制了连续自回归生成中”越说越跑偏”的误差累积问题,且无需多阶段训练流水线。
  • LLM-DiT 生成范式:以 Qwen3-1.7B 作为核心后端(与 Qwen3.8-Flash 同属通义系开源模型谱系),充分发挥其文本理解与指令执行能力,通过 Aggregator 序列压缩与 DiT 模块的 Patch 级去噪生成,保证语音的时间连贯性与表现力。
  • 先规划后执行:Instruct 版本把用户的自然语言需求先转化为结构化声学方案或编辑掩码,再执行生成与修改,显著提升指令遵循的准确性。

如何使用 FireRedTTS3

  1. 环境配置:从 GitHub 仓库获取源代码并安装依赖,PyTorch 代码与模型权重均已开放。
  2. 下载权重:通过 ModelScope 或 Hugging Face 下载 FireRedTeam/FireRedTTS3 的 Base 与 Instruct 两套模型文件至本地。
  3. 调用接口:Base 版用于零样本克隆(参考音频 + 文本 + 语言标签);Instruct 版通过 generate_voice_design 实现声音设计,generate_semantic_edit 与 generate_acoustic_edit 分别完成语义编辑与声学编辑。
  4. 进阶技巧:需自动识别语种可配合 FastText 模型;合成方言时在文本前添加对应标签(如 ZH_Sichuan),并尽量使用同语系参考音频以获得最佳听感。
  5. 先试听再上手:可先访问官方 Demo 页面对比真人与合成效果,再决定是否本地部署。
FireRedTTS3

FireRedTTS3 的使用场景

  1. 跨语言内容创作:将有声书、播客一键转化为 24 种语言版本,大幅压缩海外发行的配音成本。
  2. 虚拟角色配音:为游戏与动画角色定制专属声线,台词修改后直接在语音成品上微调,无需重新进棚。
  3. 后期剪辑提效:录音中的口误、错词可以直接用语义编辑修掉,省去整段重录的麻烦。
  4. 品牌化语音交互:为智能客服、语音助手打造辨识度高、风格统一的企业声音资产。
  5. 方言文化保护:21 种方言的深度覆盖,让地方戏曲、乡音故事等文化内容的数字化传播成为可能。

FireRedTTS3 的评测表现

在 MiniMax-MLS-Test 24 语言基准上,FireRedTTS3 以平均字错率 3.75%、说话人相似度 84.8 的成绩位列对比模型(含 ElevenLabs、MiniMax-Speech、CosyVoice3、FishAudio S2 等)双料第一;在 Seed-TTS-Eval 上以 3.04% 的克隆字错率与 78.8 的平均相似度再夺双榜第一;在复旦 OpenMOSS 团队的 InstructTTSEval 声音设计基准上,中英文六个指标全部登顶。三个基准同时第一,在开源 TTS 领域并不多见。

FireRedTTS3 的常见问题解答

FireRedTTS3 可以商用吗?
模型采用 Apache 2.0 协议开源,代码与权重均可使用和修改;但官方论文与仓库明确约定:零样本音色克隆能力仅限学术研究用途,涉及克隆真人声音的商业项目务必先行评估合规风险,声音设计与编辑能力的商用边界也请以官方说明为准。
Base 版和 Instruct 版有什么区别?
Base 版专注 24 种语言与 21 种中文方言的零样本音色克隆;Instruct 版在克隆基础上新增声音设计、语义编辑与声学编辑三类指令接口,两个版本均可在同一项目中搭配使用。
不想本地部署能体验吗?
可以。官方 Demo 页面提供各能力的在线试听样例;开发者也可在 ModelScope 模型主页直接在线体验模型效果,再决定是否下载权重私有化部署。

FireRedTTS3 官网网址

GitHub 仓库:https://github.com/FireRedTeam/FireRedTTS3

官方 Demo:https://fireredteam.github.io/demos/firered_tts_3/

ModelScope 模型主页:https://modelscope.cn/models/FireRedTeam/FireRedTTS3

OpenI AI时代点评

FireRedTTS3 最打动人的不是某个单点成绩,而是”统一”二字:克隆、设计、编辑三件事合进一个 Apache 2.0 框架,过去要外接四五个模块的语音管线,现在一个模型全包。RedAE 用”语义教师”压制连续表征的漂移问题,思路干净利落,也说明国产团队在语音底层架构上已经具备了定义路线的能力,而不只是追赶者。

从产品视角看,它与 Gemini 3.5 Transcribe 这类语音转写模型恰好构成语音链路的一进一出:一个把声音变成文字,一个把文字变成可随心编辑的声音。与 Hy-MT2-1.8B 等轻量开源模型一样,FireRedTTS3 的开源权重让中小团队也能拥有过去只有大厂才做得起的语音能力——唯一的提醒是:克隆能力限学术研究的条款,商用前务必读懂规则。

阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...