Breeze TTS 2

Breeze TTS 2 是什么

Breeze TTS 2 是 BreezeBlue 团队推出的新一代语音合成(TTS)模型,定位于面向交互媒体的实时旗舰语音模型。它打破了传统 TTS”只能念预设音色”的限制:用户可以用自然语言从零描述并构建专属音色,也可以通过一句话指令精准调控语速、口音与情绪细节,让声音表现更具生命力。2026 年 8 月 16 日正式发布并同步上线托管 API,8 月 25 日模型权重与 PyTorch 推理代码在 Hugging Face 开源(3B 参数规模)。在 Artificial Analysis 的真人盲测榜单 Speech Arena 上,Breeze TTS 2 以 1215 的 Elo 分登顶开源权重模型榜首,领先此前的开源第一 Fish Audio S2 Pro 约 90 分,在全站约 100 个受评系统(含闭源)中总排名第六。

Breeze TTS 2

BreezeBlue 是一家约 15 人的初创公司,创始人杨斌曾是国内头部 AI 实验室的技术联创,公司获得由元璟资本与红点中国领投的 600 万美元种子轮融资。一个问世仅两周的模型就坐上开源 TTS 榜首位置,且由真人盲听打分而非厂商自测背书,含金量可观。

Breeze TTS 2 的主要功能

  • Voice Clone 声音克隆:提供一段干净的参考音频与对应文字稿,模型即可把音色、节奏与情绪完整复刻出来,无需依赖预设音色库。
  • Voice Design 音色设计:不需要任何参考音频,直接用一句话描述想要的声音——气质、年龄、性格、语气,模型即可即时生成独一无二的专属声线,这在开源 TTS 中相当少见。
  • Voice Direction 声音指导:克隆完声音还能继续”导演”——用自然语言调整语气、情绪、语速与表达方式(如”慢一点、严肃一点”),无需重录参考音频,且保持音色身份一致。
  • 人声合成:英文文本中直接写 (laugh)、(sigh)、(cough),中文写 [笑]、[叹气]、[咳嗽]、[清嗓子],模型会把笑声叹气等非语言声音直接合成进语音流,省去后期贴音效的麻烦。
  • 毫秒级实时交互:官方称在 H100 上暖机后首字节音频延迟低至 40ms 级、实时率约 0.32(约 3.1 倍实时速度),流式传输响应极快,适合 AI Agent 与实时对话场景。
  • 中英双语能力:开源权重版本以中英文为核心,其音频编码器基于 Qwen3-TTS 的 tokenizer(Apache 2.0 协议),中文表现有成熟基础;跨语言场景下仍能保持声音的自然度与角色辨识度。

Breeze TTS 2 的技术特点

Breeze TTS 2 将大型语言模型(LLM)的泛化逻辑与指令遵循范式引入语音领域,并利用海量影视、播客及访谈数据训练,深度学习了人类对话中的逻辑停顿、情感张力与互动节奏。它采用端到端的统一架构,避免了模块拼接带来的性能损耗,从而实现角色创造、情感表演与实时生成的无缝衔接。在官方自建的评测基准中,它的 Voice Design(Role Fit 78.02 分)与 Voice Direction(4.25 分)均排名第一,分别领先第二名约 5 分与 13%,同时保持 0.67 的音色相似度,做到了”改表演、不改人”。

值得注意的是发布节奏:2026 年 8 月 7 日,团队先公开了语音设计、语音指挥与延迟三组自研评测基准;8 月 16 日发布模型并上线 API;8 月 25 日权重与推理代码开源。榜单结果在开源次日即由第三方确认,这套”先立标准、再交答卷”的打法让它的第一名更具说服力,也为整个开源 TTS 社区提供了可复用的评测工具。

如何使用 Breeze TTS 2

  1. 网页端快速体验:访问 BreezeCreator 网页端,输入文本或上传参考音频即可直观体验音色克隆、音色设计与声音指导三大能力。
  2. API 集成:订阅官方托管的 HTTP/WebSocket API,配合 SDK 把语音合成能力集成到应用中;付费订阅后 API 生成的输出可用于商业用途。
  3. 本地部署:从 Hugging Face 下载 BreezeBlue/Breeze-TTS-2 权重与推理代码自行部署。默认推理模式约需 7.7GB 显存(建议 12GB 显卡起步);开启全速优化后显存需求升至约 14.4GB(建议 24GB 显卡)。习惯 Qwen3-TTS 的用户几乎零学习成本,输入方式同属”参考音频+精确转录”一套逻辑。
Breeze TTS 2

Breeze TTS 2 的使用场景

  1. 数字直播与虚拟主播:根据实时弹幕动态调整语气与情绪,让直播互动更自然流畅。
  2. 沉浸式游戏:为海量 NPC 赋予个性化声音,用 Voice Direction 批量调校不同角色的说话方式,显著增强代入感。
  3. 有声内容制作:帮助创作者高效完成广播剧、有声书配音,实现多角色、多情绪的精准演绎,人声标注让笑声叹气直接写进文本。
  4. 智能交互系统:在 AI 客服、语音助手与伴侣机器人场景中,凭借低延迟让对话响应如真人般敏捷。它与 Prime Agent 这类 Agent 框架结合,可以快速搭建具备自然语音交互能力的智能体应用;若再接入 GLM-5.3-Flash 这类对话模型充当”大脑”,就能形成”听得懂—想得清—说得好”的完整闭环,让机器开口说话这件事从及格线迈入有感情、有个性的水准。

Breeze TTS 2 的价格版本

Breeze TTS 2 提供两种使用路径:其一是官方托管 API,定价为每百万字符 34 美元,付费订阅后生成内容可商用;其二是开源权重,源代码遵循 Apache 2.0 协议,但模型权重、衍生模型及自托管输出适用 BreezeBlue 研究与非商业许可——个人学习、研究、自用不受限,商业变现(配音接单、有声书、付费产品等)需另行获取书面授权。选择本地部署前请务必确认自己的用途符合协议条款。

Breeze TTS 2 的常见问题解答

Breeze TTS 2 与 ElevenLabs 等头部商业产品相比如何?
在 Artificial Analysis 真人盲测中,Breeze TTS 2 以 1215 Elo 登顶开源权重榜首、全站第六,与闭源第一梯队同台竞技。相比 Eleven v3 等竞品,它的优势集中在音色定制灵活度、复杂情感表达的指令控制能力与 API 响应速度上;不过第三方实测其合成速度(约每秒 45 字符)低于同榜的 Fish Audio S2 Pro(约每秒 102 字符),它赢在音质与可控性而非纯速度。
开源权重可以商用吗?
不可以直接商用。源代码是 Apache 2.0,但模型权重与自托管生成的音频适用研究与非商业许可,商用需获得书面授权,或改用官方付费 API(其输出可商用)。
本地跑 Breeze TTS 2 需要什么配置?
默认推理模式需约 7.7GB 显存,建议 12GB 以上显卡;若要开启全速优化路径,显存需求约 14.4GB,建议 24GB 显卡。官方宣传的 40ms 级延迟与 0.32 实时率基于 H100 级别硬件,普通消费级显卡上速度会有所下降。

Breeze TTS 2 官网网址

Breeze TTS 2 产品官网:https://breezeblue.ai/breeze-tts-2

Hugging Face 模型页:https://huggingface.co/BreezeBlue/Breeze-TTS-2

GitHub 推理代码仓库:https://github.com/breezeblue-ai/breeze-tts

OpenI AI时代点评

今年的开源 TTS 竞赛已经从”念稿子”卷到了”造声音、导表演”。Breeze TTS 2 把 Voice Clone、Voice Design、Voice Direction 三条控制路径做全,再加上把笑声叹气直接写进文本的人声能力,等于把”配音导演”这个职业的一部分工作交给了模型。15 人团队两周登顶开源榜首,也再次证明在小而精的垂直领域,小团队完全有机会撼动头部格局。

需要提醒的是两点理性预期:一是协议,权重与自托管输出仅限非商业用途,内容创作者商用前请先算清授权账,或直接走官方 API;二是速度与硬件,官方延迟数字基于 H100,消费级显卡用户应有合理预期。总体而言,如果你在做实时语音产品或想研究开源 TTS 的前沿控制范式,Gemini 3.5 Transcribe 这类语音转写模型负责”听清”,Breeze TTS 2 负责”说好”,一进一出的组合正好覆盖了语音交互的完整链路,值得上手一试。

阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...