首个支持普通话和方言混说的TTS大模型：河南话、上海话、粤语说得溜

AIGC动态2年前 (2024)发布机器之心

AIGC动态欢迎阅读

原标题：首个支持普通话和方言混说的TTS大模型：河南话、上海话、粤语说得溜
关键字：方言,模型,普通话,语音,策略
文章来源：机器之心
内容字数：0字

内容摘要：

AIxiv专栏是机器之心发布学术、技术内容的栏目。过去数年，机器之心AIxiv专栏接收报道了2000多篇内容，覆盖全球各大高校与企业的顶级实验室，有效促进了学术交流与传播。如果您有优秀的工作想要分享，欢迎投稿或者联系报道。投稿邮箱：liyazhou@jiqizhixin.com；zhaoyunfeng@jiqizhixin.com自 2024 年 GPT-4o 出现以来，业内各公司纷纷投入巨大的资源进行 TTS 大模型的研发。近几个月内，中文语音合成大模型如雨后春笋般涌现，如 chattts、seedtts、cosyvoice 等。
虽然当前语音合成大模型在中文普通话上的效果已与真人几乎无异，但面对中国纷繁复杂的方言，TTS 大模型却鲜有涉猎，训练一个统一的中文各方言语音合成大模型是一项极具挑战的任务。
行业痛点与技术瓶颈
当前，语音合成大模型技术在普通话领域已经取得了显著进展，但在方言领域的发展却十分缓慢。中国拥有数十种主要方言，每一种方言都有独特的语音特征和语法结构，这使得训练一个覆盖各种方言的 TTS 大模型变得异常复杂。
现有的 TTS 大模型大多专注于普通话，无法满足多样化的

原文链接：首个支持普通话和方言混说的TTS大模型：河南话、上海话、粤语说得溜