AIGC动态欢迎阅读
原标题:语音生成的「智能涌现」:10万小时数据训练,亚马逊祭出10亿参数BASE TTS
关键字:语音,报告,解码器,研究者,模型
文章来源:机器之心
内容字数:8472字
内容摘要:
机器之心报道
编辑:蛋酱伴随着生成式深度学习模型的飞速发展,自然语言处理(NLP)和计算机视觉(CV)已经经历了根本性的转变,从有监督训练的专门模型,转变为只需有限的明确指令就能完成各种任务的通用模型。
在语音处理和文本到语音(TTS)领域,这样的转变也正在发生,模型能够利用数千小时的数据,使合成结果越来越接近类人语音。
在最近的一项研究中,亚马逊正式推出了 BASE TTS,将 TTS 模型的参数规模提升到了前所未有的 10 亿级别。论文标题:BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data
论文链接:https://arxiv.org/pdf/2402.08093.pdf
BASE TTS 是一个多语言、多说话人的大型 TTS(LTTS)系统,在约 10 万小时的公共领域语音数据上进行了训练,比此前的训练数据量最高者 VALL-E 翻了一番。受 LLM 成功经验的启发,BASE TTS 将 TTS 视为下一个 token 预测的问题。这种方法通
原文链接:语音生成的「智能涌现」:10万小时数据训练,亚马逊祭出10亿参数BASE TTS
联系作者
文章来源:机器之心
作者微信:almosthuman2014
作者简介:专业的人工智能媒体和产业服务平台
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...