SALMONN-2 – 清华等开源的通用音频大语言模型
SALMONN-2:通用音频大模型领域的革新者
由清华大学、上海人工智能实验室以及剑桥大手打造的SALMONN-2,是一款突破性的通用音频大语言模型。它巧妙地融合了字节跳动SPEAR统一自监督音频编码器的强大能力与多层特征融合适配器的精妙设计。以Qwen3为文本基座,SALMONN-2仅需约1.8万小时的监督数据,便在MMAU-Pro、MMAR、MMSU三大综合基准测试中刷新了同等规模开源模型的最佳纪录。尤为值得一提的是,SALMONN-2首次在通用ALLM(Audio Large Language Model)领域系统性地实现了声音检测、音频伪造检测、语音质量评估以及多模态上下文语音识别等一系列高级功能。
SALMONN-2的卓越能力概览
- 全方位音频洞察:SALMONN-2能够胜任语音识别、音频内容描述、音乐理解、情感分析以及说话人身份验证等多种跨领域任务。
- 精准声音识别(SED):它能够精确地捕捉并标示出环境中声音的起始与结束时间,例如识别出狗吠声或脚步声的出现时段。
- 深度伪造音频辨别:该模型能够判断语音的真实性,并精准定位音频中可能被篡改或合成的局部区域。
- 智能语音质量评定(SQA):SALMONN-2能够感知并分析诸如背景噪音、音频失真以及清晰度等低层声学特征,并提供专业的质量评分及详细的解释。
- 多模态情境语音识别(MICL):通过结合文本信息与参考发音音频,SALMONN-2显著提升了对生僻词汇和罕见人名的识别精度。
SALMONN-2的技术内核解析
- 统一自监督音频编码器:SALMONN-2的核心亮点之一在于其采用的SPEAR统一音频前端。该编码器在大规模无标注音频数据上通过自监督学习进行训练,能够同时捕获语音的语义、发音、音色、说话人身份以及声学环境信息。这一创新取代了以往常用的Whisper与BEATs双编码器组合,不仅简化了模型架构,更实现了在不同音频任务上更均衡的表现。
- 多层特征融合(MLF)适配器:SPEAR编码器的不同层级蕴含着丰富的信息:浅层捕捉精细的声学和发音细节,中层承载着音色和说话人特征,深层则积累了更宏观的语义概念。MLF适配器首先对各层隐状态进行层归一化与拼接,随后通过可学习的下投影和帧分组压缩,最终将融合后的分层表征映射至语言模型嵌入空间。这使得模型能够根据具体任务需求,灵活调用不同层级的声学线索。
- 时间戳注入机制:SALMONN-2创新性地将时间戳信息以自然语言文本的形式(例如
<2.0 seconds>)直接嵌入音频序列中。这些带时间戳的文本与音频嵌入交错输入语言模型,使得模型在统一的生成框架内即可完成时间定位任务,无需额外的专用时间戳嵌入层。 - 多模态上下文学习(MICL)训练:在多模态上下文语音识别任务中,SALMONN-2不仅接收文本偏置词表,还能同步利用目标词的参考发音音频作为多模态上下文。训练过程中引入的干扰词与目标词随机丢弃策略,有效避免了模型对上下文的过度依赖,促使其在声学证据的支持下,更合理地利用上下文线索。
如需加入AI开源项目交流群,请关注微信公众号并回复“开源”。
如何快速上手SALMONN-2
- 获取代码仓库:请访问GitHub仓库
https://github.com/bytedance/SALMONN/tree/salmonn2,使用git clone命令将项目代码克隆至本地。 - 搭建运行环境:执行
conda create -n salmonn2 python=3.10命令创建并激活名为salmonn2的虚拟环境。随后,请升级pip、setuptools及wheel。 - 安装依赖与项目:在项目根目录下,依次运行
pip install -r requirements.txt和pip install -e . --no-deps命令,以安装SALMONN-2及其运行时所需的全部依赖。 - 下载预训练模型权重:使用HuggingFace CLI工具下载模型检查点:
hf download marcoyang/SALMONN-2-8B --repo-type model --local-dir /path/to/salmonn-2-hf。请将/path/to/salmonn-2-hf替换为您期望的本地保存路径。 - 加载模型并执行推理:通过
AutoProcessor和AutoModelForCausalLM加载本地模型权重。将音频文件和指令文本作为输入,调用model.generate()方法,即可获得音频理解的分析结果。
SALMONN-2的突出优势
- 数据效能卓越:SALMONN-2仅使用约1.8万小时的监督数据,相较于同规模竞品动辄数十万甚至数百万小时的训练数据量,极大地降低了数据标注成本。
- 统一前端的均衡性:单一的SPEAR自监督编码器替代了复杂的双编码器架构,在语音、环境声、音乐以及副语言等多种任务上实现了更佳的性能均衡。
- 全层次信息深度挖掘:MLF适配器能够融合所有编码器层级的特征,有效避免了因仅使用末层信息而可能丢失的声学和音色等关键细节。
- 音频分析能力显著拓展:SALMONN-2首次在通用ALLM中系统性地支持了声音检测、音频伪造检测以及语音质量评估等此前较少被关注的音频分析任务。
- 规模化潜力巨大:通过将文本基座从8B扩展至30B-A3B,三大综合基准测试分数均持续提升,充分验证了该架构具备良好的规模扩展能力。
SALMONN-2的资源链接
- GitHub代码库:https://github.com/bytedance/SALMONN/tree/salmonn2
- HuggingFace模型库:https://huggingface.co/marcoyang/SALMONN-2-8B
- 技术论文(arXiv):https://arxiv.org/pdf/2607.17079
SALMONN-2与同类产品的深度对比
| 对比维度 | SALMONN-2 | MOSS-Audio |
|---|---|---|
| 模型规模 | 90亿参数(基于Qwen3-8B) | 90亿参数 |
| 监督训练数据量 | 约1.8万小时 | 逾100万小时 |
| 音频编码器架构 | SPEAR统一自监督编码器+MLF | 监督式单编码器 |
| MMAU-Pro得分 | 58.5 | 57.5 |
| MMAR得分 | 64.5 | 64.4 |
| MMSU得分 | 69.5 | 66.4 |
| SED / 伪造检测 / SQA | 原生支持 | 未系统集成 |
| 多模态上下文ASR | 支持(音频+文本偏置) | 未支持 |
| 开源许可 | 开放源代码(GitHub + HuggingFace) | 开放源代码 |
SALMONN-2的广泛应用前景
- 智能会议助手:实时会议内容转录,并能结合参会者发音示例,精准识别外籍人士姓名及专业术语。
- 音频内容安全审核:自动检测直播或播客中的异常声音,有效识别深度伪造语音,防范潜在的欺诈行为。
- 语音质量自动化监控:对客服通话录音、录音棚素材等进行自动化质量评分,并精准定位存在噪声或失真的片段。
- 多媒体档案智能检索:为历史音频、广播节目生成带有时间戳的描述,实现基于内容的精准信息检索。
- 辅助听障人士的设备:将环境中的声音(如门铃声、警报声)以文字和时间戳的形式实时提示听障用户,提升生活便利性。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...


