Xiaomi-CocktailASR-1 是什么
Xiaomi-CocktailASR-1 开源项目主页
Xiaomi-CocktailASR-1 是小米研究院开源的一款目标说话人语音识别(Target Speaker ASR,简称 TS-ASR)大模型,核心能力是从多人混合语音中直接转录出指定说话人的发言内容。与传统的”先分离、再识别”级联方案不同,Xiaomi-CocktailASR-1 采用大型语言模型(LLM)端到端架构,把一段目标说话人的参考语音当作声纹提示(Prompt)送入模型,从而在不需要任何语音分离步骤的前提下完成定向转录。
换句话说,只要给 Xiaomi-CocktailASR-1 一段目标说话人的声纹样本,再给它一段嘈杂的多人音频,它就能把属于这个人的话单独”挑”出来并转成文字。这一能力让它在会议记录、客服质检、车载语音助手等多说话人场景中具备很高的实用价值。该模型以 Apache 2.0 协议开放,代码与权重均可获取与商用。
Xiaomi-CocktailASR-1 的主要功能
- 定向说话人语音识别:输入一段目标说话人的参考语音和一段多人混合音频,Xiaomi-CocktailASR-1 直接输出该说话人的转录文本,中间无需预先做语音分离,也就避免了分离误差向下游传导。
- 单人与多人场景统一:同一个模型、同一套权重即可同时胜任单人识别和多人目标识别,单人场景下的表现与主流单说话人 ASR 模型相当(LibriSpeech WER 1.73%),省去了按说话人数量切换模型的麻烦。
- 负样本拒识:当目标说话人根本没有出现在音频里时,Xiaomi-CocktailASR-1 会自然输出空文本而不是硬凑一段识别结果,实测拒识率在 68%–80% 之间,大幅降低了误触发和无效识别。
- 思维链(CoT)可解释推理:开启 CoT 模式后,模型会先输出说话人数量、性别、声纹相似度等中间推理过程,再给出最终转录结果,既提升了可解释性,也在一定程度上降低了词错误率(WER)。
- 极简调用与批量推理:核心推理只需一行代码,支持非 16kHz 音频自动重采样,同时提供批量 TSV 推理脚本,便于在数据集上做规模化评测与落地。
如何使用 Xiaomi-CocktailASR-1
Xiaomi-CocktailASR-1 以 HuggingFace 权重 + 自定义代码的形式发布,本地部署流程比较标准,下面按实际使用顺序整理。
- 安装运行环境:准备 Python 与 CUDA 环境后,安装依赖包。
pip install torch torchaudio transformers soundfile
- 获取模型权重:在 HuggingFace 下载预训练权重,模型 ID 为
Ease3/Xiaomi-CocktailASR-1,仓库地址为 https://huggingface.co/Ease3/Xiaomi-CocktailASR-1。 - 加载模型:加载时务必开启
trust_remote_code=True,并使用 bfloat16 精度送入 GPU,同时切换到评估模式。
AutoModel.from_pretrained("Ease3/Xiaomi-CocktailASR-1", trust_remote_code=True, torch_dtype="bfloat16").cuda().eval()
- 准备音频:准备一段 16kHz 单声道的目标说话人参考语音(声纹样本),以及一段待识别的单人或多人音频;若待识别音频采样率不是 16kHz,模型会自动重采样。
- 执行单条推理:调用时第一个参数是待识别音频,第二个参数是参考语音。
model("target.wav", "ref_speaker.wav")
如果目标说话人不在音频中,Xiaomi-CocktailASR-1 会自动返回空文本,不需要额外设置阈值参数。
- 开启思维链推理:追加
cot=True参数即可启用 CoT 模式,模型会在<think>标签内输出推理过程,在<answer>标签内给出最终识别结果。 - 批量推理:把数据整理成包含
utt_id, wav, text, ref_wav, ref_id五列的 TSV 文件,再运行tools/test_batch_scp.py脚本,指定模型路径、输入 TSV 与输出文件,即可完成批量转录。
Xiaomi-CocktailASR-1 的技术架构与训练策略
Xiaomi-CocktailASR-1 的整体结构由三段组成,设计上追求”简单但有效”。
- 统一的端到端架构:一个基于 Data2Vec2 改进的 0.6B 音频编码器负责提取语音特征,一个轻量级线性 Adapter 把编码器输出对齐到 LLM 的隐空间,最后由 Qwen3-8B 大语言模型作为骨干生成转录文本。输入音频按”参考语音 + 1 秒静音 + 混合语音”的方式组织,编码器输出的帧级特征经 Adapter 处理后与文本 Prompt 一起送入 LLM。
- 参考语音作为条件提示:编码器借助 Data2Vec2 的自监督掩码预测机制,在单一网络内同时完成语义信息与说话人信息的融合,因此不需要额外的声纹编码器。参考语音被当成一种条件 Prompt,让编码器在特征提取阶段就自适应地聚焦目标说话人的声音、抑制背景噪声,从源头避免了级联系统的误差累积。
- 多阶段数据配比训练:Xiaomi-CocktailASR-1 通过精心配比的数据同时塑造四种能力——约 40 万小时多说话人数据训练目标提取能力;约 60 万小时同说话人”参考-目标”配对数据,防止模型在单人场景下过度抑制;约 1 万小时错配参考的负样本数据,把拒识能力内化为模型本能而不需要额外阈值;CoT 数据则训练模型先生成推理链再给出答案。
- 双模式 Prompt 设计:标准模式下,一个统一 Prompt 同时覆盖单人识别、多人目标识别与负样本拒识三类任务,目标缺失时自然输出空文本;CoT 模式由 Prompt 触发
<think>推理标签,输出说话人数、性别、声纹相似度等中间步骤后再输出<answer>转录结果。
Xiaomi-CocktailASR-1 GitHub 仓库与模型说明
Xiaomi-CocktailASR-1 的使用场景
- 多人会议的定向转录:在会议室场景下,Xiaomi-CocktailASR-1 可以锁定某一位参会者,只转写他的发言,自动过滤他人插话和背景讨论。如果你只需要把整场会议完整转成文字再整理,也可以配合 字幕精灵 这类实时语音识别工具使用,前者做定向提取,后者做全量记录。
- 语音助手与指令识别:在手机、智能音箱或车载系统中,模型可以只响应特定用户的语音指令,避免被周围其他人声干扰而误唤醒。类似需求在传统输入场景下通常交给 秒言AI语音输入法 这样的语音输入工具处理,而 Xiaomi-CocktailASR-1 解决的是”多人同时在场时该听谁的”这一层问题。
- 客服与质检录音分析:从多人通话录音中精确提取指定一方的完整话术,为合规检查、服务评估和纠纷复盘提供可靠的文字依据。成段的录音内容后续也可以导入 通义听悟 做摘要与要点归纳。
- 智能家居的精准控制:家庭环境中电视声嘈杂、多人交谈时,Xiaomi-CocktailASR-1 依然能识别遥控器持有者的指令,减少误操作。
- 辅助助听与会议记录设备:为听障人士或需要精确记录发言的用户,在嘈杂社交场合中专注提取特定说话人的语音并实时转成文字。个人随身的语音转写需求,也可以参考 Audio Note 语音笔记 与 灵机语音 这类轻量化工具。
Xiaomi-CocktailASR-1 与 Qwen3-ASR 的对比分析
下面按原文给出的公开基准数据,把 Xiaomi-CocktailASR-1 与通用语音识别大模型 Qwen3-ASR 做一次横向对照。
| 对比维度 | Xiaomi-CocktailASR-1 | Qwen3-ASR |
|---|---|---|
| 产品定位 | 专注于目标说话人语音识别(TS-ASR),尤其擅长多人混合场景 | 通用语音识别大模型(LALM),支持多语言和方言 |
| 多人语音识别能力 | 业界领先:LibriMix 2mix WER 4.11%,AliMeeting Far 20.63% | 表现受限:LibriMix 2mix WER 68.75%,AliMeeting Far 39.64% |
| 单人语音识别能力 | 表现强劲:LibriSpeech WER 1.73%,CommonVoice(zh) 4.95% | 性能相当:LibriSpeech WER 1.87%,CommonVoice(zh) 5.39% |
| 负样本拒识能力 | 支持,拒识率 68%–80%(LibriSpeech neg 79.59%) | 拒识率为 0%,目标缺席时仍可能产生误识别 |
| 可解释推理能力 | 支持 CoT 思维链,输出声纹相似度等推理过程 | 不支持此功能 |
| 技术架构 | Data2Vec2 编码器 + Adapter + Qwen3-8B,参考语音作为 Prompt,无需语音分离 | 通用音频编码 + LLM 端到端架构 |
| 使用方式 | model(target, ref) 一行调用,需要目标说话人的参考音频 | 标准 ASR 调用方式,无需参考音频 |
可以看到,两者并非简单的替代关系:Xiaomi-CocktailASR-1 胜在”指定谁就转写谁”,Qwen3-ASR 则胜在通用、无需参考音频。实际选型时,如果业务里存在固定的目标人物(如指定参会者、指定客服坐席),前者的准确率和拒识优势会非常明显。
Xiaomi-CocktailASR-1 的常见问题解答
- Xiaomi-CocktailASR-1 是免费的吗?是否需要申请?
- 模型以 Apache 2.0 协议开源,代码与权重托管在 GitHub 和 HuggingFace 上,可下载、修改与商用,无需申请授权。不过需要注意,本地部署需要自备 GPU 显存来承载 0.6B 音频编码器与 Qwen3-8B 骨干模型。
- 一定要提供参考语音吗?参考语音要多长?
- 需要。Xiaomi-CocktailASR-1 依赖参考语音作为声纹提示来锁定目标说话人,因此必须准备一段 16kHz 单声道的目标说话人音频。待识别音频如果不是 16kHz,模型会自动重采样,无需手动处理。
- 目标说话人没说话时会输出什么?
- 模型会输出空文本,而不是强行给出一段识别结果。这一负样本拒识能力由约 1 万小时错配参考数据训练而来,不需要额外设定阈值,实测拒识率在 68%–80% 之间。
Xiaomi-CocktailASR-1 官网网址
Xiaomi-CocktailASR-1 以开源项目的形式发布,目前没有的产品官网,代码、权重与论文均通过以下公开渠道获取:
- GitHub 仓库(项目主页):https://github.com/xiaomi-research/xiaomi-cocktailasr-1
- HuggingFace 模型库:https://huggingface.co/Ease3/Xiaomi-CocktailASR-1
- 技术论文:https://arxiv.org/pdf/2609.11274
OpenI AI时代点评
目标说话人识别一直是语音领域的”老大难”:传统方案必须先做语音分离,再把分离后的音轨送进 ASR,两个环节各自都会引入误差,叠加之后效果往往不理想。Xiaomi-CocktailASR-1 的价值在于把这个问题收敛成了一个端到端的 Prompt 问题——用参考语音当条件,让编码器自己去聚焦目标声源。从公开指标看,LibriMix 2mix WER 4.11%、AliMeeting Far 20.63% 确实是相当有说服力的数据,负样本拒识这一点更是工程落地中容易被忽视却非常关键的细节。
当然,Xiaomi-CocktailASR-1 也有明确的使用前提:你必须先拿到目标说话人的参考语音,且本地要有足够的算力跑 Qwen3-8B 级别的骨干模型。它更适合”知道要听谁”的定向场景,而不是”随便来一段音频都要转全”的通用转写。如果你的需求是后者,字幕精灵、通义听悟 这类通用语音转文字工具会是更轻量的选择。作为 Apache 2.0 开源项目,Xiaomi-CocktailASR-1 值得语音方向的开发者和研究者到 https://github.com/xiaomi-research/xiaomi-cocktailasr-1 亲自试跑一遍。


