Nemotron-Labs-Diffusion – 英伟达开源的三模式语言模型
Nemotron-Labs-Diffusion:NVIDIA 性三模态语言模型,重塑 AI 推理新范式
NVIDIA 近期重磅发布了 Nemotron-Labs-Diffusion,一款颠覆性的三模态语言模型。这款模型巧妙地将自回归(AR)、扩散(Diffusion)以及自我推测(Self-Speculation)解码方式融于单一架构之中。通过创新的联合 AR-扩散目标训练,Nemotron-Labs-Diffusion 能够在不同并行场景下灵活切换模式,从而实现卓越的高吞吐量表现。
Nemotron-Labs-Diffusion 究竟是什么?
Nemotron-Labs-Diffusion 是 NVIDIA 推出的一项突破性技术,它在一个统一的框架内整合了三种不同的语言生成模式:自回归、扩散和自我推测解码。得益于联合 AR-扩散目标的精心训练,该模型能够根据不同的应用需求,在多种并发场景下无缝切换工作模式,最大限度地提高处理效率。该系列模型提供了 30 亿、80 亿和 140 亿参数的版本,涵盖基础模型、指令调优模型以及视觉语言模型。在性能表现上,Nemotron-Labs-Diffusion 在准确性和速度方面均超越了当前市面上领先的开源 AR 和扩散语言模型。
Nemotron-Labs-Diffusion 的核心能力概览
- 多模态解码的无缝切换:该模型支持 AR、扩散和自我推测这三种解码模式。通过调整其内部的注意力机制,模型能够在同一个架构内实现不同模式之间的平滑过渡。
- 分块并行扩散生成:Nemotron-Labs-Diffusion 采用了分块(block-wise)扩散公式,将输入序列分割成若干个块,并在每个块内部进行双向并行解码,从而在单次前向传播中生成多个 token。
- 草稿验证的自我推测机制:模型首先通过扩散并行生成一系列候选 token 草稿,然后利用同一模型内的 AR 机制进行验证。这一过程共享了 KV 缓存,并且无需额外的预测头,大大提升了效率。
- 强大的视觉语言理解能力:Nemotron-Labs-Diffusion 还提供了支持图像理解和图文推理的视觉语言模型变体,显著拓展了多模态应用的边界。
- 高效的推理部署优化:模型支持 FP8 低精度格式,并与 SGLang 框架协同工作,能够在 GB200 GPU 上实现极高的服务吞吐量。
Nemotron-Labs-Diffusion 的技术基石
- 联合 AR-扩散目标训练策略:该模型同时优化了自回归的下一个 token 预测损失和分块扩散的去噪损失,并采用加权组合(α=0.3)的方式来平衡两者。AR 目标为扩散过程提供了从左到右的语言先验,防止扩散训练将计算资源浪费在任意 token 排列上;而扩散目标则强化了模型的前瞻性规划能力。
- 两阶段训练方法:训练过程分为两个阶段。第一阶段仅使用 AR 目标进行预训练,以建立强大的左到右语言归纳偏置。随后进入第二阶段,开启联合训练,通过扩散梯度的补充,实现两种目标的和谐统一。
- 结构化的注意力模式:在训练过程中,模型采用双流输入。噪声流中的 token 能够在块内实现双向注意力,并且进行跨块的因果注意力,同时还会关注干净流中已生成的文本前缀。干净流则严格遵循因果掩码,确保 AR 目标与扩散目标能够在同一次前向-反向传播中联合计算。
- 全局损失平均处理:为了解决扩散目标中不同样本噪声 token 数量差异导致的梯度方差问题,模型采用了全局 token 级损失平均。这意味着批次中的所有 token 都被平等加权,从而避免了少数高权重噪声样本对批次梯度的不成比例影响。
- 优化采样与 LoRA 增强:扩散模式通过基于采样轨迹优化的采样器来提升并行度。而自我推测模式则可以通过附加 LoRA 草稿适配器来增强草稿的质量,从而提高草稿的接受率和实际设备上的效率。
如何驾驭 Nemotron-Labs-Diffusion
- 环境与依赖的准备:执行诸如
pip install "transformers>=5.0" torch peft等命令,确保 Python 和 GPU 环境已就绪。 - 模型权重的获取:从 HuggingFace 仓库下载
nvidia/Nemotron-Labs-Diffusion-8B等模型权重及相应的分词器。 - 模式的选择策略:根据当前的并行处理需求,选择 AR 模式(适用于高并发场景)、扩散模式(追求最大并行度)或自我推测模式(侧重低延迟)。
- 运行推理脚本:利用
chat_ar.py、chat_dlm.py或chat_linear_spec.py等官方提供的脚本,执行单轮或多轮对话推理。 - 推理服务的部署:基于 SGLang 框架启动推理服务,配置 Linear Self-Speculation 和 FP8 精度,以便将其集成到生产环境中。
Nemotron-Labs-Diffusion 的独特优势
- 统一的三模态架构:单一模型集成了 AR 的语言先验知识和扩散的并行规划能力,无需维护多套的模型和处理流程。
- 吞吐量的飞跃式提升:以 80 亿参数模型为例,其单次前向传播生成的 token 数是 Qwen3-8B 的六倍。在 GB200 GPU 上,SPEED-Bench 的吞吐量提升了四倍。
- 自我推测的优越性:相比于多 token 预测(MTP)方法,自我推测模式在草稿接受率和实际设备效率方面均表现更佳。
- 双目标的和谐共振:通过全局损失平均和两阶段训练策略,有效地平衡了两种目标的梯度,避免了模式间的容量竞争。
- 适应性场景切换:仅需切换注意力模式,即可完美适配云端的高并发需求和终端的低并发场景,无需进行架构上的大规模改造。
Nemotron-Labs-Diffusion 的应用前景展望
- 实时交互式对话助手:在低并发场景下,自我推测模式可以实现极低的延迟,提供流畅的 AI 对话体验,显著提升用户满意度。
- 高效云端推理服务:AR 模式能够高效处理高并发的批量请求,充分释放 GPU 的计算潜能,从而大幅降低云端部署成本。
- 复杂代码与数学推理:扩散模式的增强前瞻规划能力,非常适合需要多步逻辑推导的代码辅助编程和数学问题求解任务。
- 本地端侧推理部署:80 亿参数的模型已能在个人设备上运行,其灵活的三模态切换能力可以适应不同的计算负载,同时保障用户数据的隐私安全。
- 多模态视觉语言应用:其视觉语言模型变体支持对图像内容的深入理解和图文问答,可广泛应用于智能文档分析、多模态交互系统等领域。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...


