Nemotron-Labs-TwoTower – 英伟达开源的双塔架构扩散语言模型
NVIDIA Nemotron-Labs-TwoTower,一款由英伟达倾力打造并开源的双塔架构扩散语言模型,正以其独特的创新理念和卓越的性能表现,在人工智能领域掀起新的浪潮。这款模型拥有约600亿的庞大总参数量,但其活跃参数仅为30亿,巧妙地实现了效率与能力的平衡。其核心亮点在于将复杂的上下文理解与精密的去噪生成任务,巧妙地解耦为两个相对的塔式结构。其中,被冻结的AR上下文塔专注于处理纯净的token信息,而可训练的扩散去噪塔则通过精妙的交叉注意力机制,对噪声块进行迭代式的精炼与重塑。
Nemotron-Labs-TwoTower的诞生,旨在突破传统扩散语言模型在单一网络中同时承担过多职责所带来的性能瓶颈。它基于Nemotron-3-Nano-30B-A3B模型进行构建,并在海量约2.1万亿token的数据集上进行了深度训练。令人瞩目的是,它在保留自回归基线98.7%的聚合基准质量的同时,实现了高达2.42倍的生成吞吐量提升,为文本生成带来了前所未有的速度与效率。此外,该模型还支持Mask Diffusion、Mock-AR以及AR-only三种灵活的推理模式,能够根据不同的应用场景需求进行适配。
Nemotron-Labs-TwoTower的核心功能亮点
- 双塔协同,职责分明:通过将上下文的编码与去噪的生成过程分离为两个的模块,有效规避了单一网络“身兼多职”所产生的性能制约。
- 多模态推理,灵活切换:单一模型检查点即可支持Mask Diffusion、Mock-AR和AR-only三种截然不同的推理模式,为用户提供了极大的灵活性,以满足多样化的应用场景。
- 卓越文本生成质量:在保持自回归基线98.7%的聚合基准质量前提下,实现了高度可并行的迭代式生成,确保了输出文本的高质量。
- 推理吞吐量显著提升:在双路H100 GPU环境下,生成吞吐量实现了2.42倍的飞跃,极大地缩短了推理延迟,并有效降低了计算成本。
- 商用级开源,赋能企业:采用NVIDIA Nemotron Open Model License进行开源,为企业级的商用部署和二次开发提供了坚实的法律保障。
Nemotron-Labs-TwoTower的技术原理剖析
Nemotron-Labs-TwoTower的核心创新在于其“角色解耦”的设计理念。传统的扩散语言模型往往将“上下文理解”与“迭代去噪”这两个关键任务强加于同一个网络,导致两者之间的相互牵制。TwoTower模型则将这两个职责明确地划分到双塔架构中:
- 上下文塔(Context Tower):作为冻结的 Nemotron-3-Nano-30B-A3B 组件,它利用因果注意力机制高效处理纯净的token,肩负起高质量上下文表示编码的重任。
- 去噪塔(Denoiser Tower):这是一个可训练的模块,采用双向块注意力处理带有噪声的token块。通过与上下文塔进行交叉注意力交互,它能够获取丰富的语义指导,从而逐步精炼噪声,实现高质量的去噪生成。
在训练方面,该模型基于30B的混合Mamba-Transformer MoE骨架,在约2.1万亿token的数据集上进行了训练。通过MoE(Mixture of Experts)的稀疏激活机制,实现了计算的高效性。在推理阶段,扩散模型的天然并行迭代特性被充分利用,而双塔分离的设计则使得去噪塔无需重复进行上下文编码,从而在保证生成质量的前提下,大幅提升了实际运行时的吞吐量。
微信关注回复“开源”,加入AI开源项目交流群
如何驾驭Nemotron-Labs-TwoTower
- 探访HuggingFace模型枢纽:请访问Nemotron-Labs-TwoTower-30B-A3B-Base-BF16的官方仓库页面。
- 细读模型说明与许可协议:务必仔细查阅NVIDIA Nemotron Open Model License的商用条款,并充分了解模型架构及硬件配置要求。
- 获取模型权重:您可以通过
git lfs命令或HuggingFace的transformers库来克隆或下载模型权重及相关配置文件。 - 搭建运行环境:建议准备至少双路H100 GPU,并安装PyTorch及所需的依赖库(可参考仓库中的
requirements.txt文件)。 - 加载模型与分词器:使用
AutoModelForCausalLM和AutoTokenizer类加载模型,并根据需求选择Mask Diffusion、Mock-AR或AR-only的推理模式。 - 执行高效推理生成:输入您的提示词(prompt),调用模型的生成接口,利用其创新的双塔架构,实现高效的并行去噪生成。
- 个性化微调适配:如果您需要针对特定数据进行优化,可以对可训练的去噪塔进行进一步微调,同时保持上下文塔的冻结状态。
Nemotron-Labs-TwoTower的独特优势
- 双塔解耦,各司其职:将上下文理解与去噪生成分离到两个的塔中,避免了单一网络在多重角色间产生的性能瓶颈。
- 质量损失微乎其微:模型在生成时能够保留自回归基线高达98.7%的聚合基准质量,意味着扩散生成不再是以牺牲输出质量为代价。
- 推理速度实现质的飞跃:在配备双路H100 GPU的环境下,实现了2.42倍的wall-clock生成吞吐量,显著降低了延迟并节约了计算资源。
- 一模型多模式,适用广泛:单一模型检查点支持Mask Diffusion、Mock-AR和AR-only三种推理方式,可灵活应对不同延迟与质量需求场景。
- 开源可商用,赋能创新:采用NVIDIA Nemotron Open Model License发布模型权重,为企业部署和商业化二次开发提供了便利。
Nemotron-Labs-TwoTower的项目链接
- HuggingFace模型库:https://huggingface.co/collections/nvidia/nemotron-labs-twotower
- arXiv技术论文:https://arxiv.org/pdf/2606.26493
Nemotron-Labs-TwoTower与同类竞品的比较分析
| 对比维度 | Nemotron-Labs-TwoTower | LLaDA |
|---|---|---|
| 发布机构 | NVIDIA | MIT |
| 架构设计 | 双塔分离:冻结AR上下文塔 + 可训练扩散去噪塔(通过交叉注意力连接) | 单塔统一:单一Transformer同时负责上下文编码与掩码去噪 |
| 总参数量 | 约60B(活跃参数3B,采用MoE稀疏激活) | 8B(稠密) |
| 基座模型 | Nemotron-3-Nano-30B-A3B(基于Mamba-Transformer MoE) | 自研Transformer架构 |
| 训练数据规模 | 约2.1万亿token | 约2万亿token |
| 基线质量保留率 | 98.7%(相对于自回归基线) | 约95%(相对于同等规模的AR模型) |
| 吞吐量提升幅度 | 2.42倍(在2路H100 GPU环境下,wall-clock时间) | 约1.5倍(在标准GPU环境下) |
| 推理模式选项 | 三种:Mask Diffusion / Mock-AR / AR-only | 单一:掩码扩散(支持随机或半自回归采样) |
| 注意力机制运用 | 上下文塔:因果注意力;去噪塔:双向块注意力结合交叉注意力 | 统一采用双向注意力机制,并结合位置编码进行处理 |
| 核心技术创新 | 角色功能解耦:有效避免了单一网络在承担多重任务时产生的性能瓶颈 | 简单且可扩展性强:证明了扩散模型可以扩展到8B参数量,并能逼近GPT-4的性能水平 |
Nemotron-Labs-TwoTower的应用场景拓展
- 高并发在线服务场景:其高达2.42倍的吞吐量提升,使其非常适合搜索引擎、智能客服等需要低延迟、高并发响应的实时文本生成应用。
- 长文档生成与优化:扩散模型的迭代式并行生成特性,非常适合长文本续写、报告撰写、代码补全等需要多步精炼的任务。
- 多模式部署的灵活性:三种不同的推理模式,使得企业可以根据成本效益和质量要求,在边缘端采用AR-only模式,在云端部署Mask Diffusion模式。
- 商业化产品开发加速:该模型拥有商用许可,能够支持企业将其集成到写作助手、营销文案生成器、代码辅助工具等各类商业化产品中,加速产品迭代。
- 科研探索与二次创新驱动:开源的模型权重和详细的论文信息,为研究人员提供了宝贵的资源,以探索扩散语言模型的架构创新、训练策略优化以及跨模态能力的扩展。


