Cosmos 3 Edge – 英伟达开源的 4B 参数世界模型
NVIDIA 近期发布了 Cosmos 3 Edge,一款性的 40 亿参数开源世界模型,它专为机器人和边缘人工智能的实时推理而设计。这款模型基于先进的 Nemotron 架构,巧妙地融合了自回归与扩散两种 Transformer 结构,并通过共享的多模态注意力层实现了高效的信息整合。Cosmos 3 Edge 能够在 Jetson Thor、RTX GPU 以及 DGX 等多种硬件平台上实现本地化运行,并支持高达 15 赫兹的实时控制频率。这意味着开发者可以在大约一天的时间内,将该模型适配到特定的机器人或复杂的运行环境中,实现无需依赖云端即可进行的感知、推理及动作策略生成。
Cosmos 3 Edge 的核心能力
- 深入理解世界状态:通过自回归塔对视觉和文本信息进行处理,Cosmos 3 Edge 能够实时解析边缘环境中的物体、它们之间的空间关系以及场景的整体语义。这为后续的智能决策提供了坚实的世界表征基础。
- 精准预测未来状态:基于扩散塔,模型能够处理视觉、音频和动作信息,并通过去噪生成技术模拟执行特定动作后可能产生的视觉结果,从而预测未来的场景变化。
- 高效生成动作策略:Cosmos 3 Edge 将机械臂、车辆、摄像头等不同形态的具身智能体的动作,统一编码为简洁的几何向量,涵盖了平移、旋转和操作等状态。每次推理都能生成 32 个连续的动作指令,并以 15 赫兹的频率输出,实现流畅的实时控制。
- 边缘端实时推理能力:在内存受限的 Jetson Thor、RTX PRO、Jetson T2000/T3000 等设备上,Cosmos 3 Edge 实现了高吞吐量和内存效率的推理。这使得机器人能够在本地闭环运行,摆脱对云端计算的依赖。
- 快速适应特定领域:模型提供了完整的后训练脚本和 DROID 数据集策略检查点。开发者可以利用这些资源,在短短一天内将基础模型微调至适应特定机器人或运行环境。
Cosmos 3 Edge 的技术基石
- 双塔共享架构的精妙设计:该模型的核心在于其自回归塔和扩散塔组成的双塔结构。自回归塔运用因果注意力机制处理视觉和文本 token,专精于场景的理解与推理。而扩散塔则采用双向注意力,处理视觉、音频和动作 token,负责预测、生成和神经模拟。尽管两者各自拥有的 LayerNorm 和 MLP,但它们共享多模态注意力层,从而将语言、视频、音频和动作信息有效地对齐到一个统一的表征空间。
- 通用动作表征的创新:Cosmos 3 Edge 将不同物理系统的动作映射为紧凑的几何向量,统一编码了平移、旋转和操作状态。这种方法建立了像素变化与物理、空间关系以及控制输入之间的直接联系。
- 世界动作模型(WAM)的集成:作为策略使用时,模型能够接收当前的观测状态,并同时输出应执行的动作及其预期的视觉结果。这直接将世界建模与机器人策略训练紧密结合。动作在模型中可以双向流动,既能预测动作的效果,也能根据效果反推最优动作。
- 边缘优化的推理引擎:基于 Nemotron 架构的 4B 参数紧凑设计,结合四步知识蒸馏和 vLLM 优化框架,Cosmos 3 Edge 在保证输出质量的同时,实现了高达 25 倍的推理加速。这使其能够完美适配 Jetson 系列等边缘计算平台的算力和内存限制。
关注微信公众号,回复“开源”,即可加入AI开源项目交流群。
如何上手使用 Cosmos 3 Edge
- 环境搭建:首先,安装 NVIDIA Container Toolkit 并拉取官方 Docker 镜像,或者配置 Conda 环境,安装 PyTorch、Diffusers、Transformers 等必要的库。
- 模型下载:前往 Hugging Face 下载
nvidia/Cosmos3-Edge模型权重。同时,别忘了获取后训练脚本和 DROID 数据集策略检查点。 - 后训练微调:利用小型 H100 集群或 DGX Station,基于开源的 Cosmos Framework,对特定机器人、传感器或环境进行大约一天的适配性微调。
- 部署与推理:将微调后的模型部署到 Jetson T2000/T3000、RTX PRO 或 DGX 等边缘设备。通过 vLLM 或 NIM 微服务,即可实现 15 赫兹的实时动作生成。
Cosmos 3 Edge 的突出优势
- 端侧实时推理的卓越表现:凭借 40 亿参数的轻量化设计,Cosmos 3 Edge 在 Jetson Thor 上实现了 15 赫兹的实时控制,有效消除了云端延迟。
- 快速适应能力的显著提升:开发者可在约一天内将基础模型微调至特定机器人或环境,极大缩短了部署周期。
- 统一多模态架构的强大整合力:自回归塔与扩散塔共享注意力层,实现了语言、视频、音频和动作的统一处理,构建了“理解→模拟→行动”的完整闭环。
- 开放生态系统的全面支持:模型权重、训练脚本、后训练方案以及四步知识蒸馏检查点全部开源,并支持 Hugging Face Diffusers 和 vLLM 部署。
- 基准测试中的领先地位:在同等参数规模(4B)的模型中,Cosmos 3 Edge 在 VANTAGE-Bench 视觉分析任务中排名第一,机器人策略学习能力也达到了业界领先水平。
Cosmos 3 Edge 的项目对比
- 官方项目页面:https://huggingface.co/blog/nvidia/cosmos3edge
- HuggingFace 模型库:https://huggingface.co/nvidia/Cosmos3-Edge
Cosmos 3 Edge 与同类竞品的比较
| 评估维度 | Cosmos 3 Edge | SmolVLA |
|---|---|---|
| 发布机构 | NVIDIA | HuggingFace / 社区 |
| 参数规模 | 40 亿 | 4.5 亿 |
| 架构类型 | 世界动作模型(WAM)双塔架构 | 视觉-语言-动作(VLA)模型 |
| 核心机制 | 自回归塔与扩散塔共享注意力,实现世界理解与动作生成的统一 | 双 SigLIP+DinoV2 视觉编码器,分块预测动作 |
| 开源程度 | 权重、训练脚本、后训练方案全面开源 | 权重、代码、评估脚本全面开源 |
| 边缘部署能力 | Jetson Thor / RTX PRO / T2000 / T3000,支持 15 赫兹实时控制 | 单张 RTX 4090,可实现 15–30 赫兹推理 |
| 微调成本 | 使用小型 H100 集群或 DGX Station,约一天完成 | 单张 A100 或消费级 GPU,数小时内完成 |
| 动作输出方式 | 每次推理生成 32 个连续动作,采用通用几何向量表征 | 每次预测 50 个动作块,减少 50 倍计算调用 |
| 世界建模能力 | 内置世界模型,可预测动作带来的视觉结果 | 无内置世界模型,直接从观测映射至动作 |
| 适用场景 | 需要因果推理和模拟的复杂操作,以及动态变化的环境 | 结构化环境下的快速响应式抓取与放置任务 |
Cosmos 3 Edge 的广泛应用领域
- 工业自动化中的机械臂控制:在工厂生产线上,实现对工件位置的实时感知,并生成精准的抓取与装配动作,完全摆脱云端通信的束缚。
- 仓储物流机器人的自主导航:在仓库内部实现自主导航,实时避开障碍物,并规划最高效的拣货路径,支持每秒 15 次的动态决策。
- 自动驾驶的边缘感知系统:在车载 Jetson 平台上,实现对路况的实时推理,预测其他车辆的轨迹,并生成自车控制策略。
- 医疗辅助机器人的智能操作:在医院环境中,理解场景的动态变化,实时调整机械臂动作,为手术或护理提供智能辅助。
- 农业自动化的智能化升级:在田间地头的边缘设备上,实时识别作物状态,并生成相应的采摘或喷洒动作,轻松应对户络不稳定的环境。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...


