Xiaomi-Robotics-U0 – 小米推出的统一具身合成模型
小米重磅发布 380 亿参数的统一具身合成模型 Xiaomi-Robotics-U0,该模型基于世界基础模型持续精进,全面优化了文生图、图像编辑、具身场景生成、具身迁移及具身视频生成五大核心能力。
Xiaomi-Robotics-U0 究竟是何方神圣?
Xiaomi-Robotics-U0 是小米倾力打造的一款拥有 380 亿参数的统一具身合成模型。它以世界基础模型为基石,通过持续训练,实现了文本到图像生成、图像精细化编辑、具身场景的创建、跨场景的具身迁移以及具身视频的合成等五项关键任务的协同优化。尤为值得一提的是,Xiaomi-Robotics-U0 是业界首个能够跨越多种机器人形态,生成高质量、多视角一致场景的模型。在具身场景生成与迁移的实际评估中,其表现已超越 GPT-Image-2.0;而在 World Arena 具身视频生成排行榜上,它更是荣登榜首。更令人瞩目的是,它将 π0.5 在真实世界操控任务中的分布外成功率,从原先的 36.9% 显著提升至 63.2%。
Xiaomi-Robotics-U0 的核心亮点功能
- 文本驱动的图像创作:能够根据文字描述生成高品质的图像,并巧妙地保留了基础世界模型所蕴含的丰富视觉知识。
- 灵活的图像编辑能力:支持“任意图像到图像”的编辑模式,用户可以实现诸如相机视角调整、时间序列控制、结构化信息提取等精细化的图像操控。
- 智能具身场景构建:能够根据指定的机器人形态和场景设定,生成多视角高度一致的初始观察画面。
- 无缝具身场景迁移:在确保多视角一致性和交互动态连续性的前提下,实现跨越不同场景的结构化、可控性迁移。
- 动态具身视频生成:支持零样本(zero-shot)的多视角具身视频生成,能够将静态场景转化为具有时间连贯性的操作视频。
Xiaomi-Robotics-U0 的技术内核解析
- 统一自回归架构:该模型基于 EMU3.5 进行初始化,采用 IBQ Tokenizer 实现 16×16 的空间压缩,将所有模态统一转化为离散的词汇表,并进行“下一个词元”的预测。
- 协同持续训练策略:在通用数据集与具身数据集上,模型采用统一的自回归目标进行持续学习,有效规避了因仅依赖有限的机器人数据而可能导致的泛化能力下降。
- FlashAR+ 推理加速技术:引入了具备反对角线并行解码能力的垂直预测头,并结合 vLLM 优化技术,在 1024×1024 分辨率下,图像生成速度实现了高达 82.9 倍的飞跃。
- 结构化控制分解机制:将场景解构为工作空间、任务对象、非任务对象、光照和背景五个的控制维度,为具身视频的增强提供了可扩展的支持。
- 子任务-子目标交错学习范式:通过 HDBSCAN 聚类技术对机器人轨迹进行子任务划分,生成交错的图像-文本序列,从而精准捕捉长程任务的进展以及细粒度的交互动态。
关注微信公众号,回复“开源”,即可加入AI开源项目交流群。
如何驾驭 Xiaomi-Robotics-U0
- 环境的准备工作:首先,访问小米机器人官方网站下载模型权重和推理代码,并确保配置好支持 CUDA 和 vLLM 的高性能 GPU 环境。
- 模型的加载流程:基于 EMU3.5 架构初始化模型,并加载 Xiaomi-Robotics-U0 的 380 亿参数检查点。随后,利用 IBQ Tokenizer 处理多模态的输入序列。
- 文生图的实践:输入您想要的文本描述,模型将直接生成 1024×1024 分辨率的高质量图像,整个过程遵循标准的自回归“下一个词元”预测。
- 图像编辑的运用:提供一到三张参考图像,并配合文字指令,模型将运用其 Any-to-Image 的强大能力,执行诸如相机控制、时间序列调整或结构提取等精细化编辑任务。
- 具身场景的生成:输入机器人形态的描述以及结构化的场景文本,模型将输出严格遵循多视角一致性和几何连贯性的初始观察画面。
- 具身场景的迁移:提供当前的多个视角观察画面和目标场景的描述,模型将在保持交互动态的前提下,生成迁移后的多视角 RGB 图像。
- 具身视频的生成:输入初始观察帧和具体的任务指令,模型将通过自回归的方式,生成 15 至 25 帧具有时间连贯性的机器人操作视频。
- 加速推理体验:激活 FlashAR+ 垂直预测头与 vLLM 优化,即可在 1024×1024 分辨率下,体验高达 82.9 倍的图像生成速度提升。
- 数据引擎的应用:将模型生成的具身场景或视频序列直接输入下游的机器人策略网络,能够显著提升真实世界操控任务的分布外泛化能力。
Xiaomi-Robotics-U0 的核心竞争力所在
- 卓越的统一性:作为首个将基础图像/视频生成与具身生成整合于单一框架内的模型,它有效避免了因后续训练而导致的视觉知识遗忘。
- 出色的多视角一致性:模型原生支持跨越多种机器人形态的高质量多视角场景生成,并严格遵循几何连贯性和相机标定约束。
- 精细化的可控迁移:通过引入结构化控制机制,模型能够在保持交互动态的同时,对工作空间、背景、光照等维度进行细致入微的编辑。
- 强大的数据引擎能力:生成的具身场景可以直接转化为时序连贯的操作视频,为下游策略学习提供了可扩展的合成轨迹。
- 行业领先的性能表现:在具身场景生成与迁移方面,其表现超越了 GPT-Image-2.0;而在 World Arena 具身视频生成榜单上,更是位居第一。
Xiaomi-Robotics-U0 的项目链接
- 项目官方网站:https://robotics.xiaomi.com/xiaomi-robotics-u0.html
- HuggingFace 模型库:https://huggingface.co/collections/XiaomiRobotics/xiaomi-robotics-u0
- arXiv 技术论文:https://arxiv.org/pdf/2607.11643
Xiaomi-Robotics-U0 与同类竞品的深度对比
| 维度 | Xiaomi-Robotics-U0 | π0.5 |
|---|---|---|
| 定位 | 统一具身合成世界模型,专注于生成可控数据与场景 | 端到端视觉-语言-动作策略模型,专注于直接控制机器人 |
| 参数规模 | 380 亿参数自回归 Transformer | 采用 VLM 主干 + Action Expert 分层架构 |
| 核心能力 | 多视角场景生成、具身迁移、视频生成、图像编辑 | 端到端机器人控制、家庭泛化任务执行 |
| 架构 | 基于 EMU3.5 初始化,统一 next-token 预测 | 预训练离散动作 token,后训练流匹配生成连续动作 |
| 数据引擎 | 可直接生成具身场景与视频,将 π0.5 分布外成功率从 36.9% 提升至 63.2% | 本身不具备数据生成能力,依赖真实世界采集 |
| 多视角一致性 | 原生支持跨多种机器人形态的多视角场景生成与几何连贯迁移 | 作为单视角策略模型,不直接处理多视角合成 |
| 视觉知识保留 | 联合训练通用生成与具身任务,VLM 基准保持高分(ERQA 40.8、SEED 78.6) | VLM 基准得分较低(ERQA 0.0、SEED 21.5),视觉理解受损 |
Xiaomi-Robotics-U0 的广泛应用场景
- 机器人合成数据生成:为真实机器人训练提供海量、多样化的合成操作轨迹,有效解决真实数据收集成本高昂和场景受限的难题。
- 跨形态场景的无缝迁移:能够将同一操作任务从一种机器人形态(如单臂机器人)平滑迁移至另一种形态(如双臂机器人),同时保持场景的一致性。
- 仿真环境的快速构建:能够快速生成高质量的多视角机器人操作场景,极大地便利了仿真平台的训练和策略验证。
- 操作策略的强化升级:利用生成的分布外数据,可以显著提升机器人策略的泛化能力,例如将 π0.5 的成功率提高了 26.3%。
- 具身智能的前沿研究:作为世界基础模型,它为长程任务规划、子任务分解以及交互动态预测等基础研究提供了强大的支撑。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...


