Xiaomi-Robotics-U0

Xiaomi-Robotics-U0 – 小米推出的统一具身合成模型

小米重磅发布 380 亿参数的统一具身合成模型 Xiaomi-Robotics-U0,该模型基于世界基础模型持续精进,全面优化了文生图、图像编辑、具身场景生成、具身迁移及具身视频生成五大核心能力。

Xiaomi-Robotics-U0 究竟是何方神圣?

Xiaomi-Robotics-U0 是小米倾力打造的一款拥有 380 亿参数的统一具身合成模型。它以世界基础模型为基石,通过持续训练,实现了文本到图像生成、图像精细化编辑、具身场景的创建、跨场景的具身迁移以及具身视频的合成等五项关键任务的协同优化。尤为值得一提的是,Xiaomi-Robotics-U0 是业界首个能够跨越多种机器人形态,生成高质量、多视角一致场景的模型。在具身场景生成与迁移的实际评估中,其表现已超越 GPT-Image-2.0;而在 World Arena 具身视频生成排行榜上,它更是荣登榜首。更令人瞩目的是,它将 π0.5 在真实世界操控任务中的分布外成功率,从原先的 36.9% 显著提升至 63.2%。

Xiaomi-Robotics-U0 的核心亮点功能

  • 文本驱动的图像创作:能够根据文字描述生成高品质的图像,并巧妙地保留了基础世界模型所蕴含的丰富视觉知识。
  • 灵活的图像编辑能力:支持“任意图像到图像”的编辑模式,用户可以实现诸如相机视角调整、时间序列控制、结构化信息提取等精细化的图像操控。
  • 智能具身场景构建:能够根据指定的机器人形态和场景设定,生成多视角高度一致的初始观察画面。
  • 无缝具身场景迁移:在确保多视角一致性和交互动态连续性的前提下,实现跨越不同场景的结构化、可控性迁移。
  • 动态具身视频生成:支持零样本(zero-shot)的多视角具身视频生成,能够将静态场景转化为具有时间连贯性的操作视频。

Xiaomi-Robotics-U0 的技术内核解析

  • 统一自回归架构:该模型基于 EMU3.5 进行初始化,采用 IBQ Tokenizer 实现 16×16 的空间压缩,将所有模态统一转化为离散的词汇表,并进行“下一个词元”的预测。
  • 协同持续训练策略:在通用数据集与具身数据集上,模型采用统一的自回归目标进行持续学习,有效规避了因仅依赖有限的机器人数据而可能导致的泛化能力下降。
  • FlashAR+ 推理加速技术:引入了具备反对角线并行解码能力的垂直预测头,并结合 vLLM 优化技术,在 1024×1024 分辨率下,图像生成速度实现了高达 82.9 倍的飞跃。
  • 结构化控制分解机制:将场景解构为工作空间、任务对象、非任务对象、光照和背景五个的控制维度,为具身视频的增强提供了可扩展的支持。
  • 子任务-子目标交错学习范式:通过 HDBSCAN 聚类技术对机器人轨迹进行子任务划分,生成交错的图像-文本序列,从而精准捕捉长程任务的进展以及细粒度的交互动态。

关注微信公众号,回复“开源”,即可加入AI开源项目交流群

如何驾驭 Xiaomi-Robotics-U0

  • 环境的准备工作:首先,访问小米机器人官方网站下载模型权重和推理代码,并确保配置好支持 CUDA 和 vLLM 的高性能 GPU 环境。
  • 模型的加载流程:基于 EMU3.5 架构初始化模型,并加载 Xiaomi-Robotics-U0 的 380 亿参数检查点。随后,利用 IBQ Tokenizer 处理多模态的输入序列。
  • 文生图的实践:输入您想要的文本描述,模型将直接生成 1024×1024 分辨率的高质量图像,整个过程遵循标准的自回归“下一个词元”预测。
  • 图像编辑的运用:提供一到三张参考图像,并配合文字指令,模型将运用其 Any-to-Image 的强大能力,执行诸如相机控制、时间序列调整或结构提取等精细化编辑任务。
  • 具身场景的生成:输入机器人形态的描述以及结构化的场景文本,模型将输出严格遵循多视角一致性和几何连贯性的初始观察画面。
  • 具身场景的迁移:提供当前的多个视角观察画面和目标场景的描述,模型将在保持交互动态的前提下,生成迁移后的多视角 RGB 图像。
  • 具身视频的生成:输入初始观察帧和具体的任务指令,模型将通过自回归的方式,生成 15 至 25 帧具有时间连贯性的机器人操作视频。
  • 加速推理体验:激活 FlashAR+ 垂直预测头与 vLLM 优化,即可在 1024×1024 分辨率下,体验高达 82.9 倍的图像生成速度提升。
  • 数据引擎的应用:将模型生成的具身场景或视频序列直接输入下游的机器人策略网络,能够显著提升真实世界操控任务的分布外泛化能力。

Xiaomi-Robotics-U0 的核心竞争力所在

  • 卓越的统一性:作为首个将基础图像/视频生成与具身生成整合于单一框架内的模型,它有效避免了因后续训练而导致的视觉知识遗忘。
  • 出色的多视角一致性:模型原生支持跨越多种机器人形态的高质量多视角场景生成,并严格遵循几何连贯性和相机标定约束。
  • 精细化的可控迁移:通过引入结构化控制机制,模型能够在保持交互动态的同时,对工作空间、背景、光照等维度进行细致入微的编辑。
  • 强大的数据引擎能力:生成的具身场景可以直接转化为时序连贯的操作视频,为下游策略学习提供了可扩展的合成轨迹。
  • 行业领先的性能表现:在具身场景生成与迁移方面,其表现超越了 GPT-Image-2.0;而在 World Arena 具身视频生成榜单上,更是位居第一。

Xiaomi-Robotics-U0 的项目链接

  • 项目官方网站:https://robotics.xiaomi.com/xiaomi-robotics-u0.html
  • HuggingFace 模型库:https://huggingface.co/collections/XiaomiRobotics/xiaomi-robotics-u0
  • arXiv 技术论文:https://arxiv.org/pdf/2607.11643

Xiaomi-Robotics-U0 与同类竞品的深度对比

维度Xiaomi-Robotics-U0π0.5
定位统一具身合成世界模型,专注于生成可控数据与场景端到端视觉-语言-动作策略模型,专注于直接控制机器人
参数规模380 亿参数自回归 Transformer采用 VLM 主干 + Action Expert 分层架构
核心能力多视角场景生成、具身迁移、视频生成、图像编辑端到端机器人控制、家庭泛化任务执行
架构基于 EMU3.5 初始化,统一 next-token 预测预训练离散动作 token,后训练流匹配生成连续动作
数据引擎可直接生成具身场景与视频,将 π0.5 分布外成功率从 36.9% 提升至 63.2%本身不具备数据生成能力,依赖真实世界采集
多视角一致性原生支持跨多种机器人形态的多视角场景生成与几何连贯迁移作为单视角策略模型,不直接处理多视角合成
视觉知识保留联合训练通用生成与具身任务,VLM 基准保持高分(ERQA 40.8、SEED 78.6)VLM 基准得分较低(ERQA 0.0、SEED 21.5),视觉理解受损

Xiaomi-Robotics-U0 的广泛应用场景

  • 机器人合成数据生成:为真实机器人训练提供海量、多样化的合成操作轨迹,有效解决真实数据收集成本高昂和场景受限的难题。
  • 跨形态场景的无缝迁移:能够将同一操作任务从一种机器人形态(如单臂机器人)平滑迁移至另一种形态(如双臂机器人),同时保持场景的一致性。
  • 仿真环境的快速构建:能够快速生成高质量的多视角机器人操作场景,极大地便利了仿真平台的训练和策略验证。
  • 操作策略的强化升级:利用生成的分布外数据,可以显著提升机器人策略的泛化能力,例如将 π0.5 的成功率提高了 26.3%。
  • 具身智能的前沿研究:作为世界基础模型,它为长程任务规划、子任务分解以及交互动态预测等基础研究提供了强大的支撑。
阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...