LingBot-VA 2.0,由蚂蚁灵波倾力打造,作为业界首个具身原生世界动作模型,以其革新性的自回归架构和从零开始的预训练,赋予机器人“边思考、边行动”的通用控制智慧。
LingBot-VA 2.0 揭秘
LingBot-VA 2.0 不仅仅是一个动作模型,它是蚂蚁灵波在具身智能领域的一项重大突破。这款模型基于先进的自回归架构,经过从零开始的深度预训练,成功解锁了机器人“边推演、边行动”的通用控制能力。其核心技术集成了因果DiT与稀疏MoE架构,在拥有庞大15.3B总参数的同时,推理时仅激活2.5B,效率惊人。在RoboTwin 2.0基准测试中,它取得了高达93.6%的双臂任务成功率,并且单GPU推理速度达到了150Hz,为机器人实时操作提供了强大的算力支撑。
LingBot-VA 2.0 的核心本领
- 视动协同,预判未来:该模型能够同步预测未来的世界状态和机器人即将执行的动作,实现如同“预知未来”般的精准控制。
- 长程规划,任务无忧:强大的高维Planner能够将复杂任务分解为一系列结构化的子任务,并支持双臂的并行执行与状态的持续记忆。
- 实时闭环,瞬息响应:Foresight Reasoning 异步推理机制,让机器人在执行当前动作的同时,已在为下一步做准备,有效消除了串行延迟。
- 跨域泛化,适应万象:无论是在整洁的环境还是在充满变化的随机化场景下,LingBot-VA 2.0 都能保持超过93%的任务成功率,展现了其卓越的适应性。
- 精细操控,化繁为简:对于薯片这类易碎的薄片物体,模型能够实现高精度、力控的抓取,展现出对精细操作的深刻理解。
LingBot-VA 2.0 的技术精髓
- 语义驱动的视动分词器:与传统模型不同,LingBot-VA 2.0 的分词器在压缩视觉信息时,对齐了语义与动作的关键信息。它通过逆向和正向动力学模型,从连续的视频帧中隐式地提取动作监督信号,使得无需标注的网络视频也能为模型训练提供宝贵的信号。
- 原生因果预训练范式:该模型摒弃了对双向视频生成模型的后期修改,从一开始就采用了自回归的因果架构进行训练。这确保了模型严格遵循时间顺序进行学习,天然契合了机器人闭环控制所依赖的单向物理现实。
- 高效的稀疏MoE架构:视频处理部分采用了Mixture-of-Experts(MoE)架构,虽然总参数高达约13B,但在推理阶段仅激活1.9B。结合一致性蒸馏和低精度编译等加速技术,成功将推理延迟从965ms大幅缩短至142ms/chunk。
- Foresight Reasoning 异步推理:该机制构建了一个预测-执行-纠偏的闭环。当机器人执行当前动作时,模型会并行预测下一步的状态。在接收到真实观测反馈后,模型会进行重新校准,有效避免了纯粹“脑补”导致的物理漂移,并将异步控制频率提升至225Hz。
如何驾驭 LingBot-VA 2.0
- 官方网站一览:请访问 https://technology.robbyant.com/lingbot-va-v2,深入了解模型的架构、观看演示视频并查阅详细的技术信息。
- GitHub 代码库获取:前往 GitHub 仓库,下载开源代码和技术报告,深入理解因果DiT、稀疏MoE及Foresight Reasoning 的实现细节。
- 环境部署指南:在具备强大GPU的服务器或工作站上,配置好推理环境,安装必要的依赖项,并加载模型权重。
- 硬件集成调试:将模型无缝集成到机器人本体,连接相机采集的视觉流以及机械臂/夹爪等执行器,确保传感器数据的实时输入。
- 启用异步管线:激活Foresight Reasoning 异步推理机制,使模型在执行当前段的同时,能够并行预测下一时刻的状态。
- 闭环校准优化:设置真实的观测反馈通道,确保模型在每次接收到新的观测数据时都能进行精确校正,从而防止物理漂移。
- 任务微调适配:若需执行全新的任务,只需采集少量机器人操作数据,即可基于预训练权重进行高效微调,快速适应新场景。
LingBot-VA 2.0 的独特优势
- 原生为具身而生:从模型的架构设计、训练数据到最终的训练目标,一切都为物理世界的交互量身定制,而非简单地微调数字视频生成模型。
- 实时高效,动态响应:单GPU 150Hz 的推理速度,完全满足实时闭环控制的严苛要求。
- 因果一致,精度保障:严格遵循单向时间建模,有效规避了双向注意力可能带来的动作精度损失和灾难性遗忘问题。
- 数据高效,训练提速:MCP多步预测目标显著提升了训练收敛速度,是传统方法的2.3倍,极大地降低了对机器人标注数据的依赖。
- 全栈协同,闭环完整:与LingBot-Depth、LingBot-VLA、LingBot-Video等组件协同工作,构建了从感知、预测到执行的完整闭环。
LingBot-VA 2.0 的项目入口
- 项目官网:https://technology.robbyant.com/lingbot-va-v2
- 技术论文深度解读:https://github.com/Robbyant/lingbot-va/blob/main/LingBot_VA2_paper.pdf
LingBot-VA 2.0 与竞品之比较
| 维度 | LingBot-VA 2.0 | ACE-Ego |
|---|---|---|
| 发布方 | 蚂蚁灵波 | 大晓机器人 × 港中文 MMLab |
| 模型定位 | 具身原生世界动作模型(VA) | “一脑多型”具身操作 VLA 模型 |
| 架构路线 | 自回归因果 DiT + 稀疏 MoE | Qwen3-VL-4B + Flow-Matching Diffusion Action Expert |
| 预训练方式 | 从零具身原生预训练,不依赖数字视频生成模型 | 混合人类第一视角视频 + 机器人/仿真数据联合预训练 |
| 核心机制 | Foresight Reasoning 异步推理、语义视觉-动作分词器 | 相机空间动作对齐、形态条件编码、时间对齐分块、可靠性感知损失 |
| 总参数 / 激活参数 | 15.3B / 2.5B(稀疏激活) | VLM 4B + Action Expert 约 600M(全激活) |
| 推理速度 | 单 GPU 150Hz(异步 225Hz) | 未公开具体频率,依赖 4 步 flow-matching 解码 |
| RoboTwin 2.0 平均成功率 | 93.6%(Clean 93.8% / Randomized 93.4%) | Easy 91.12% / Hard 90.62% |
LingBot-VA 2.0 的广泛应用场景
- 居家服务助手:能够胜任桌面整理、物品归位、餐具摆放等一系列长程家务任务,凭借其强大的长程记忆和双臂协调能力,轻松应对复杂的日常操作。
- 工业动态抓取:在生产流水线上,模型可以实时抓取移动中的物体,通过预测物体未来的轨迹并同步动作节奏,有效替代传统的基于光电触发的方案。
- 精密装配专家:在芯片、薄片、易碎零部件的装配过程中,模型能够实现柔性的力控抓取,利用精细的视觉伺服技术,确保物料的完整性。
- 人机交互新体验:在冰球对战、桌面游戏等需要实时预判对手动作的高频交互场景中,LingBot-VA 2.0 能够实现毫秒级的反应速度和策略调整,带来流畅的互动体验。
- 仓储物流管家:在动态变化的仓储环境中,模型能够高效地进行货物分拣、搬运和码垛,轻松应对不同尺寸和形状包裹的泛化抓取需求。


