蚂蚁灵波 LingBot 三连发:从视频到世界模型的具身开源全家桶
2026 年,具身智能赛道的竞争日趋白热化,但开源社区的进展始终慢半拍——直到蚂蚁集团旗下具身智能部门 Robbyant 打出了一套漂亮的"三连发"。从年初到年中,LingBot-Depth、LingBot-VLA、LingBot-World 三款模型接连开源,形成了一条从空间感知到决策控制再到世界仿真的完整技术链路。最新发布的 LingBot-World 2.0(Infinity 版本)更是将世界模型的生成时长推到了"小时级"——这在开源领域尚属首次。
三件套全景:感知 → 决策 → 仿真
Robbyant 的 LingBot 系列并非零散的单点突破,而是一套精心规划的具身智能技术栈。
LingBot-Depth 是三件套的"眼睛"。这是一款高精度空间感知模型,专注于单目深度估计任务。在机器人导航、物体抓取等场景中,精确的深度信息是后续决策的基础。LingBot-Depth 通过大规模多样化数据训练,在室内外复杂场景下均能输出高质量深度图,为机器人提供可靠的三维空间理解能力。
LingBot-VLA 是"大脑"。VLA 即视觉-语言-动作(Vision-Language-Action)模型,是当前具身智能最核心的技术范式。它将视觉感知、语言理解和动作规划统一到一个端到端的模型中,使机器人能够理解自然语言指令,并将其转化为具体的物理动作序列。LingBot-VLA 的出现填补了中文具身大模型的空白,为国内机器人企业提供了自主可控的基础模型选择。
LingBot-World 则是"沙盒"。这是一款以视频生成为核心驱动力的世界模型,能够根据输入的图像和交互信号,生成具有物理一致性的连续视频帧。2026 年 1 月首次开源后,团队在 7 月推出了重大升级——LingBot-World 2.0,代号 Infinity。
LingBot-World:从视频生成到世界模型
LingBot-World 的技术路线独树一帜。与传统的基于物理引擎的仿真器不同,它选择从视频生成的角度来构建世界模型。这一思路的直觉很简单:如果模型能"想象"出后续会发生什么,那它就能理解世界的运行规律。
模型基于 Wan2.2 架构构建,支持 480P 和 720P 两种分辨率。核心技术亮点包括:
高保真多样化环境:LingBot-World 在写实场景、科学场景、卡通风格等多种环境下均能保持高保真度和稳健的动态表现,而非局限于狭窄的训练域。
分钟级长时记忆与一致性:模型能够维持分钟级别的生成视界,同时在时间轴上保持上下文一致性——这被称为"长时记忆"。在早期视频生成模型中,超过几十帧后画面就会出现漂移和失真,LingBot-World 对此做了针对性优化。
实时交互能力:在生成 16 FPS 视频时,系统延迟低于 1 秒,这意味着用户可以实时通过键盘或控制信号与生成的虚拟世界进行交互——前进、后退、转弯,世界会即时给出视觉反馈。
完全开源:模型权重、代码、技术报告均以 Apache 2.0 协议开源,托管在 HuggingFace 和 ModelScope。团队还提供了三种模型变体——Base (Cam) 支持相机姿态控制、Base (Act) 支持动作信号控制、Fast 版本则通过 KV 缓存实现加速推理。
Infinity:进入"无限世界"时代
2026 年 7 月,Robbyant 团队开源了 LingBot-World 2.0,正式将项目推向 Infinity 阶段。这是所有开源世界模型中,唯一在通用领域实现小时级、近似无限生成时长的产品。
Infinity 的核心突破在于解决了世界模型长期运行的"漂移积累"问题。传统模型在生成数百帧后,画面会逐渐偏离初始场景,出现物体消失、场景变形等伪影。LingBot-World-Infinity 通过改进的因果推理框架和分块生成策略,实现了长时连续生成下的高动态、高视觉质量和语义交互的三位一体。
这相当于为具身智能研究者提供了一个"无限沙盒":机器人可以在其中进行长时间、不间断的训练和测试,而不受现实世界物理限制。对游戏开发者和内容创作者而言,这意味着一个可以实时探索的、永不重复的 AI 生成世界。
具身智能的开源拐点
蚂蚁灵波 LingBot 三连发的战略意义,远超三款模型本身。
首先,它证明了国内科技巨头在具身智能开源领域正在从跟随者转向引领者。此前,具身智能的开源标杆多由海外团队设立(如 Google 的 RT 系列、Meta 的 Habitat),LingBot 系列的完整性和工程化程度标志着中国团队在这一赛道的话语权正在快速提升。
其次,"感知-决策-仿真"三层全栈开源的格局极为罕见。大多数团队只在某一个环节开源,使得社区难以进行端到端的系统级研究。Robbyant 一次性打通了从视觉输入到动作输出再到环境仿真的完整链路,大幅降低了具身智能研究的进入门槛。
最后,LingBot-World-Infinity 的"小时级无限世界"能力可能成为具身智能训练的范式转折点。当仿真环境足够逼真且可持续运行任意时长,机器人可以在虚拟世界中积累远超现实可及的训练数据,从而加速从仿真到现实的知识迁移。
展望
LingBot 系列仍处于快速迭代期。当前模型的能力边界——如物理交互的精度、复杂操作的泛化性——仍有大量提升空间。但"三连发"的打法已经清晰地呈现了 Robbyant 的野心:不是做某个单一的酷炫 Demo,而是构建一套能让整个具身智能社区共同成长的底层基础设施。在这个意义上,LingBot 的开源全家桶,或许正是具身智能从实验室走向产业化的关键拼图。