位置:首页 > 新闻资讯 > 蚂蚁灵波开源全球首个具身视频基模,为机器人打造“物理世界模拟器”

蚂蚁灵波开源全球首个具身视频基模,为机器人打造“物理世界模拟器”

时间:2026-07-29  |  作者:火苗实验室  |  阅读:0

7月9日,蚂蚁灵波正式开源了LingBot-Video。这是全球首个基于Mixture-of-Experts(MoE)架构、面向具身智能的开源视频生成基础模型。简单来说,它不是又一个“画画好看”的视频生成器,而是围绕机器人和具身智能的核心需求,重新设计了视频预训练范式。推理效率、物理合理性、动作理解和任务完成度这几个关键维度,都得到了系统性的提升。这意味着,视频基础模型正在从数字内容创作向具身智能领域跨越,而LingBot-Video提供了那个关键的开源底座。

不妨先看看数据。在北大和字节跳动联合推出的RBench基准上,LingBot-Video的总分是0.620,直接超越了Wan2.6(0.607)、Seedance 1.5 Pro(0.584)和Cosmos3 Super(0.581)。RBench可不是一般的视频测评——它专门考察机器人操作视频的物理合理性,要看模型能不能生成真正符合真实物理规律的机器人行为。这个成绩说明,LingBot-Video在生成机器人相关视频时,动作过程的合理性和任务执行的完整性都更胜一筹。

蚂蚁灵波开源全球首个具身视频基模,为机器人打造

(图说:LingBot-Video 在 RBench 上性能最优)

为了进一步验证模型对物理世界变化的建模能力,蚂蚁灵波在内部benchmark中从通用质量和具身领域两个维度做了评估。对比NVIDIA Cosmos 3、Wan 2.2 A14B、LongCat-Video、Hunyuan Video 1.5、LTX-2.3这五个开源模型,LingBot-Video在具身相关场景中明显更强,物理理解和动作一致性都更突出。

蚂蚁灵波开源全球首个具身视频基模,为机器人打造

(图说:综合评测显示,LingBot-Video 在具身相关场景中展现出更强的物理理解和动作一致性)

过去几年,视频生成模型在画质、流畅度和创意表达上进步飞快。但对于具身智能来说,一个看起来逼真、动作流畅的视频,如果反映不出真实的物理规律,那就只是个好看的“花瓶”,根本没法用来支持机器人连续预测、规划和执行任务。更何况,具身智能还要求模型有更高的推理效率,才能适应实时交互和控制闭环。

这也让视频生成开始分岔出两条截然不同的路:一条通向影院,服务内容创作;另一条通向机器人,服务物理世界的理解、预测与交互。LingBot-Video正是蚂蚁灵波面向具身智能,在视频生成这条新路线上做的关键探索。

那么,它到底是怎么做到的?LingBot-Video从架构、数据和训练三方面进行了系统创新。

首先是架构。LingBot-Video采用了DiT + MoE的设计,用MoE替代传统的Dense架构。好处很直观:模型容量扩大了,但单次推理成本反而控制住了。它的总参数有30B,但生成时只激活大约3B参数——相比同等参数规模的Dense架构,推理效率提升了约3倍。这让模型既能拥有大规模参数带来的视觉表达能力,又能满足具身智能对高效推理的刚需。

第二是数据。LingBot-Video构建了一个数据画像引擎,在海量互联网视频的基础上,进一步引入了VLA、VLN、Ego等机器人相关数据,覆盖灵巧操作、机器人移动和第一视角交互等场景。总规模达到7万小时的具身数据。这些数据的作用是帮助模型学习动作与环境变化之间的关系,而不是只学视频的表面纹理和视觉风格——这个区别很关键。

蚂蚁灵波开源全球首个具身视频基模,为机器人打造

蚂蚁灵波开源全球首个具身视频基模,为机器人打造

蚂蚁灵波开源全球首个具身视频基模,为机器人打造

第三是训练。LingBot-Video引入了多维强化学习奖励系统。除了美学、prompt跟随和运动一致性这些常规指标,它还专门围绕物理合理性和任务完成度做了对齐。这样一来,生成的结果更符合真实世界规律,也更贴近机器人在真实世界完成任务的需求。

据官方介绍,LingBot-Video可以用在机器人动作预测、仿真数据生成、动作条件建模、世界模型研究等方向。而且,它已经正式开源了。对于整个具身智能社区来说,这无疑是一个值得关注的新底座。

免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多