通用机器人珠峰级考试:人类满分,AI仍在山脚
时间:2026-07-21 | 作者:318050 | 阅读:0具身智能时代,通用机器人策略离“登顶”还有多远?现有基准恐怕还回答不了这个问题。
问题出在哪儿?不少基准依赖的任务要么太简单、要么太短程,或者技能范围太窄。仿真评估效率高、容易扩展,但很难反映真实物理世界的部署能力。真实世界评估虽然更贴近实际部署,但成本高、耗时长,可复现性也是个难题。
针对这一困境,来自香港大学、加州大学伯克利分校、清华大学、北京大学等机构的研究团队,联合提出了一个面向仿真与真实世界的统一评估基准——RoboDojo。它覆盖了多样、长时程、高精度、依赖记忆以及开放式操作场景,可以说是为当前机器人策略做了一次“全面体检”。
论文链接:https://arxiv.org/abs/2607.04434
实验数据摆在眼前:现有通用机器人操作策略远谈不上可靠。即便是当前最先进的模型,在RoboDojo的复杂任务面前也表现挣扎。真实世界部署的成功率只有12.8%,而人类遥操作的表现几乎是满分。
基于这些结果,研究团队建立了公开排行榜,系统梳理了当前策略在仿真与真实世界中的局限,并指明了未来通用操作策略的关键方向。
图|RoboDojo 概览。
RoboDojo:统一的机器人评估基准
从整体架构来看,RoboDojo以五类核心操作能力定义了仿真基准。它通过仿真评估平台、真实世界评估平台和XPolicyLab共同完成从任务构建、策略训练、部署到评估的完整闭环。
图|RoboDojo 任务概览。
仿真基准覆盖了五类核心操作能力:泛化、记忆、长程执行、精细控制与开放指令理解。通过42个任务,系统性地诊断策略在不同操作能力上的短板。
- 泛化任务:测试策略对未见背景、光照、目标和杂物的适应能力。
- 记忆任务:考察历史信息的利用情况。
- 长程任务:评估策略完成多步骤操作序列的能力。
- 精细控制任务:聚焦窄孔插入等高精度接触操作。
- 开放任务:测试策略能否将已学技能迁移到未见语言指令和新目标。
从系统构成来看,RoboDojo由仿真评估平台、真实世界评估平台和XPolicyLab三部分构成,具体如下:
仿真平台:负责任务构建、资产生成、并行评估和数据采集。任务和场景通过配置文件定义,不同物体被构建为数字孪生资产。评估时,平台可并行运行多个场景以提升效率。采集数据时,简单任务可自动生成轨迹,复杂任务则通过VR遥操作获取高质量示范。
图|RoboDojo 中的技能多样性。
真实世界评估:强调可复现性。通过统一硬件、工作空间、光照、场景重置和评估协议,减少真实机器人实验中的偶然因素。RoboDojo-RealEval则借助触摸屏界面和布局叠加机制,规范任务重置与执行流程。
图|真实世界任务亮点。
XPolicyLab:统一策略开发、训练、评估与部署流程。通过标准化数据转换、训练模板、部署流程和observation-action接口,降低策略接入成本。
此外,RoboDojo还设立了仿真与真实世界双榜单:仿真榜单围绕五类能力反复评估,并以资深VR遥操作员为人类参考。真实世界榜单基于RoboDojo-RealEval,在3种机器人本体、18个任务上评估10个代表性策略,统一重置、部署与评分协议。
图|RoboDojo-RealEval 系统概览。
RoboDojo 的评测结果如何?
研究团队发现,现有通用机器人操作策略整体仍不可靠:即便是当前领先模型,也与人类专家存在显著差距。而且仿真中的优势未必能延续到真实部署中。不过,RoboDojo本身具备较好的评估效率和可复现性。具体结果如下:
1. 仿真结果
目前领先策略仍远低于人类水平:目前领先模型包括Hy-Embodied-0.5-VLA、Spatial Forcing、π0.5、X-VLA等。但最佳策略平均成功率仅8.80%、平均分13.07,远低于人类专家的76.03%和80.42分。这说明现有策略距离稳定完成任务,还有巨大的鸿沟。
图|RoboDojo 仿真基准排行榜。
不同模型能力发展不均衡:Spatial Forcing更擅长泛化,X-VLA在精细操作上领先,π0.5在开放任务上相对更强,Hy-Embodied-0.5-VLA则在长程执行、记忆和总体表现上最好。但这些优势多局限于单一维度,难以覆盖完整任务集。即使在表现较好的泛化和长程维度,最佳成功率也不足15%。精细控制、记忆和开放指令理解仍是短板。
泛化方面,场景随机化会显著削弱策略表现:Hy-Embodied-0.5-VLA在标准场景下领先,但随机化后下降92.9%。Spatial Forcing在随机场景下相对更稳,但绝对表现仍很低。当前策略对视觉和空间分布变化高度敏感,可靠泛化仍需更稳定的控制、闭环校正和失败恢复能力。
图|标准与随机化视觉设置下的策略性能。
长程执行方面:动作先验、具身预训练和空间grounding带来的提升仍然有限。Hy-Embodied-0.5-VLA、π0.5和Spatial Forcing成功率接近15%,说明模型能推进部分多步任务。但最佳成功率仍不足15%,且分数高于成功率。模型常能推进前期步骤,但难以稳定完成最终目标。技能组合、阶段决策和错误恢复能力仍不足。
精细控制方面:X-VLA表现最好,成功率12.00%、分数18.32,但仍远未达到可靠水平。Hy-Embodied-0.5-VLA虽总体最佳,却在该维度落后于X-VLA和Spatial Forcing,说明整体表现不能直接转化为局部精细控制。三维定位、平滑动作预测和闭环接触控制仍是短板。
记忆方面:当前策略仍难以有效利用历史信息完成后续操作。Hy-Embodied-0.5-VLA表现最好,具身预训练和动作先验有助于利用历史信息。但EventVLA的显式记忆设计和X-WAM的隐式时间记忆都未能带来稳定成功,表明记忆能力仍难以转化为可靠控制。
开放语义操作方面:当前策略仍难以应对开放指令和新目标。即使表现最好的π0.5,成功率也仅1.67%、分数1.98。强视觉-语言骨干虽能提升感知和语言理解,但尚不能稳定对齐开放指令、视觉affordance与可执行动作。语义目标到机器人行为的转化仍是关键短板。
2. 真实世界结果
真实世界部署方面,当前通用机器人操作策略仍不可靠:最佳策略π0.5在18个真实任务上的成功率仅12.8%、分数22.9,远低于人类遥操作的满分表现。分数普遍高于成功率,说明模型常能完成部分步骤,却难以完成完整任务。
图|RoboDojo 真实世界基准排行榜。
仿真性能与真实可部署性并不完全一致:π0.5在仿真和真实评估中均表现较强,但真实排名并不完全遵循仿真结果。InternVLA-A1、GalaxeaVLA在真实测试中优于预期,部分仿真领先模型在真实机器人上优势缩小。仿真更适合能力诊断,真实评估则用于检验策略对感知噪声、校准误差、执行延迟和接触不稳定等物理因素的适应性。
真实世界评估暴露了成功率之外的执行与安全风险:真实部署中会出现动作抖动、无效重复、接触不稳定甚至安全关键行为,DM0等模型还需要人工监控或干预。这说明真实评估不能只看任务是否完成,还要检验策略在物理机器人上的控制稳定性和失败恢复能力。
3. 评估效率与稳定性
RoboDojo具备较好的评估效率和稳定性:异构并行仿真提升了大规模测试吞吐量。真实世界评估中,π0.5完成180次试验仅耗时202分钟,平均每个任务10次试验约11.2分钟。这体现了标准化重置、统一接口和本地部署带来的效率提升。
图|每个任务的真实世界评估时间。
重复评估结果显示,仿真与真实世界的最大成功率标准差分别仅1.1和1.3个百分点,榜单结果较稳定、可复现。
图|多次重复运行中各任务真实世界评估的完整稳定性。
不足和未来发展
研究团队指出,尽管RoboDojo已覆盖仿真与真实世界评估,但当前机器人操作策略在泛化、长程执行、精细操作、记忆和开放任务理解上仍有明显短板。真实世界结果也表明,现有模型在复杂物理部署中仍不够稳定。
研究团队表示,他们将在未来持续更新RoboDojo的策略、任务和评估结果,并扩展到更广泛的场景、机器人本体和感知模态,包括灵巧手操作、类人全身操作、触觉操作和移动操作等方向。
图|RoboDojo 的未来扩展。
同时,他们也将为RoboDojo在不同方向引入多个机器人本体,提升基准的可访问性,增强跨硬件平台比较的公平性,最终发展为面向具身操作的通用评估平台。
更多技术细节,详见原论文。
来源:整理自互联网
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。
相关文章
更多-
- 月14日悉尼RSS'26线下社交晚宴报名中
- 时间:2026-07-25
-
- 量子位RSS'26专题策划招募启动
- 时间:2026-07-25
-
- 特斯拉市值蒸发2000亿美元 卖车利润投入AI与机器人
- 时间:2026-07-25
-
- 宇树发布全新UnifoLM-OminiA-0.3模型
- 时间:2026-07-25
-
- 宇树发布新款轮足机器人As2-W 6m/s高速疾驰
- 时间:2026-07-25
-
- 快马AI生成Ubuntu部署openclaw新手详细图文教程与排错指南
- 时间:2026-07-25
-
- OpenAI发布首款联名硬件Codex Micro 键盘 ?230 美元还会发光
- 时间:2026-07-24
-
- NAO机器人SDK全面常见问题解析与解决方案大全
- 时间:2026-07-24
精选合集
更多大家都在玩
热门话题
大家都在看
更多-
- iOS 13.5.1电池续航差是电池耗电问题吗
- 时间:2026-07-25
-
- 苹果教育优惠开启 附购买攻略
- 时间:2026-07-25
-
- 苹果iOS 14 beta 2 测试版主要更新内容:除细节变化外修复多项Bug
- 时间:2026-07-25
-
- iOS 14 beta 2 是否解决内存占用过多问题?
- 时间:2026-07-25
-
- 受欢迎的奥特曼游戏有哪些
- 时间:2026-07-25
-
- iOS 14信息应用5大更新变化
- 时间:2026-07-25
-
- iOS 14正式版上线时间公布 官方全新介绍
- 时间:2026-07-25
-
- 最新苹果iOS 14 Beta 2版本更新内容全解析与升级教程
- 时间:2026-07-25











