位置:首页 > 热点资讯 > 小米发布开箱即用机器人基座模型十万小时数据训练

小米发布开箱即用机器人基座模型十万小时数据训练

时间:2026-07-19  |  作者:318050  |  阅读:0

7月16日上午,小米技术团队正式放出了他们的具身基座模型——Xiaomi-Robotics-1。该模型基于10万小时真实世界操作数据进行预训练,再通过跨本体的后训练,最终实现“开箱即用”的效果。换句话说,你拿到这个模型,不需要从头调参,直接就能在真实环境里干活。

小米推出“开箱即用”机器人基座模型 Xiaomi-Robotics-1,基于 10 万小时数据训练

项目主页地址:https://robotics.xiaomi.com/xiaomi-robotics-1.html

预训练阶段:10万小时数据与自动标注

这10万小时的轨迹数据,通过一个叫Universal Manipulation Interface(UMI)的设备采集。覆盖家庭、商业空间、工业场景、办公室、户外……几乎能想到的环境都包含在内,且记录了大量物体交互和操作动作。

数据量这么大,怎么标注?团队开发了一套自动标注流程:

  • 将长轨迹切成固定长度的片段。

  • 用视觉语言模型描述每个片段里夹爪的状态变化、交互物体的状态变化。

这样一来,模型就能学会根据当前的视觉观察和语言条件,生成能推动场景状态变化的动作。整套标注流程大约两周就能搞定10万小时的数据,效率相当可观。

训练范式:预训练 + 后训练

预训练的目标很明确——让模型学会通用的动作生成能力。给定当前视觉画面和一段语言描述,模型要预测出一串动作,让场景从当前状态变成目标状态。这就像看菜谱做菜:看到现状(一堆食材),听懂指令(“把土豆切成块”),然后生成手的动作序列,直到完成。

后训练阶段要解决两个对齐问题:

  • 本体对齐:把预训练阶段从UMI数据上学到的动作生成能力,迁移到真实机器人本体上。说白了,电脑里模拟好了,得让真机器人也能做出来。

  • 指令对齐:把“根据状态变化描述生成动作”的能力,转化为“根据人类自然语言指令执行任务”的能力。用户说“把桌上的杯子拿过来”,模型就得知道这对应什么动作序列。

为此,团队构建了约10000小时跨本体后训练数据,其中包括:

  • 7200+小时移动操作机器人和双臂机器人数据

  • 1000+小时人工标注UMI数据

  • Bridge V2、RT-1、DROID等公开数据集

数据量够大,覆盖面也够广。

真实环境表现与任务适配

完成后训练后,Xiaomi-Robotics-1就能在真实环境中根据自然语言指令直接执行多种移动操作任务。如果碰上特别复杂、需要灵巧操作的任务,模型也能通过少量下游真实机器人数据快速微调,而不是从零开始学。这种“先训练通用基座,再用少量数据适配任务”的路线,对降低新任务的开发成本和训练成本很有帮助。

效果评测:多个基准测试领先

几个基准测试的数据很能说明问题:

  • RoboCasa365基准中,平均成功率达到57.4%;在Composite-Unseen任务划分上,模型的任务组合泛化能力很强。

  • RoboDojo仿真评测中,Xiaomi-Robotics-1以20.07的平均分数和13.93%的平均成功率登顶Leaderboard,大幅刷新了此前行业最优方法保持的纪录(13.07分/8.80%成功率)。

  • VLABench中,模型也取得了最优表现(SoTA),平均成功率59.1%,平均进度得分70.3%

  • RoboCasa基准中,平均成功率达到74.5%,超过了RLDX-1、Cosmos Policy、GR00T N1.6、Pi-0.5、Pi-0-FAST等方法。

来源:整理自互联网
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多