位置:首页 > 热点资讯 > 腾讯发布具身VLM基座模型Hy-Embodied-VLM-1.0,A3B性能接近A32B

腾讯发布具身VLM基座模型Hy-Embodied-VLM-1.0,A3B性能接近A32B

时间:2026-07-18  |  作者:318050  |  阅读:0

腾讯发布第二代具身 VLM 基座模型

7月17日,腾讯 Robotics X 实验室、福田实验室联合腾讯混元,正式推出了第二代具身 VLM 基座模型 Hy-Embodied-VLM-1.0

这一发布在行业内引起了不小的关注。毕竟,具身智能领域这两年竞争激烈,各团队都希望在模型能力上抢先一步。

核心亮点:参数规模缩小十倍,性能接近上一代旗舰

在一套覆盖37个评测任务的具身能力测试中,Hy-Embodied-VLM-1.0 表现突出:

  • 物理状态理解:68.6分
  • 动作—变化推理:64.1分
  • 时序与自适应推理:57.4分
  • 综合平均得分65.6分

关键信息是:它仅用了 A3B 规模,整体性能就已经接近上一代 A32B 旗舰模型。

同时,它显著优于同等规模的 Qwen3.6-A3B、Cosmos 3-8B、Embodied-R1 等通用与具身模型。

换句话说,参数规模缩小了十倍,能力却几乎没打折扣,效率提升非常亮眼。

腾讯发布具身 VLM 基座模型 Hy-Embodied-VLM-1.0,A3B 规模整体性能接近上一代 A32B 模型

模型能力的三层架构

模型从三个层次构建能力:

  • 物理空间状态理解:能识别物体属性、判断深度和空间关系,理解机器人视角下的功能部件、可操作区域,以及环境中的“可供性”——即哪些东西能用来做什么。
  • 动作-变化理解:结合人机交互的语义、目标对象和任务约束,可以完成下一步动作选择、目标定位和轨迹规划。
  • 时序和自适应推理:判断空间前置条件是否满足、动作是否可行,以及局部物理影响。

这意味着,它不仅能感知场景,还能分析行动、规划路线,甚至完成导航这类复杂的多模态任务。

面向长时程任务的全面能力

当面向长时程任务时,模型的能力更加全面。它具备以下能力:

  • 多步规划
  • 视觉语言导航
  • 历史与空间记忆
  • 失败诊断
  • 反事实分析
  • 动态重规划

它可以根据目标、执行进度和环境反馈持续修正决策,最终实现从场景理解、局部因果推理到长期自适应执行的完整闭环。

开源地址

附上开源地址,供感兴趣的读者进一步研究:

  • https://github.com/Tencent-Hunyuan/HY-Embodied

  • https://huggingface.co/tencent/Hy-Embodied-VLM-1.0

来源:整理自互联网
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多