位置:首页 > 产业资讯 > 商汤开源SenseNova-Vision统一视觉大模型,单模型横扫四大核心任务

商汤开源SenseNova-Vision统一视觉大模型,单模型横扫四大核心任务

时间:2026-07-19  |  作者:318050  |  阅读:0

商汤科技最近放了个大招——正式发布并全面开源了“日日新SenseNova-Vision”理解生成统一视觉大模型。这次升级,直接瞄准了视觉能力在大模型体系中的核心地位。

过去行业里讲的“统一视觉”,说白了就是把检测、分割、深度预测这些专家模型打包在一起,本质上还是各干各的、割裂的。而SenseNova-Vision真正让视觉成为通用基础模型的原生能力,彻底融入了大模型体系。

image.png

在分割能力这块,它同时覆盖了多个方向:

  • 通用分割
  • 推理分割
  • 交互式分割

得益于强大的多模态理解能力,推理分割和对话式分割的表现尤其让人眼前一亮。更关键的是,仅凭一个模型就能高质量完成多视角点云重建和相机位姿估计,性能在通用视觉路线中已经处于领先位置。

全面超越Vision Banana,数据同步开源

横向对比来看,和语义导向模型比,SenseNova-Vision在检测、分割、深度这些细节要求极高的视觉任务上实现了全面领先。

再对比生成导向模型Vision Banana,优势就更明显了——在各项权威评测的绝大多数指标上,SenseNova-Vision都实现了超越和领跑。Vision Banana只能应对四大核心板块中的两类问题,而SenseNova-Vision却能同时覆盖结构化理解、稠密几何、全景分割、多视角3D等全任务,差距一目了然。

在开源方面,商汤不仅开放了模型本身,还同步开源了包含5000万条样本的视觉指令语料库SenseNova-Vision Corpus-50M。未来,商汤还将把SenseNova-Vision的核心技术全面融入日日新U系列大模型中。

来源:整理自互联网
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多