位置:首页 > 产业资讯 > 谷歌DeepMind发布GenCeption 突破专用模型限制 一个AI搞定五大视觉任务

谷歌DeepMind发布GenCeption 突破专用模型限制 一个AI搞定五大视觉任务

时间:2026-07-22  |  作者:318050  |  阅读:0

谷歌 DeepMind 团队最近放出了一个很有意思的新东西——GenCeption 模型

简单来说,他们把传统的视频生成 AI 技术“反过来用”,做成了一个能深度理解现实世界的视觉分析引擎

过去做深度估计、图像分割、3D 姿态估计这些任务,通常得各自搭一套模型,各干各的。

但 GenCeption 用一个模型就能同时搞定五项核心视觉任务,效率一下子拉高了不少。

image.png

基于通义万相框架,一次前向传播完成预测

这个模型基于阿里巴巴开源的通义万相 Wan2.1 框架训练。

它只需要一次前向传播就能完成预测,处理速度大幅提升。

你只要用简单的文本提示输入指令,模型就能直接输出深度图、分割掩码、相机运动轨迹这些丰富的信息,省去了很多中间步骤。

单人合成数据训练,泛化细节保留到发丝

有意思的是,GenCeption 的训练集其实非常“寒酸”——只用了约 7500 段由 Blender 渲染的单人合成视频数据。

但它的泛化能力却让人意外:

  • 能顺畅处理真实世界中的多人视频
  • 还能轻松迁移到动物和机器人这些类别上

从实际测试来看,小模型处理 81 帧视频只需要大约 6 秒,140 亿参数的大模型也只要 10 秒左右。

更夸张的是,它还原的细节甚至超过了训练用的合成原图,连猫的胡须和单根发丝边缘都能清晰保留下来。

这背后的逻辑值得琢磨——合成数据训练出来的模型,反而在真实场景中表现得更“细腻”,某种程度上打破了“合成数据不行”的固有印象。

来源:整理自互联网
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多