位置:首页 > 产业资讯 > DeepMind发布GenCeption视频生成模型实现视觉突破

DeepMind发布GenCeption视频生成模型实现视觉突破

时间:2026-07-20  |  作者:318050  |  阅读:0

从技术突破的角度来看,Google DeepMind 最近放出的 GenCeption 模型,确实值得行业多看一眼。它基于预训练的视频生成模型打造,直接上手解决深度估计、图像分割、3D姿态估计这些经典视觉任务,而且在多项基准测试中,成绩已经接近甚至超越了当前的主流水平。更大的亮点在于,它所需的数据量,远比传统模型要少。

现在的计算机视觉领域,基本还是“一个萝卜一个坑”的玩法——做分割得用 Segment Anything,做深度估计得上 Depth Anything,不同任务得搭不同的架构。DeepMind 的研究团队自然也在思考一个问题:大型文本到视频模型在训练过程中,其实已经学透了场景的空间结构、物体的运动规律,以及语言与视觉之间的关联。那它,有没有可能直接拿来当通用视觉基础模型用?

QQ20260720-091824.jpg

GenCeption 基于阿里巴巴开源视频模型 Wan2.1 开发,但架构做了大幅简化。现在,只需要一次前向传播,就能完成视觉任务的预测。具体来说,模型能根据文本提示,从同一段视频里直接生成深度图、表面法线、分割掩码和姿态估计结果。如果需要输出 3D 关键点这类非图像数据,它也能通过可训练模块搞定。

训练数据这块,GenCeption 主要用的是个合成数据集,一共 7500 个视频,由 800 个人体模型搭配 200 组动作序列,通过 Blender 渲染生成。结果呢?在深度估计、表面法线预测、3D 姿态识别和语言引导分割这些任务上的表现都很亮眼。更关键的是,它的训练数据量只有某些现有模型的七分之一到五百分之一——这效率差距,不是一星半点。

泛化能力也是个惊喜。虽然训练数据几乎全是单人合成的人体视频,但模型拿到真实世界的多人场景、动物,甚至是人形机器人这些它从未见过的类别时,照样能输出包含细节的视觉预测结果。这可不是简单“记住”训练数据能解释的。

当然,问题也有。研究团队自己也坦承,多个任务联合训练可能会影响某些复杂任务的性能;而且推理速度还有优化空间——目前大模型处理 81 帧视频大概需要 6 到 10 秒。这在实时性要求高的场景里,显然还不够快。

GenCeption 的发布,其实是一个信号:视频生成模型,正在从“负责生成内容”的工具,向“能理解视觉世界”的基础模型方向拓展。未来的挑战也很明确——如何让生成式模型获得更可靠的物理理解能力,以及真正与现实世界互动的反馈机制。这恐怕才是 AI 视觉研究接下来要啃的硬骨头。

来源:整理自互联网
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多