DeepMind发布GenCeption视频生成模型实现视觉突破
时间:2026-07-20 | 作者:318050 | 阅读:0从技术突破的角度来看,Google DeepMind 最近放出的 GenCeption 模型,确实值得行业多看一眼。它基于预训练的视频生成模型打造,直接上手解决深度估计、图像分割、3D姿态估计这些经典视觉任务,而且在多项基准测试中,成绩已经接近甚至超越了当前的主流水平。更大的亮点在于,它所需的数据量,远比传统模型要少。
现在的计算机视觉领域,基本还是“一个萝卜一个坑”的玩法——做分割得用 Segment Anything,做深度估计得上 Depth Anything,不同任务得搭不同的架构。DeepMind 的研究团队自然也在思考一个问题:大型文本到视频模型在训练过程中,其实已经学透了场景的空间结构、物体的运动规律,以及语言与视觉之间的关联。那它,有没有可能直接拿来当通用视觉基础模型用?
GenCeption 基于阿里巴巴开源视频模型 Wan2.1 开发,但架构做了大幅简化。现在,只需要一次前向传播,就能完成视觉任务的预测。具体来说,模型能根据文本提示,从同一段视频里直接生成深度图、表面法线、分割掩码和姿态估计结果。如果需要输出 3D 关键点这类非图像数据,它也能通过可训练模块搞定。
训练数据这块,GenCeption 主要用的是个合成数据集,一共 7500 个视频,由 800 个人体模型搭配 200 组动作序列,通过 Blender 渲染生成。结果呢?在深度估计、表面法线预测、3D 姿态识别和语言引导分割这些任务上的表现都很亮眼。更关键的是,它的训练数据量只有某些现有模型的七分之一到五百分之一——这效率差距,不是一星半点。
泛化能力也是个惊喜。虽然训练数据几乎全是单人合成的人体视频,但模型拿到真实世界的多人场景、动物,甚至是人形机器人这些它从未见过的类别时,照样能输出包含细节的视觉预测结果。这可不是简单“记住”训练数据能解释的。
当然,问题也有。研究团队自己也坦承,多个任务联合训练可能会影响某些复杂任务的性能;而且推理速度还有优化空间——目前大模型处理 81 帧视频大概需要 6 到 10 秒。这在实时性要求高的场景里,显然还不够快。
GenCeption 的发布,其实是一个信号:视频生成模型,正在从“负责生成内容”的工具,向“能理解视觉世界”的基础模型方向拓展。未来的挑战也很明确——如何让生成式模型获得更可靠的物理理解能力,以及真正与现实世界互动的反馈机制。这恐怕才是 AI 视觉研究接下来要啃的硬骨头。
来源:整理自互联网
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。
相关文章
更多-
- 清华95后助理教授陈勇超婉拒DeepMind创业押注自进化大模型
- 时间:2026-07-23
-
- 全球首位AI哲学家在谷歌DeepMind九年为AGI安全奔走
- 时间:2026-07-23
-
- 谷歌DeepMind正式发布GenCeption视觉模型
- 时间:2026-07-23
-
- Claude脑内小剧场曝光 隐藏工作空间自发涌现类人意识 获DeepMind认证
- 时间:2026-07-22
-
- 谷歌DeepMind发布GenCeption 突破专用模型限制 一个AI搞定五大视觉任务
- 时间:2026-07-22
-
- Deepmind:由科学家工程师伦理学家组成的团队
- 时间:2026-07-20
-
- 谷歌染指好莱坞
- 时间:2026-06-23
-
- 阿里千问团队动荡 多位成员接连离职 谷歌直接喊话挖人
- 时间:2026-03-05
精选合集
更多大家都在玩
热门话题
大家都在看
更多-
- iOS 13.5.1电池续航差是电池耗电问题吗
- 时间:2026-07-25
-
- 苹果教育优惠开启 附购买攻略
- 时间:2026-07-25
-
- 苹果iOS 14 beta 2 测试版主要更新内容:除细节变化外修复多项Bug
- 时间:2026-07-25
-
- iOS 14 beta 2 是否解决内存占用过多问题?
- 时间:2026-07-25
-
- 受欢迎的奥特曼游戏有哪些
- 时间:2026-07-25
-
- iOS 14信息应用5大更新变化
- 时间:2026-07-25
-
- iOS 14正式版上线时间公布 官方全新介绍
- 时间:2026-07-25
-
- 最新苹果iOS 14 Beta 2版本更新内容全解析与升级教程
- 时间:2026-07-25
