谷歌DeepMind发布GenCeption 突破专用模型限制 一个AI搞定五大视觉任务
时间:2026-07-22 | 作者:318050 | 阅读:0谷歌 DeepMind 团队最近放出了一个很有意思的新东西——GenCeption 模型。
简单来说,他们把传统的视频生成 AI 技术“反过来用”,做成了一个能深度理解现实世界的视觉分析引擎。
过去做深度估计、图像分割、3D 姿态估计这些任务,通常得各自搭一套模型,各干各的。
但 GenCeption 用一个模型就能同时搞定五项核心视觉任务,效率一下子拉高了不少。
基于通义万相框架,一次前向传播完成预测
这个模型基于阿里巴巴开源的通义万相 Wan2.1 框架训练。
它只需要一次前向传播就能完成预测,处理速度大幅提升。
你只要用简单的文本提示输入指令,模型就能直接输出深度图、分割掩码、相机运动轨迹这些丰富的信息,省去了很多中间步骤。
单人合成数据训练,泛化细节保留到发丝
有意思的是,GenCeption 的训练集其实非常“寒酸”——只用了约 7500 段由 Blender 渲染的单人合成视频数据。
但它的泛化能力却让人意外:
- 能顺畅处理真实世界中的多人视频
- 还能轻松迁移到动物和机器人这些类别上
从实际测试来看,小模型处理 81 帧视频只需要大约 6 秒,140 亿参数的大模型也只要 10 秒左右。
更夸张的是,它还原的细节甚至超过了训练用的合成原图,连猫的胡须和单根发丝边缘都能清晰保留下来。
这背后的逻辑值得琢磨——合成数据训练出来的模型,反而在真实场景中表现得更“细腻”,某种程度上打破了“合成数据不行”的固有印象。
来源:整理自互联网
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。
相关文章
更多-
- 清华95后助理教授陈勇超婉拒DeepMind创业押注自进化大模型
- 时间:2026-07-23
-
- 全球首位AI哲学家在谷歌DeepMind九年为AGI安全奔走
- 时间:2026-07-23
-
- 谷歌DeepMind正式发布GenCeption视觉模型
- 时间:2026-07-23
-
- Claude脑内小剧场曝光 隐藏工作空间自发涌现类人意识 获DeepMind认证
- 时间:2026-07-22
-
- DeepMind发布GenCeption视频生成模型实现视觉突破
- 时间:2026-07-20
-
- Deepmind:由科学家工程师伦理学家组成的团队
- 时间:2026-07-20
-
- 谷歌染指好莱坞
- 时间:2026-06-23
-
- 阿里千问团队动荡 多位成员接连离职 谷歌直接喊话挖人
- 时间:2026-03-05
精选合集
更多大家都在玩
热门话题
大家都在看
更多-
- iOS 13.5.1电池续航差是电池耗电问题吗
- 时间:2026-07-25
-
- 苹果教育优惠开启 附购买攻略
- 时间:2026-07-25
-
- 苹果iOS 14 beta 2 测试版主要更新内容:除细节变化外修复多项Bug
- 时间:2026-07-25
-
- iOS 14 beta 2 是否解决内存占用过多问题?
- 时间:2026-07-25
-
- 受欢迎的奥特曼游戏有哪些
- 时间:2026-07-25
-
- iOS 14信息应用5大更新变化
- 时间:2026-07-25
-
- iOS 14正式版上线时间公布 官方全新介绍
- 时间:2026-07-25
-
- 最新苹果iOS 14 Beta 2版本更新内容全解析与升级教程
- 时间:2026-07-25
