位置:首页 > 热点资讯 > 谷歌DeepMind正式发布GenCeption视觉模型

谷歌DeepMind正式发布GenCeption视觉模型

时间:2026-07-23  |  作者:318050  |  阅读:0

7月21日,The Decoder消息传来,谷歌DeepMind正式亮出了GenCeption模型。这波操作有意思的地方在于,它把预训练的视频生成模型拿来“反向重构”,硬生生改造成了一个多任务视觉理解系统。而它的底子,是阿里巴巴的通义万相Wan2.1。

谷歌DeepMind发布GenCeption视觉模型

说白了,这模型就干了一件事:碘伏计算机视觉领域里那个“单任务、单模型”的老规矩。你猜怎么着?GenCeption只需要一次前向推理,就能根据文本指令,同步完成深度估计、语义分割、3D人体姿态估计等五项关键视觉分析任务。更让人意外的是,它的训练数据量只有7500段合成视频,比主流的同类模型少了一大截,但在多项指标上,居然能跟DepthAnything这类专用的单任务模型掰手腕,甚至还有超越。

说到泛化能力,GenCeption的跨域迁移表现相当稳健。它不仅能处理真实场景下的多人视频,连训练中从没见过的动物、机器人等类别也能应对自如。部分输出结果的细节还原度,甚至比原始训练渲染质量还要高。当然,话说回来,当前版本在推理速度与多任务协同优化之间的平衡,还有提升空间。不过,能走到这一步,已经足够让人对这条技术路线抱有期待了。

来源:整理自互联网
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多