位置:首页 > 热点资讯 > FLUX 3多模态AI模型登场 支持单次生成20秒多样化视频

FLUX 3多模态AI模型登场 支持单次生成20秒多样化视频

时间:2026-07-28  |  作者:深海捕梦者  |  阅读:0

7月24日消息,Black Forest Labs昨天(7月23日)发了一篇博文,直接甩出重磅新品——Flux 3多模态基础模型,以Early Access的方式上线。

这个模型最大的看点在于:它用统一的架构,把图像、视频和音频三大模态的学习任务打包在一起干了。

FLUX 3 多模态 AI 模型登场:支持单次生成 20 秒多样化视频

训练框架:自监督流匹配扩展

训练这块儿,博文里说得很清楚:模型基于Self-Flow(自监督流匹配)学习框架做了扩展。

视频、图像、音频同步训练,等于是在FLUX.1和FLUX.2系列的基础上,把能力边界直接拉到了多模态生成与理解任务上。

核心功能一览

那么,FLUX 3能干什么?

  • 单次生成就能输出最长20秒的视频,而且自带原生音频——这可不是简单的画面配乐,是真正的视频与音频联合生成。
  • 支持的玩法包括:文生视频、图生视频、视频生视频、输入视频与音频续写、关键帧转视频、多语言对话,以及多镜头串联。

一句话总结:从静态到动态,从单模态到多模态,它都能一把抓。

性能评测:胜率过半

性能方面,官方放出了人工评测数据:在带声音的10秒、720p视频对比中,FLUX 3对阵Grok Imagine Video的胜率是69%,对阵Seedance 2.0和Gemini Omni Flash都是52%

虽然算不上碾压,但面对几个竞品都能保持胜率过半,说明这个统一架构的路线确实有料。

探索机器人行为预测

有意思的是,Black Forest Labs还在探索机器人方向。他们正与Mimic Robotics合作,把FLUX 3用作机器人行为预测模型。

这相当于把多模态生成能力迁移到物理世界,让模型不只“看”和“听”,还开始“预测行动”。

图像生成与编辑能力

图像能力也没落下,FLUX 3支持图像生成与编辑,覆盖多种风格、宽高比和分辨率。从官方描述来看,它更像是一个全能的视觉底座,而不是偏科生。

免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多