位置:首页 > 产业资讯 > 最新黑森林实验室FLUX 3多模态基础模型正式发布

最新黑森林实验室FLUX 3多模态基础模型正式发布

时间:2026-07-25  |  作者:半糖攻略君  |  阅读:0

FLUX 3 是什么

FLUX 3 来了,它这次带来的,不只是又一个视频生成模型。

Black Forest Labs 这次拿出的是一个真正意义上的多模态基础模型——在统一架构下,同时搞定图像、视频和音频。这背后靠的是 Self-Flow 技术,把生成和理解两件事对齐到同一个框架里,一次就能生成最长 20 秒 带原生音频的视频。

而且,它不只能文生视频,图生视频、视频生视频、关键帧转视频,各种玩法都支持。更关键的是,模型通过模态之间的物理约束去学习世界表征,这直接让它在机器人操控这类任务上,表现相当亮眼。

最新黑森林实验室FLUX 3多模态基础模型正式发布_wishdown.com

FLUX 3 的主要功能

具体来说,它的能力清单大致包括以下几块:

  • 多模态视频生成:单次生成最长 20 秒带原生音频的视频。支持文生视频、图生视频(动画延续或视觉参考)、视频生视频、关键帧转视频,甚至多语言对话。
  • 统一模态理解与生成:Self-Flow 架构把生成和理解对齐到底层框架。图像、视频、音频可以联合生成,输入可以是纯文本,也可以是参考图像或视频。
  • 智能片段串联:多个独立片段能智能拼接成更长的多镜头序列。风格上从手持实录到动画、电影级,都能覆盖。
  • 可扩展动作预测:架构里预留了 Action 编码器/解码器的扩展位,意味着它原生支持物理 AI 和机器人控制任务,后续很值得期待。

FLUX 3 的技术原理

技术层面,到底是怎么做到的?

  • Self-Flow 架构:在 Flow Matching 基础上引入自对齐机制,把多模态生成和理解统一到同一个框架里。结果是生成质量提升了,世界理解能力也跟着上去了。
  • 多模态 Transformer:文本、图像、视频、音频先分别经过独立编码器处理,然后汇入统一的 Transformer,模态之间信息交互融合,最后再由对应解码器输出。
  • 联合训练范式:同时加大计算和数据的投入,对视频、图像、音频进行联合训练。利用模态间的物理约束,去学习更准确的世界模型。
  • 模态互约束学习:声音需要匹配冲击力,运动需要遵守物理质量,未来的画面需要遵循过去的逻辑。通过多模态联合约束,模型构建起对物理世界的统一表征。

如何使用 FLUX 3

想上手试试?流程其实很简单:

  • 获取访问权限:直接访问 Black Forest Labs 官网(https://bfl.ai/)申请 Early Access 早期体验资格。
  • 选择使用方式:可以通过浏览器 Playground 直接体验,也可以走 API 或者第三方平台(Replicate、fal.ai、Together AI)集成调用。
  • 输入创作指令:在 Playground 或 API 里输入文本提示,或者上传参考图像/视频作为创作输入。
  • 配置生成参数:选择目标模态(图像/视频/音频)、设置风格、宽高比、输出时长等参数。
  • 获取生成结果:模型自动完成多模态生成,之后就可以下载或集成输出的图像、带音频的视频等内容了。

FLUX 3 的核心优势

相比同类产品,FLUX 3 的核心优势体现在几个关键点上:

  • 生成与理解双提升:Self-Flow 架构统一了生成和理解,机器人操控任务成功率达到了 47%,而且学习速度是传统 Flow Matching 的 2 倍。
  • 用户偏好领先:在 720p 带音频视频的盲测中,对 Runway Gen-4.5 的偏好率是 77%,对 Luma Ray 3.2 更是达到了 93%
  • 原生音频视频联合生成:单次就能生成长达 20 秒带原生音频的视频,不需要后期配音,声画同步效果自然。
  • 统一多模态架构:图像、视频、音频在统一框架下联合训练,模态间的物理约束让世界模型更准确。
  • 风格多样性:从手持实录到动画、电影级,风格覆盖广泛,还支持强排版生成和动态设计。
  • 可扩展至物理 AI:架构预留了 Action 编码器/解码器,原生支持机器人控制等物理世界交互任务。

FLUX 3 的项目地址

  • 项目官网:https://bfl.ai/blog/flux-3

FLUX 3 的同类竞品对比

拿它和 Seedance 2.0 做个简单对比,会更直观一些:

  • 模态覆盖:FLUX 3 覆盖了图像、视频、音频和动作预测,而且是统一架构;Seedance 2.0 支持文本、图像、视频、音频四模态输入。
  • 单次生成时长:FLUX 3 最长能到 20 秒带音频视频;Seedance 2.0 没有明确说明。
  • 用户偏好率:两者持平,都是 52%。
  • 架构:FLUX 3 用的 Self-Flow 统一生成与理解;Seedance 2.0 则是 Universal Reference 系统。
  • 动作预测:FLUX 3 原生支持,架构预留了位置;Seedance 2.0 没有提及。
  • 开源策略:FLUX 3 提供 Open Weights;Seedance 2.0 是闭源 API。

FLUX 3 的应用场景

最后,这么强的能力,能用在哪些地方?

  • 影视预演与广告创意:快速生成带音频的视频分镜和动态概念片,前期制作成本可以大幅降低。
  • 多模态内容创作:一键产出风格统一的图文音视频素材,社交媒体和营销传播场景直接用。
  • 虚拟角色与动画:基于参考图像,能保持角色一致性,跨场景生成连贯的动画视频。
  • 物理 AI 与机器人:利用动作预测能力,训练机器人操控策略,加速具身智能的研发。
  • 动态设计与排版:生成强文字排版和动画设计内容,品牌视觉和数字广告都能用上。

免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多