位置:首页 > 产业资讯 > 德国黑森林实验室发布Flux3多模态模型原生音频生成20秒音视频同步输出

德国黑森林实验室发布Flux3多模态模型原生音频生成20秒音视频同步输出

时间:2026-07-25  |  作者:318050  |  阅读:0

德国AI初创公司黑森林实验室最近扔出了一颗重磅冲击波——正式发布多模态基础模型Flux3。这款模型基于Self-Flow架构打造,配备专用的图像、视频、音频以及动作编解码器,说白了,就是想让机器对物理世界和数字世界实现“理解+生成”的一体化。从架构设计上看,这已经不是单纯的视觉模型,而是朝着通用智能体方向迈出的一大步。

image.png

性能碾压Luma与Runway,对标顶尖模型

Flux3最令人印象深刻的是,它是首款原生支持音频生成的模型。什么意思呢?它可以一次性输出长达20秒的音视频同步片段,而且覆盖了文本/图像/视频转视频、基于关键帧的转场、多语言对话等一整套功能。在720p分辨率、10秒片段的早期测试中,Flux3的胜率惊人:以93%碾压Luma Ray3.2,以77%击败Runway Gen-4.5,哪怕面对Seedance2.0和Gemini Omni Flash这样的顶尖选手,也保持了微弱优势。可以说,多模态生成赛道上的格局正在被重新定义。

进军机器人领域,分阶段推出策略

除了纯数字内容生成,黑森林实验室还把触角伸向了实体世界。公司联合Mimic Robotics开发了一款面向机器人领域的视频动作模型——Flux-mimic,目前已经在奥迪工厂进行生产任务测试。这意味着AI能力从虚拟屏幕真正延伸到了制造车间,直接参与生产环节。而在推出节奏上,BFL采取了分阶段策略:Flux3 Video已经上线,Flux3 Image和开源权重版本“Flux3 Dev”会在近期陆续发布。对于开发者来说,开源的到来无疑是个好消息,值得持续关注。

来源:整理自互联网
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多