位置:首页 > 产业资讯 > MAGI-2-preview:Sand.ai开源多模态视频生成模型解析

MAGI-2-preview:Sand.ai开源多模态视频生成模型解析

时间:2026-08-11  |  作者:318050  |  阅读:0

MAGI-2-preview是什么

MAGI-2-preview 是 Sand.ai 放出的一个重量级开源项目。

它是全球首个千亿参数级别的MoE多模态视频生成模型,参数总量高达114B,但每次推理激活的仅6B参数。

它的核心架构延续了单流设计,把文本、视频、音频全部统一放进同一个Transformer里进行联合建模,实现了真正的原生多模态生成。

在AA视频生成榜单上,它目前排名第六。模型代码和预训练权重都已经开放,给视频生成领域的高效Scaling路径增添了一个很有分量的验证样本。

MAGI-2-preview – Sand.ai 开源的多模态视频生成模型

MAGI-2-preview的主要功能

  • 多模态视频生成:支持文本、图像、视频到视频的生成,并且原生融合了音频理解。这意味着输入和输出模态灵活,音频不再是后期合成的附属品。
  • MoE 稀疏激活:114B参数总量,激活仅6B,推理成本大幅降低。这是典型的“大容量、低开销”路线。
  • 单流统一架构:放弃了传统的cross-attention拼接方式,从第一层开始就对画面和声音共同建模。音画同步的细节捕捉能力理论上更强。
  • 高效 Scaling:针对视频生成场景,重构了MoE通信与训练稳定性,解决了超长序列下的跨卡通信瓶颈。这算是从工程层面对Scaling Law的验证。

MAGI-2-preview的技术原理

那么,这么大一个模型是怎么做到高效运行的呢?关键就在于几个核心设计。

核心设计一:MoE 混合专家架构

  • MoE 混合专家架构:模型容量达到114B,但每次前向传播只激活6B参数。容量和计算成本实现了解耦,是稀疏激活的典型优势。

核心设计二:单流 Transformer

  • 单流 Transformer:文本、视频、音频的token从输入层就进入同一个Transformer,通过自注意力机制直接交换跨模态信息。
  • 相比那种多塔拼接的架构,这种方式更能捕捉到音画同步的细节,比如嘴型、动作与声音的配合。

核心设计三:分布式通信优化

  • 分布式通信优化:视频生成涉及超长序列,对通信要求极高。MAGI-2-preview重构了专家并行中的token路由与通信策略,有效降低了跨GPU的数据传输开销。

核心设计四:训练稳定性方案

  • 训练稳定性方案:动态路由、专家负载均衡与多模态数据联合训练,这三重机制共同保障了训练的稳定性,避免了MoE模型常见的训练崩溃问题。
MAGI-2-preview – Sand.ai 开源的多模态视频生成模型

如何使用MAGI-2-preview

上手这个模型并不复杂,按照下面的步骤即可。

  • 环境准备:先克隆GitHub仓库 SandAI-org/MAGI-2-preview,然后按照README文档配置好依赖环境。
  • 下载权重:从GitHub Releases页面获取预训练权重文件。
  • 运行推理:修改配置文件与脚本参数,支持 t2v / i2v / v2v 三种模式,可以参考MAGI-1的 run.sh 格式来执行。
  • 硬件要求:具体配置需等待官方文档更新,但可以参考MAGI-1的经验:24B版本需要多卡H100,4.5B版本单卡24GB VRAM即可运行。

MAGI-2-preview的核心优势

放在当前的开源视频生成模型里,它有几个明显的加分项。

  • 开源可商用:模型采用Apache 2.0协议,预训练权重和推理代码完全开放,商业使用不受限制。这对企业用户来说是个好消息。
  • 千亿 MoE 首创:全球首个成功开源的千亿级MoE视频生成模型,验证了视频领域Scaling的新路径,为后续研究提供了坚实基线。
  • 低成本高容量:6B激活参数就能驱动114B容量的模型,推理成本远低于同等规模的传统稠密模型。这是MoE架构在高容量场景下的核心价值。
  • 原生多模态:单流架构让音视频在模型底层就深度融合,避免了后期对齐带来的延迟与质量损失。音画同步的体验会更好。

MAGI-2-preview的项目地址

  • 项目官网:https://sand.ai/blog/magi-2-preview
  • GitHub仓库:https://github.com/SandAI-org/MAGI-2-preview
  • HuggingFace模型库:https://huggingface.co/sand-ai/MAGI-2-preview

MAGI-2-preview的同类竞品对比

放到同类产品里看看,MAGI-2-preview和阿里通义实验室的Wan2.7-Video做个对比,差异一目了然。

对比维度MAGI-2-previewWan2.7-Video
开发团队Sand.ai阿里通义实验室
架构MoE + 单流自回归 Transformer3D DiT + MoE + 流匹配
总参数114B270B(14B 系列)
激活参数6B140B
生成范式自回归扩散(流匹配)
多模态原生音视频联合建模(单流统一)文本/图像/视频/音频全模态输入
视频时长未明确(延续 MAGI-1 流式能力)2-15 秒
分辨率未明确720P / 1080P
开源协议Apache 2.0(可商用)开源(权重开放)
核心能力高效 Scaling、原生多模态视频生成视频编辑、参考生视频、运镜控制、表情驱动
榜单表现AA 视频生成榜第六DesignArena V2V 榜首
编辑能力未明确一句话修改视频、风格迁移、局部替换

MAGI-2-preview的应用场景

这个模型的潜力并不局限于学术研究,实际落地场景也很丰富。

  • 长视频广告与短剧:MoE的大容量让复杂叙事成为可能,分钟级连贯剧情视频不再是遥不可及。
  • 多模态影视预演:原生音频理解能力让配音、音效与画面的同步生成和编辑变得更自然,预演阶段的效率会大幅提升。
  • AI 视频学术研究:开源千亿级视频MoE权重,为学术界提供了一个可复现的Scaling基线,研究门槛大大降低。
  • 企业私有化部署:基于Apache 2.0协议,金融、医疗等对数据安全要求高的行业,可以放心构建自己的私有视频生成能力。
  • 实时流媒体生成:稀疏激活降低推理成本,为低延迟的实时视频生成和直播场景提供了技术支撑。

来源:整理自互联网
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多