Sand.ai开源全球首个千亿MoE视频生成模型 114B参数6B激活
时间:2026-08-05 | 作者:318050 | 阅读:0说到底,再牛的大模型,也得放到行业面前公开亮个相,才算是真正交了答卷。
最近,一支清华系背景的团队又拿出了新动作。团队不大,但能量不小——他们率先用MoE架构把视频生成模型卷到了千亿参数级别。而且,代码和权重全!开!源!
模型一亮相,国内外科技圈就炸了锅。这么大、这么强的模型,说开源就开源,确实够狠。
模型效果惊艳:多场景直逼闭源第一梯队
先看看生成效果:
最近爆火的AI漫剧,声台形表四角俱全。
再来一场酣畅淋漓的长镜头,视角跟随人物动作切换自如。
商业场景也不在话下。
光是运镜、对焦和人物表现,拉到和闭源第一梯队同台PK,也照样能打。
MAGI-2-preview:千亿参数,成本仅5毛
不卖关子了,这就是Sand.ai的最新力作——MAGI-2-preview。继Magi-1横空出世后,新模型又一次瞄准了开源C位。
模型总参数114B,单次前向只激活约6B。按8卡H100当下的行情算,生成一段10秒1080P视频,成本仅需5毛钱,差不多只有行业主流模型的十分之一。
Benchmark排名也相当亮眼。MAGI-2-preview在AA视频生成榜单排名第六,仅用6B激活参数,效果就已经非常接近第一梯队。
这下,视频生成行业又多了一个千亿级的新变量。
视频模型Scaling不能照抄LLM
这一变,直击视频生成模型的Scaling路线。这个问题其实挺刚需的。做大模型,最怕的就是钱不够烧。
文本模型倒还好,处理的都是离散token,叠参数、加算力,模型就能越滚越强。但视频模型呢?面对的是一整个动态世界。
每一帧画面都要被拆成大量空间patch,连续帧还要记录人物动作、物体关系和镜头变化。如果再叠加文本、音频等信息,序列长度直接超级加倍……如果还用稠密模型,Scaling的训推成本简直不敢想。
模型要更大、视频要更长、成本还要可承受——这三件事,就是摆在视频生成面前的近乎「不可能三角」。
解法不是没有——MoE。所谓MoE,就是把模型的总容量和单次使用的计算量拆开。模型可以继续膨胀到百亿、千亿的总参数,但每次推理只激活其中一小部分,成本自然可控。
但视频MoE也有自己的麻烦,首当其冲的是通信。传统专家并行会先为token选出Top-K专家,再把token送到专家所在的GPU。激活的专家越多,需要运输的数据就越多。对于本就拥有超长序列的视频模型,这部分通信成本很快就会盖过专家计算本身。
更别提训练稳定性了。动态变化的路由、随时波动的专家负载,再加上需要处理的多模态数据,都会让大模型Scaling中常见的问题,在视频MoE上成倍放大。
所以,视频生成的Scaling路径,跟大语言模型不完全是一回事。
单纯迁移MoE不管用,还得扛得住超长序列和跨卡通信,同时保证音频、视频、文本在同一套系统里顺畅协作。说白了,得从底层开始一点点重构。
行业里很少有人能做到。要说把视频MoE从纸上谈兵搬到千亿参数视频模型上,Sand.ai是第一个。
让千亿MoE模型真正跑起来
要想跑通,架构和系统缺一不可。先打地基。MAGI-2-preview延续了Sand.ai在daVinci-MagiHuman中验证过的单流架构——文本、视频和音频进入同一个Transformer,然后在每一层自注意力里直接交换信息。
传统做法里,视频走视频的,音频走音频的,最后再靠cross-attention把两边粘起来。而MAGI-2-preview是从第一层开始,画面和声音就在共同建模,因此更适合处理细微的音画对应关系。效果就像这样:
这样设计还有额外的好处:统一主干让延迟和维护成本比模型串联低得多,也更天然适配MoE扩展。
有了框架,再把专家颗粒度推到极致。MAGI-2-preview采用Multi-Head LatentMoE的思路,将3072维的隐藏表示拆成12个256维head,再让每个head独立路由。同一个token被拆进多个低维子空间,有的head更关注人物外观,有的处理动作和时序,各司其职。
于是在36层主体网络里,每层总共3072个独立专家单元,每个token在每个head内选择6个专家,合计激活72个小专家。看起来同时调用的专家变多了,但每个专家处理的子空间尺寸更小,分工更细,模型能够拼凑出更多能力组合。
作为参照,DeepSeek-V4-Pro等主流MoE大模型的每层专家数大多还停留在几百个,MAGI-2-preview直接推到了三千级别。
这么细的专家,单靠通用MoE是实现不了的,还需要一套完整的自研infra。Sand.ai自己写了MagiMoE kernel库,把路由、排序、专家计算整条链路压在一起,减少中间结果的显存搬运。还针对Multi-Head MoE的计算形态,前向和反向过程都做了专门优化。
并行策略也重新设计了。Head Parallel在路由发生之前就按head把计算分配到不同设备,设备间传输的是形状固定的head表示,而不是路由后数量不断变化的专家token。通信量不随激活专家数波动,视频的长序列就不再是要命的瓶颈。
优化器同样做了混合设计。矩阵参数用Muon,专家参数用AdamW,不同性质的参数用不同的更新节奏。
最后一环是数据。很多团队做数据是层层过滤,最后留一个干净但窄的数据集。但生成模型需要的恰恰相反,要的就是多样性,见得越多,生成才能越逼真。MAGI-2-preview的思路是从「删减」转向「组织」。先扩大有效数据的规模,尽量保留广度,再通过更精准的标注把数据组织起来,让模型依次学会不同场景、动作、声音之间的对应关系。
预训练和后训练的分工也随之变化。预训练负责尽可能完整地覆盖数据分布,让基础模型吃全,后训练则回到自己更擅长的部分,处理偏好对齐、可控性、安全性和产品适配。
至此,MAGI-2-preview跑通了一整套Scaling系统。通过模型结构、通信机制、底层infra和数据体系协同设计,在扩大总容量的同时,把单次激活参数控制在可执行范围内。
当然,这里的6B激活参数并不等于一款6B稠密模型的实际成本,专家通信、路由、显存和部署方式仍会产生额外开销。但作为一款开源的千亿级视频模型,效果已然next level~
尤其是开源,其带来的变化,要比想象中大得多。
开源不只是「秀肌肉」
过去开源的视频模型大多都是百亿级,千亿参数直接改变的是整个行业的游戏规则。
对于研究者而言,这是第一次能够真正解剖千亿级视频MoE。专家如何分工、路由是否稳定、通信怎样组织、Scaling规律能否复现,这些问题终于有了公开研究对象。不必隔着论文空想,这对学术界和中小研究团队是实打实的基础设施升级。
对企业来说,开源意味着多了一个私有化部署和行业微调的选项。尤其是金融、医疗、工业等数据敏感行业,数据能否留在本地、模型能否针对业务继续训练,重要性并不亚于一次生成效果。
再把视线放大至整个行业,开闭源的竞争维度也将被重新定义。以前是单纯效果比拼,比谁的画质好、谁更便宜,往后模型能否继续训练以及接口是否被单一平台控制,都将成为对比指标。一旦开源模型在效果上持续逼近闭源,视频生成也大概率会走上语言模型的老路——闭源靠产品体验和服务稳定性,开源靠部署、控制和开发者生态。两条路线,终于开始在更多层面正面碰撞。
在这背后,是Sand.ai的非共识再一次得到验证。从自回归视频生成,到音画同出,再到千亿MoE开源,团队选择的道路总是人迹罕至。
这与团队背景不无关系。Sand.ai创始人曹越是清华大学特等奖学金获得者、Swin Transformer共同一作,曾联合创办光年之外,也曾在智源研究院负责多模态与视觉研究。团队其他成员也个个都是顶尖技术流出身,这样的技术基因,决定了团队更愿意把资源押在基础模型和底层infra,更关注模型的本质,而不是追着热点跑。
这一次则更为激进。Sand.ai首次将千亿参数、MoE和开放权重三件事捏在一起,再用一整套自研系统让它真正跑起来。所以,这不仅仅是场技术发布,也是一个团队对“视频模型应该怎么做”的立场表达。
诚然,MAGI-2-preview还不是视频生成的最终答案,还需等待正式版继续交卷。但它先把这件事给做实了——千亿级MoE,不只属于语言模型。
也欢迎行业内外借由开源验证。
开源地址:
https://github.com/SandAI-org/MAGI-2-preview
来源:整理自互联网
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。
相关文章
更多-
- 苏州GEO系统开源部署实战:制造企业30天快速落地指南
- 时间:2026-08-18
-
- JimuChatBI v1.0发布:开源对话式Chat2BI智能问数产品
- 时间:2026-08-18
-
- 阿里云秒悟Meoo CLI开源工具一键部署上线指南
- 时间:2026-08-18
-
- 小米MiMo Code开源后Bug频发,5人2周做出5.1k星项目引热议
- 时间:2026-08-18
-
- 智谱GLM-5.2全量开源推动前沿人工智能全民化
- 时间:2026-08-17
-
- 免费开源CLI工具推荐:适合API设计与开发使用
- 时间:2026-08-15
-
- 免费开源API Mock工具推荐:适用于CLI开发与测试
- 时间:2026-08-15
-
- 免费开源API测试CLI工具推荐与使用指南
- 时间:2026-08-15
精选合集
更多大家都在玩
热门话题
大家都在看
更多-
- 无锡GEO系统开源定制方案:制造业四大核心需求改造指南
- 时间:2026-08-18
-
- 苏州GEO系统开源部署实战:制造企业30天快速落地指南
- 时间:2026-08-18
-
- 美国部分学生用AI代修整门网课,智能体成逃课工具?
- 时间:2026-08-18
-
- 截至今年8月科技行业裁员12.6万人超去年全年
- 时间:2026-08-18
-
- IBM与Together AI合作部署NVIDIA AI基础设施方案
- 时间:2026-08-18
-
- MiniMax Agent周报自动生成工作流搭建教程
- 时间:2026-08-18
-
- MiniMax Agent多步骤任务表格数据处理实用教程
- 时间:2026-08-18
-
- 硅基流动报错401和429怎么解决?常见错误代码排查方法
- 时间:2026-08-18












