MAGI-2 Preview开源:视频生成为什么迎来千亿级MoE新路线?
2026年8月5日,视频生成行业迎来一次重要发布:Sand.ai正式发布并开源MAGI-2 Preview。这是全球首个千亿级开源MoE视频生成模型,总参数约114B,但单次前向计算只激活约6B参数。
更关键的是,MAGI-2 Preview的模型权重和代码同步上线,不需要申请、不需要排队。研究者、开发者和企业技术团队都可以直接下载、部署、微调。对于过去长期只能调用API、看不到权重、无法复现训练过程的视频生成社区来说,这意味着一个新的入口被打开了。
凭借约6B激活参数,MAGI-2 Preview进入Artificial Analysis视频生成榜单前六。它的意义不只是“又多了一个开源模型”,而是把视频生成的Scaling路线从单纯堆参数、堆算力,推向了另一种可能:像大语言模型一样,用MoE在扩大模型规模的同时控制推理成本。
为什么说过去两年视频生成热闹,但开源社区没有真正入场?
过去两年,视频生成一直是AI领域最受关注的方向之一。OpenAI Sora、Google Veo、Runway Gen、Pika、可灵、seedance等模型不断出现,视频生成能力从实验室走向生产流程,速度非常快。
但热闹背后,很多开发者和研究者始终没有真正拿到“入场券”。他们可以看到生成结果,却看不到模型权重;可以阅读技术报告,却无法复现训练过程;企业可以调用API生成视频,却很难把模型放到自己的数据和业务场景里继续微调、改造。
这和大语言模型领域形成了明显对比。LLM领域在LLaMA开源后被迅速激活,研究、微调、私有化部署、工具链都全面跟进。来源内容中提到,GLM5.2、Kimi K3、DeepSeek等开源模型已经成为学术研究和产业应用的重要基础设施。
视频生成领域此前的问题在于,最强能力大多被封装在API里,按token收费、按帧计费。开源社区很难拿到可用的大尺寸视频模型,也就很难复现训练、验证技术路线,更难基于自身数据继续发展。
MAGI-2 Preview开源真正改变了什么?
MAGI-2 Preview的出现,让这种不对称开始被打破。它不是只开放一个演示入口,也不是只公布一份技术说明,而是把模型权重和代码一起放出来。对开源社区来说,这意味着视频生成第一次真正进入前沿竞争区域。
来源内容提到,在MAGI-2 Preview之前,MiniMax H3已经位列AA榜单第三并开放权重。一天之后,MAGI-2 Preview以千亿级MoE的形态直接开源,进一步把开源视频模型推到了更高规模。
同样是开源,MAGI-2 Preview之所以值得关注,是因为视频生成模型进入百亿、千亿参数区间后,训练成本和推理成本都会急剧上升。如果只是按照稠密模型的思路继续堆参数,模型越大,单次调用越贵,落地也越困难。
MAGI-2 Preview选择的MoE路线,试图解决的正是这个矛盾:模型可以继续变大,但每次推理不必激活全部参数。
视频生成为什么需要新的Scaling路线?
过去几年,视频生成大模型遵循的是一种比较直接的Scaling逻辑:模型越大,能力越强。做法也很朴素,增加层数、加宽隐藏维度、堆更多参数。这和大语言模型早期稠密模型的发展思路相似。
但视频模型比文本模型面临更重的计算压力。一段视频会被拆成空间patch和连续帧,再叠加音频与文本,序列长度很容易达到数万甚至数十万token。在稠密模型里,每个token都要经过全部参数,计算量会随着序列长度和模型规模一起膨胀。
来源内容中有一个非常直接的判断:视频模型做一次前向计算,文本模型可以跑几十次。也就是说,稠密模型扩展成本在视频领域会被进一步放大。
这就是MoE路线的价值所在。MoE不让每个token都经过全部参数,而是在模型内部设置一个庞大的专家池。每个token只调用和当前任务相关的一小部分专家。这样一来,总参数规模决定模型的知识容量,激活参数决定单次推理成本。
MAGI-2 Preview的114B总参数和6B激活参数意味着什么?
MAGI-2 Preview总参数约114B,这让它拥有足够大的知识容器,可以学习更丰富的人物、动作、镜头语言、材质细节,以及语义、语音、环境声等多模态信息。
但它每次前向计算只激活约6B参数,这让实际推理计算被控制在一个相对可执行的范围内。换句话说,它不是用114B参数全部参与每次计算,而是把114B做成一个更大的“专家池”,每次按任务需要调用其中一部分。
这也是MAGI-2 Preview和传统稠密模型的重要差别:稠密模型更像所有参数一起工作,MoE模型则更像把不同能力拆给不同专家,让合适的专家处理合适的任务。
MAGI-2 Preview的Multi-Head MoE为什么不是简单堆专家?
MoE真正难的地方,不只是把参数做大,而是如何组织这些参数。核心问题是:谁来决定哪个专家处理什么任务?如何让数千个专家形成有效分工?
传统MoE通常是“一个token选一组专家”。这样做的问题是,每个专家可能同时要理解语义、动作、声音等多种特征,更像一种“通才型”分工。通才可以覆盖很多任务,但每种能力的精度可能被稀释。
MAGI-2 Preview采用了相反思路:把任务拆细。它将隐藏表示分成12个独立的头,每个头独立选择自己的专家。不同头可以分别关注人物、动作、声音、语义等不同任务,最后再把结果融合起来。
来源内容中给出了对比:DeepSeek-V4-Pro每层384个专家选6,Kimi K3为896选16,而MAGI-2 Preview每层形成3,072个专家单元。这种结构更像是把“通才”拆成“专才”,让模型内部出现更细的能力分工。
千亿级MoE视频模型的门槛在哪里?
MAGI-2 Preview不是简单增加参数和专家就能完成。千亿级MoE真正的门槛,在于系统工程能力。
在传统Expert Parallel模式下,系统会先为token选择Top-K专家,再把token发送到专家所在设备。问题是路由结果会随着输入动态变化:有的GPU可能突然收到大量token,有的GPU却任务不足。激活专家越多,设备之间需要传输的数据也越多。
到了视频这种超长序列规模,通信开销和负载波动很快会成为瓶颈。如果大部分时间都花在等待数据传输和任务调度上,那么再大的参数规模也很难转化成真正的能力优势。
第一,Head Parallel如何让通信更稳定?
Sand.ai做的第一件事是Head Parallel。它改变了通信顺序:在路由发生之前,就先按照head分配计算,把固定形状的表示分发到不同设备;数据抵达后,再在本地选择专家。
传统方式的通信量依赖路由结果,而Head Parallel的通信量由输入本身决定,不再随着激活专家数线性增长。这样一来,跨设备流量就变得更加稳定、可预测。
第二,MagiMoE kernel库解决了什么计算问题?
Ultra-fine-grained MoE会带来大量小矩阵计算和频繁显存读写。Sand.ai为此设计了MagiMoE kernel库。
MagiMoE把原本分散的路由、排序和计算步骤融合执行,减少中间结果和显存搬运,并针对Multi-Head MoE的计算形态优化前向与反向过程。它解决的是MoE在细粒度专家结构下的执行效率问题。
第三,MagiMuon优化器为什么重要?
千亿参数MoE训练时,参数类型并不完全一样。主体矩阵参数、专家参数、路由参数,对更新方式的需求都不同。
MagiMuon优化器是在Muon基础上做的扩展。它保留Muon处理主体矩阵参数的优势,同时引入AdamW处理更适合常规更新的参数,使训练在千亿规模下保持稳定。
MAGI-2 Preview的数据策略为什么不只是“过滤脏数据”?
系统跑通之后,Scaling只完成了一半,另一半在数据。
过去行业经常把“数据质量”理解成层层过滤:删掉画质较差、构图不够整齐、动作不够典型的数据,留下一个更干净的数据集。从训练稳定性的角度看,这确实可以降低噪声、提升收敛效率。
但来源内容指出,真实世界的多样性,往往恰恰藏在那些“不够标准”的数据里。比如复杂运动、特殊镜头、罕见主体、非常规声音、长尾组合。如果模型只在整齐数据上训练,它学到的世界就是一个被剪裁过的世界。
因此,MAGI-2 Preview的数据策略更强调数据规模、多样性与分布覆盖。它的重点不是单纯“删减”,而是“组织”:通过更准确、更细粒度的标注,让模型理解主体、动作、场景、时序,以及音频与文本之间的对应关系。
10秒1080P约0.5元,MoE成本优势意味着什么?
MAGI-2 Preview路线验证之后,最直接的变化落在成本上。
按照当前8卡H100月租金折算,来源内容提到,MAGI-2 Preview蒸馏后模型生成一段10秒1080P视频的推理成本约0.5元,每秒成本约为行业主流模型的十分之一。
0.5元和5元之间,看起来只是一个小数点的差别,但放到真实创作场景里,改变的是内容生产方式。
一条生成视频很少一次就完全符合预期。成本高的时候,创作者每生成一次都像在押注;成本足够低之后,创作者就可以反复测试提示词,调整动作、构图、风格,再从多个版本里挑出真正可用的镜头。
这意味着视频生成从昂贵的一次性生成,转向多版本生成、自动筛选、人工选择的迭代模式。内容工具、广告系统、游戏资产生成、虚拟人互动等需要持续调用模型的场景,也会因为成本降低而获得更实际的使用空间。
MoE路线区别于稠密模型的核心价值,正在于“用得起”。只有当成本降到用户可以随手用、反复试、持续跑的程度,视频生成技术才真正进入生产环节。
Sand.ai为什么连续选择非共识路线?
MAGI-2 Preview不是Sand.ai的第一个开源模型。回顾这家公司过去三年的技术路线,可以看到一个清晰的模式:它多次选择当时并非行业共识的路线,并把模型做到了可被外界检验的程度。
2024年,视频生成领域最主流的技术路线是扩散模型Diffusion。Sand.ai第一代视频生成模型Magi-1选择了自回归路线。来源内容认为,Magi-1最终跑通了,而自回归路线已经成为当下行业的主流选择。
2025年,行业主流做法是“多流拼接”,但Sand.ai提出了统一单流架构,并用GAGA-1证明统一架构在音画同步上的优势。
2026年,行业主流仍是稠密模型,Sand.ai再次选择非共识路线:MoE。在MAGI-2 Preview出现之前,这条路能不能在视频生成上走通,并没有确定答案。
三次选择,三次非共识,每一次都形成了可以被外界检验的模型。来源内容将其归结为技术判断力:在技术路线尚未收敛时,识别哪条路有长期价值。
MAGI-2 Preview之后,视频生成竞争会变成什么?
MAGI-2 Preview不是终点。它更像是把MoE路线从非共识推成了一个新的行业变量。
接下来,视频生成的竞争不再只是静态比较“谁家模型更强”,而会变成动态竞争:谁能用新路线做出更好的产品、更低的成本、更完整的工具链。
对于开源社区来说,MAGI-2 Preview的价值在于,它把千亿级、统一音视频、MoE视频生成模型以开放权重和代码的方式放进公共领域。对于产业来说,它的价值在于提供了一条新的成本路径:模型继续扩大,但推理成本不必同步失控。
结尾:我认为,MAGI-2 Preview真正重要的不是“千亿”两个字
我认为:一个时代的门槛,往往不在门上写着“禁止进入”,而是藏在看不见的成本里。过去视频生成看似热闹,模型一个接一个出现,样片一段接一段刷屏,可研究者没有权重,开发者不能复现,企业只能按次调用,这热闹便像隔着玻璃看灯火,亮是亮的,却未必照得到自己手里。
MAGI-2 Preview真正值得重视的地方,不只是114B总参数,也不只是约6B激活参数,而是它把一个长期封闭、昂贵、难以改造的视频生成能力,推向了更开放、更可验证、更可反复使用的方向。技术若只供人仰望,便容易成为展柜里的器物;技术若能被下载、部署、微调、试错,才可能变成生产里的工具。视频生成的下一步,也许不只是生成更漂亮的画面,而是让更多人真正用得起、改得动、跑得久。
#开源AI
© 版权声明
文章版权归作者所有,未经允许请勿转载。






