位置:首页 > 热点资讯 > 小红书与北大开源UltraEP:大规模MoE训练推理最优负载均衡

小红书与北大开源UltraEP:大规模MoE训练推理最优负载均衡

时间:2026-07-21  |  作者:318050  |  阅读:0

当新一代混合专家模型的总参数量正式跨过万亿门槛,专家并行已经成了训练和推理的标配方案。但一个容易被忽略的现实是:即便模型在预训练阶段已部署了负载均衡算法,在真实的训推场景中,不同GPU之间的计算负载仍可能相差数倍。

这意味着:

  • 有些GPU早早算完却只能空等;
  • token all-to-all 通信成为瓶颈;
  • 高负载GPU的峰值显存猛增,容易触发OOM;
  • 理想吞吐与实际吞吐的差距甚至能达到一倍之多。

小红书与北大开源UltraEP:大规模MoE训练推理最优负载均衡_wishdown.com

针对这个问题,小红书和北大联合提出了 UltraEP。它首次将基于精确路由信息的实时负载均衡引入生产系统——在每个microbatch和每一层动态复制热点专家,让真实训推也能逼近理想性能。UltraEP平均达到理想性能的 94.3%,相比业界SOTA训推框架提升 1.49倍,并已应用在大规模预训练的实际生产中。

小红书与北大开源UltraEP:大规模MoE训练推理最优负载均衡_wishdown.com

论文:
https://arxiv.org/abs/2606.04101

技术报告:
https://dots-infra.github.io/UltraEP/zh/

代码:
https://github.com/Dots-Infra/UltraEP

专家负载不均:影响吞吐的关键变量

随着MoE模型参数量的持续膨胀,大规模专家并行在生产中越来越常见。专家分散在不同设备上,token通过all-to-all通信在专家间交换。

小红书与北大开源UltraEP:大规模MoE训练推理最优负载均衡_wishdown.com

专家负载不均是影响实际训推吞吐的关键变量。由于路由是动态的,不同专家、不同设备接收到的token数量天然就不均衡。现有方案中,最有代表性的是DeepSeek的EPLB(2025)。它根据上一个时间窗口的历史路由,周期性地重新摆放专家。这类预测性方法隐含一个前提——负载必须相对静态。

小红书与北大开源UltraEP:大规模MoE训练推理最优负载均衡_wishdown.com

但现实恰恰相反。当下主流的细粒度MoE(几百个小专家)负载高度动态,历史信息很快过时。冷热专家的预测频频失准,均衡操作甚至可能变成负优化。

UltraEP 为什么能做到「最优」负载均衡

UltraEP选择了一条看似激进但最直接的路——基于门控后的真实负载,在每个microbatch的每一层实时进行专家重均衡。

小红书与北大开源UltraEP:大规模MoE训练推理最优负载均衡_wishdown.com

这消除了预测偏差,但代价也很明显:预测式方法可以提前把开销掩盖或平摊掉,而UltraEP的开销全暴露在关键路径上,还是在microbatch这个最细粒度上高频发生。基于一个通信前提和一系列控制面-数据面优化,UltraEP能把关键路径开销压到 300s以内,并达到近乎最优的均衡效果。

首先,UltraEP限定热点专家复制在高带宽scale-up域内进行,避免跨机专家搬运。这是实现百微秒量级专家复制的通信前提。更关键的是,UltraEP设计了一个高效的均衡方案在线求解算法,以及一套高度优化的专家权重/梯度通信算子,将均衡操作本身的开销降到最低。

关键设计:让最优负载均衡走进生产

UltraEP的定位是生产级专家均衡库,其设计原则包括:

  • 独立的Python/CUDA运行时,与DeepEP或训推框架解耦。
  • GPU-native的计算/通信过程,和host没有数据交互。
  • 保持数学等价性,以及与其他常用训推配置的兼容性。
  • 高效的显存管理,将额外显存开销压到最低。

在这些原则的基础上,UltraEP的关键设计归纳如下:

小红书与北大开源UltraEP:大规模MoE训练推理最优负载均衡_wishdown.com

UltraEP给每个rank预留固定slot放“冗余专家”(热点专家的副本),运行时无动态显存分配。副本不需要维护优化器状态,梯度会在反向中实时归约回原专家。

小红书与北大开源UltraEP:大规模MoE训练推理最优负载均衡_wishdown.com

更关键的是权重/梯度buffer采用跨层复用:以Qwen3-235B为例,单个冗余slot的额外显存开销能从9.9 GB降到 108 MB

小红书与北大开源UltraEP:大规模MoE训练推理最优负载均衡_wishdown.com

实时负载均衡面临的最大挑战

新增的计算和通信是否会拖慢训练或推理过程?

小红书与北大开源UltraEP:大规模MoE训练推理最优负载均衡_wishdown.com

小红书与北大开源UltraEP:大规模MoE训练推理最优负载均衡_wishdown.com

前向传播中,UltraEP需要在门控完成后获取全局负载,才能进行复制方案求解(replication planning)和专家权重分发(weight distribution)。重路由(reroute)负责在同一个固有专家的多个副本间分流token。相比于前两个操作,重路由更轻,且基本都可以被权重分发掩盖。

在控制面的均衡方案求解中,此前方法把“专家放置”和“token重路由”看作解耦的两阶段,容易互相拖累。UltraEP直接求解每个专家实例最终会接到多少负载(quota),把两阶段耦合起来:每一步探索既能实例化新副本,也能更新负载分布。借助warp-level并行,EP64下求解时间仍保持在 100s以内

在数据面上,专家权重分发和梯度归约都是高度动态、稀疏的通信。经典集合通信库和in-switch卸载都吃不下这种非规则模式。更棘手的是,少数热专家副本极多,其所在rank的对外多播会成为新瓶颈。为了打满scale-up物理带宽,UltraEP基于持久化算子(persistent kernel)实现,将专家权重或梯度切分成若干tile,利用内存语义和TMA进行异步的卡间数据搬运。

小红书与北大开源UltraEP:大规模MoE训练推理最优负载均衡_wishdown.com

为了消除通信热点,UltraEP设计了分片流式中继(chunk streaming relay)的通信策略,按实时流量构建两阶段中继树。低流量rank帮忙分摊、转发热点流量,并通过chunk级流式转发避免全局barrier和通信bubble。

小红书与北大开源UltraEP:大规模MoE训练推理最优负载均衡_wishdown.com

小红书与北大开源UltraEP:大规模MoE训练推理最优负载均衡_wishdown.com

反向传播时,专家重分发和梯度归约(gradient reduction)可以和其他反向计算overlap。UltraEP精细控制它们的SM占用和共享内存footprint,避免拖慢反向计算,并用保序累加保证梯度归约的确定性。

小红书与北大开源UltraEP:大规模MoE训练推理最优负载均衡_wishdown.com

除了均衡算法,UltraEP还提供了一套可视化profiler,对均衡前后的负载情况进行层次化分析:既能一览全局分布,也能看清每个microbatch中具体的冷热rank和专家负载,从而全面评估均衡效果和剩余瓶颈。

小红书与北大开源UltraEP:大规模MoE训练推理最优负载均衡_wishdown.com

实验结果:多项模型验证,吞吐显著提升

在Qwen3-235B、GLM4.5/4.7、DeepSeek-V3等模型上,研究团队分别基于Megatron-LM(训练)和SGLang(推理prefill)进行了评估。训练统一采用EP64的专家并行,推理则根据模型专家数采用EP64或EP40。

小红书与北大开源UltraEP:大规模MoE训练推理最优负载均衡_wishdown.com

训练实验结果,包括吞吐(TFLOPS/GPU)和总体均衡度。

小红书与北大开源UltraEP:大规模MoE训练推理最优负载均衡_wishdown.com

推理实验结果,包括TTFT随每秒请求数(RPS)的变化,以及总体均衡度。

主要结果如下:

  • 训练:平均达到理想吞吐的 94.6%,相比Megatron-LM 提升42%
  • 推理prefill:达到理想吞吐的 90%–97%,相比SGLang 提升1.56倍
  • EPLB、LPLB因历史滞后、复制预算受限,效果始终落后于UltraEP。

值得一提的是,UltraEP把rank间不均衡从1.30–4.01稳定压到 1.01–1.04。它与理想上限之间剩下的差距,主要来自实际路由下各专家负载的固有非一致性和少量控制开销,而不是残余不均衡或关键路径开销。

小红书与北大开源UltraEP:大规模MoE训练推理最优负载均衡_wishdown.com

生产部署与未来展望

UltraEP已经在正式生产中部署。在一个288B参数MoE模型的完整预训练中,UltraEP保持了不低于理想性能 92% 的水平,显著提升并稳定了长周期训练吞吐。

小红书与北大开源UltraEP:大规模MoE训练推理最优负载均衡_wishdown.com

UltraEP的核心判断是:随着通信带宽的提升,实时、精确的系统侧负载均衡将成为专家并行的基础能力。算法侧均衡负责训练稳定性和专家特化(specialization),系统侧均衡则负责把每个microbatch中已经发生的负载偏斜重新摊平;二者目标不同,但可以自然叠加。

下一步很自然的扩展是RL场景。由于面向特定领域数据,且没有预训练中的算法侧均衡调控,专家负载往往表现出ReLibra(https://arxiv.org/abs/2605.08639)观察到的,类似推理prefill中的强动态性。因此,UltraEP有机会成为MoE RL基础设施中统一的负载调节层。

小红书与北大开源UltraEP:大规模MoE训练推理最优负载均衡_wishdown.com

来源:整理自互联网
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多