泡泡网新闻频道 PCPOP首页      /      新闻频道     /      动态    /    正文

让国产算力跑满万亿MoE大模型:神州光大基于公开论文实现国产算力MoE后训练MFU超34%

  AI大模型竞争进入下半场,真正决定胜负的,早已不只是模型参数规模,而是MoE模型能否被高效训练、国产算力能否被充分释放、后训练能力能否进入真实业务闭环。近日,神州光大在研读了深圳河套学院Al训练平台项目团队发表的公开论文《SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD》后,基于自有工程体系独立开展复现与优化,并在客户真实业务后训练场景中,在国产算力环境实现MFU(Model FLOPs Utilization,模型算力利用率)稳定达到34%以上。该结果与论文中在Ascend SuperPOD上取得了34.22%的MFU、较开源基线提升2.93倍的技术结论相互印证,标志着相关技术完成了从论文验证到产业级应用的关键一跃。

  如果说通用大模型解决了“智能有没有”的问题,那么后训练解决的就是“智能能不能真正进业务”的问题。尤其在MoE模型成为主流技术路线之后,模型通过专家路由把总参数规模推向万亿级,同时保持相对可控的单token计算量;但硬币的另一面,是训练系统必须面对更复杂的通信编排、更严峻的显存压力、更碎片的算子调用和更敏感的长周期稳定性。神州光大此次落地该论文技术的核心价值,正在于把这套面向MoE全参数后训练的复杂工程问题,放到国产算力底座上系统性求解,并放进真实客户业务中反复锤炼。

  本次实践首先验证了MoE大模型后训练的高效工程化能力。与传统稠密模型不同,MoE模型的专家路由、Token Dispatch/Combine、All-to-All通信与稀疏激活模式,会显著放大并行策略、流水线和算子实现的复杂度。神州光大基于论文技术路径,围绕专家—张量并行协同、流水线气泡压缩、MoE通信与计算重叠、双缓冲Swap Optimizer等关键环节进行工程重构,使万亿参数级MoE模型在全参数后训练过程中,不再被通信等待、显存碎片和无效空转持续吞噬算力,而是让训练吞吐真正贴近硬件能力上限。

  其次,这次落地更是一次国产算力全栈能力的集中检验。所面向的Ascend SuperPOD与昇腾NPU体系,并非对GPU技术路线的简单平移,而是需要围绕SIMD架构、Ascend C算子、UB驻留、MTE流水、通信原语与集群拓扑建立一整套新的优化方法论。神州光大在客户项目中,将并行策略推荐、瓶颈Profiling、算子融合重写、通信重叠调度、显存治理与稳定性监控贯通起来,形成了一套面向国产算力的“MFU提升工程配方”。这不仅意味着国产算力能够承载大规模MoE后训练任务,更意味着国产软硬件体系可以在真实生产负载中跑出可持续、可复制、可交付的高效率。

  更重要的是,神州光大没有把这次验证停留在实验室指标上,而是将其放进了真实业务后训练场景。真实客户场景与公开实验最大不同在于:数据分布更复杂、模型变体更多、业务SLA更严格、数据安全与合规要求更高,训练过程还必须面对多任务混部、资源碎片、长周期运行和故障恢复等现实约束。也正是在这样的环境中,神州光大进一步确认:MFU超过34%不只是一个性能数字,而是模型迭代速度、训练成本、交付周期和业务确定性的综合体现。

  与此同时,真实场景也暴露了下一阶段的优化空间。项目复盘显示:在部分客户负载中,MoE专家并行与数据/张量并行的通信暴露时间仍有压缩余地;高吞吐训练对数据预处理、样本供给、Tokenization、Checkpoint恢复提出了更高要求;稀疏注意力、mHC、SwiGLU、RoPE等模型相关算子在不同业务变体上仍可能出现新的内存访问瓶颈;国产算力集群在多租户混部和异构资源调度下,也需要更强的拓扑感知与稳定性治理能力。这些问题共同指向一个结论:大规模后训练优化不是单点提速,而是包括模型结构、数据供给、算子实现、并行策略、集群调度、稳定性运营等一系列系统工程。

  基于上述成果与问题洞察,神州光大正式启动高效大模型后训练技术的规模化推广计划。公司将围绕MoE模型、国产算力、真实业务场景三条主线,建设可复用的训练优化配方库与工具链,沉淀并行配置推荐、瓶颈诊断、算子优化、通信编排、稳定性巡检和成本评估能力;同时继续深化与相关产业伙伴的协同创新,推动相关技术进入金融、能源、制造、政企及运营优化等更多高价值场景,让高效后训练从“项目制突破”走向“产品化交付”。

  “这次验证最重要的意义,不是把某一个指标做高,而是证明国产算力上的MoE全参数后训练,能够在真实业务里同时做到高效、稳定和可运营。”神州光大董事长高峰表示,“34%以上MFU是起点,不是终点。神州光大的目标,是把前沿方法变成客户业务里可感知的训练提速、成本下降和迭代确定性。”

  面向未来,神州光大将持续投入MoE大模型训练系统工程、国产算力适配与推理加速等场景建设,坚持开放学习、独立研发、严谨验证的产业路径,推动高效训练技术在更多真实业务中落地生根——让国产算力跑得更满,让MoE模型训得更快,让后训练能力真正进入产业现场。


0人已赞

关注我们

泡泡网

手机扫码关注