聚焦大模型训练效率提升 北大依托昇腾突破细粒度混合并行技术
2025-08-01 16:39:05AI云资讯2027
在人工智能大模型迅猛发展的当下,大模型参数和计算量呈指数级增长,大规模深度学习模型的训练离不开多硬件设备的分布式计算。在鲲鹏昇腾科教创新卓越中心的算力支持下,北京大学计算机学院崔斌教授团队创新研发了面向大模型的高效分布式训练框架,大幅提升了大规模分布式训练模型的效率。
针对模型训练任务的多样性和复杂性所带来的负载不均问题,研究团队创新设计出了细粒度模型切分与并行策略搜索算法。此方法依托昇腾强大的计算资源管理能力,及算子优化技术对训练策略的适配,完成了统一训练接口到智能切分策略的全过程。首先通过总结多种大模型训练的共同特点,设计出统一的接口来启动和管理不同任务负载的模型训练任务,对训练时所花费的算力、内存、网络通信等进行精确地计算。接着基于这些数据细致拆解庞大且复杂的大模型,根据不同模块分配不同的训练策略以适应各模块的负载差异,实现训练任务的高效并行。目前,该方案已实现比分片数据并行、3D 并行等全局模版化并行方案提升15% 的训练效率。
除此之外,团队还解决了分布式计算所涉及的硬件间通信传输效率问题。结合昇腾高速互联总线技术的高带宽低时延优势,系统会很根据不同的通信需求,对硬件设备进行分组以优化组队时间,运用计算通信重叠技术让“计算”和“通信”同步进行,提高训练流水线的效率,并在模型切分的决策时考虑计算通信重叠的性能影响,综合多方面因素选取最适合的分布式运行方案,最终实现数据传输效率和资源利用率的最大化。
该研究成果不仅为模型大规模训练提供了高效的解决方案,更展现了自主算力在分布式计算领域的巨大潜力。目前,研究成果已在国际顶级学术会议NeurIPS、ICLR、AAAI发表3篇论文,为国内AI技术突破提供了理论支撑与实践范式。
北京大学 鲲鹏昇腾科教创新卓越中心的这一突破彰显了校企协同创新的显著成效。未来,中心将持续加速AI前沿技术在自主计算平台的深度落地,为我国人工智能产业的自主化突破提供强劲动能。
相关文章
- 昇腾生态硬核赋能!上交大攻克超长上下文推理难题,性能大幅跃升
- 从代码生成到智能开发:北大发布基于昇腾平台软件开发解决方案
- 昇腾384超节点深圳首秀!光明实验室携手华为开启国产AI生态“新丝绸之路”
- AI时代“国之重器”:基于昇腾的国产AI生态主题特展亮相高交会
- 凝“芯”聚力,淬炼成“钢” | 昇腾“淬火行动”北京专场点燃伙伴开发者创新引擎
- 突破大模型对齐瓶颈,北大团队携手昇腾打通产业应用通路
- 国产算力部署推理新突破!联通元景万悟发布MinerU 昇腾方案,部署周期缩短1倍,推理性能提升50%!
- HC2025丨高校创新力量“花开”开发者日,鲲鹏昇腾使能科研创新
- 华为全联接大会2025首发《算力珠玑》十大实战案例助力开发者攻克鲲鹏、昇腾开发难关
- 昇腾联合伙伴发布多款 AI 硬件新品 硬件开放战略助力千行万业场景化智能化升级
- 云从科技获华为“昇腾生态最佳实践伙伴”奖 共创AI产业新生态
- 北京航空航天大学 鲲鹏昇腾科教创新孵化中心揭牌,推动中国自主计算生态建设
- 相聚上海,共赴智能之约!昇腾AI人工智能产业峰会三大亮点抢先看
- 科大讯飞联合华为联合推出iFlyCode编程一体机昇腾版,筑牢AI编程安全防线
- 与时代共昇腾 华为携手全爱科技上海AI分享会圆满举办 探智能转型新路径
- 哈尔滨工业大学鲲鹏昇腾科教创新孵化中心成立









