阿里云机器学习PAI发布基于HLO的全自动分布式系统 TePDist,并宣布开源!
2023-04-24 11:14:21AI云资讯1060
近日,阿里云机器学习平台PAI正式发布自研的基于HLO的全自动分布式深度学习系统TePDist。它通过在HLO上做分布式策略搜索,能够与用户模型构建语言解耦。并且在保持通用性的同时,能够在可接受的策略搜索时间内,追求高性能分布式策略,同时用户无需修改模型主体代码,系统能够全自动地帮助用户做分布式扩展,有效解决了分布式框架长期以来在实际生产场景中手工优化和自动分布式工作存在的诸多性能和效率问题。
TePDist不仅仅是一个分布式Compiler,还拥有自己的分布式Runtime,以解决深度学习模型并行策略的自动搜索与分布式策略实施问题。在架构方面,TePDist采用Client/Server模式,实现分布式策略与模型描述的解耦。Server端是TePDist最重要部分,以HLO IR作为输入,自动探索并实施分布式并行策略;Client端以用户描述的模型为输入,将其转换成HLO IR。因此,任何具有转换HLO IR能力的Client,都可经过适配后接入Server端。

在功能方面,TePDist分为两个部分。一是在HLO IR上进行SPMD(Data Parallel和Sharding)和Pipeline并行的策略搜索。并以此构建编译基于Task Graph的执行计划。二是高效运行执行计划的分布式执行引擎。同时,TePDist提供了不同优化级别,高优化级别更加追求分布式策略质量,低优化级别会额外采取一些Heuristic,以较为微小策略质量牺牲,换取更快地搜索时间,以此满足落地需求。
性能上,TePDist通过在GPT和MoE模型上SPMD+Pipeline混合策略的模型扩展性实验,TePDist能够使GPT和MoE分别达到峰值能力的62%和58%。同时,在自动化方面的通用性上,TePDist也通过了VGG-19,DNABert和UNet等模型实验验证。
一直以来,大模型在模型效果上被证明具有显著优势。而ChatGPT的出现,证明了其在工业生产工具方面具有巨大潜力。阿里云机器学习平台PAI也宣布将TePDist开源,与AI开发者共同打造更快更好的自动分布式系统,全面助力AI大模型发展!
开源地址:https://github.com/alibaba/TePDist
相关文章
- 阿里云支持鹰角3D新游《明日方舟:终末地》全球开服
- 风行在线携手阿里云通义大模型,AI漫剧创作平台“橙星梦工厂”,引领数字内容生产新范式!
- 阿里云AI火花大会:AI加速从单点创新迈向规模化落地
- 灵机一动亮相阿里云展:定义AI硬件的智能体操作平台
- 玻色量子计算云服务上线阿里云!面向全球开放,直面国际量子算力竞争!
- DFRobot亮相阿里云通义智能硬件展,软硬融合AI视觉方案获高度关注
- 定义AI时代隐私计算新标准,YoooTek联合阿里云无影发布 Glass-Box 架构
- 神眸携秋季新品亮相阿里云“秒物·智趣” 开启智能影像新纪元
- 阿里云AI Landing Zone正式发布,助力企业从“上好云”到“用好AI”的战略升级
- 爱诗科技与阿里云达成全栈AI合作 AI视频服务全球化再启航
- 快鹭科技新品入驻阿里云云市场:以AI赋能办公解决方案,开启企业智能协作新时代
- 融云与阿里云联手,共同按下“AI+通信云”生态加速键
- AI火花集|阿里云携手心智互动,为视障群体打开娱乐场景
- 延锋国际 X 阿里云:全栈AI加速汽车产业智能升级!
- 级数AI与阿里云达成全栈AI战略合作
- 工程师变身AI“指挥者”,吉利与阿里云的软件开发变革实验
人工智能企业
更多>>人工智能硬件
更多>>人工智能产业
更多>>人工智能技术
更多>>- 云知声Unisound U1-OCR大模型发布!首个工业级文档智能基础大模型,开启OCR 3.0时代
- 基石智算上线 MiniMax M2.5,超强编程与智能体工具调用能力
- 昇腾原生支持,科学多模态大模型Intern-S1-Pro正式发布并开源
- 百度千帆深度研究Agent登顶权威评测榜单DeepResearch Bench
- 在MoltBot/ClawdBot,火山方舟模型服务助力开发者畅享模型自由
- 教程 | OpenCode调用基石智算大模型,AI 编程效率翻倍
- 全国首个!上海上线规划资源AI大模型,商汤大装置让城市治理“更聪明”
- 昇思人工智能框架峰会 | 昇思MindSpore MoE模型性能优化方案,提升训练性能15%+









