让大模型少做重复计算 中科曙光发布ParaCache
2026/08/28 17:14AI云资讯16437
8月28日,2026中国国际大数据产业博览会期间,中科曙光发布新一代词元加速方案ParaCache。该方案通过保存并复用大模型已经完成的计算结果,减少不同请求、不同计算节点之间的重复计算。测试显示,在约12万词元输入下,ParaCache可使模型开始回答前的等待时间最高降低98.5%;高并发场景下,系统每秒处理的词元量最高达到原来的27倍。

少做重复计算,让算过的直接复用
随着大模型进入长文本、多轮对话、知识库问答和智能体等场景,大量相同或相似内容被反复计算,不仅增加等待时间,也持续消耗算力资源。
ParaCache的思路很直接:把已经算过的结果长时间保存下来,下次需要时直接复用。
该方案统一管理GPU显存、CPU内存、固态硬盘和分布式存储,根据使用频率对计算结果进行分层存放和智能调度,并支持在不同请求、不同计算节点之间共享,实现“一次计算、多次使用”。
ParaCache以曙光分布式存储ParaStor为基础,并融合集中式全闪存储FlashNexus,将存储能力从保存原始数据进一步延伸至保存和复用大模型计算结果,在减少重复计算的同时,降低对高成本显存的占用。
“多快好省”,推理效率全面提升
ParaCache带来的价值,可以概括为“多、快、好、省”。
“多”:高并发场景下,系统每秒处理的词元量最高达到原来的27倍,同样的硬件资源能够承接更多业务请求。
“快”:输入约12万词元时,单轮对话开始回答前的等待时间可降至0.4秒;连续20轮对话中,这一时间由43.1秒降至4.9秒。
“好”:兼容主流推理框架和国产AI加速卡,可在现有系统基础上接入,降低部署和迁移成本。
“省”:高频内容保留在显存,其他内容转移至成本更低的存储设备,减少对高成本显存和新增硬件资源的依赖。

目前,ParaCache已在国内某头部互联网企业在线推理业务中落地,模型开始回答前的平均等待时间降低50%以上;在同等硬件条件下,系统可承载的业务请求也提升数倍。
同时,ParaCache已在全国产十万卡AI超集群曙光8000上完成验证,可面向长文本对话、知识库问答、智能客服、智能体及高并发推理等场景。
中科曙光北京公司总裁助理、分布式存储产品部总经理石静表示,ParaCache不是简单提升单张GPU的性能,而是通过减少重复计算,把更多算力用于处理新的任务。
过去,存储主要负责保存数据。ParaCache进一步将模型已经完成的计算结果纳入存储和复用体系。对于大模型推理而言,少一次重复计算,就意味着少一段等待,也少一份算力消耗。
围绕本届数博会“词元——数据要素价值释放新路径”主题,ParaCache提供了一条更具体的技术路径:不仅保存数据,也保存数据在计算过程中产生的结果,让一次计算形成的价值被持续复用。
相关文章
- 中科曙光AI存储连续三年市场第一
- 从超节点到AI超集群:中科曙光的算力“组合拳”
- 中科曙光全链路解决方案亮相2026科学智能大会
- 直击AI4S算力难题!中科曙光全链路解决方案亮相2026科学智能大会
- 第七届“先导杯”决赛揭榜,中科曙光打造智能计算
- 中科曙光董事长历军:让中国的计算技术站在世界中央
- 中科曙光与豫信电科战略签约,共促河南智能产业升级
- 中科曙光落成首个全国产十万卡AI超集群
- 中科曙光亮相欧洲,展示前沿AI基础设施“中国方案”
- 再次登顶:中科曙光获全球存储权威评选双第一
- 中科曙光亮相欧洲,定义下一代AI基础设施
- 打破超智算力边界!中科曙光定义下一代AI基础设施趋势
- 金融AI落地提速!中科曙光“元融”金融数智化解决方案正式发布
- 中科曙光发布新一代通用高性能计算平台 高精度算力底座升级
- 拥抱全精度超智融合计算,中科曙光携scaleX万卡超集群亮相智博会
- AI基础设施新突破!中科曙光1700㎡展台震撼亮相智博会
AI企业
更多>>AI硬件
更多>>AI产业
更多>>AI技术
更多>>- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠









