浪潮与腾讯云联合发布数据中心服务器智能故障诊断技术白皮书
2021-08-02 11:29:53AI云资讯1195
以腾讯云数百万服务器运营数据和浪潮深厚的固件研发专家经验库为基础,“TIFDS”系统可利用AI技术对海量服务器运行数据实时分析,对各类部件故障实时预警,故障诊断“火眼金睛”,故障自动明确化率提升至95%以上,远超业界平均水平。

OCP China Day现场腾讯云星星海实验室研发副总监刘超介绍白皮书内容
大规模数据中心服务器猛增 人力运维接近极限
伴随着互联网企业的崛起,云计算市场已走过十多年的时间,据Gartner数据统计,2020年全球云计算市场快速增长,增速超过40%,中国云计算市场也持续两位数增长,市场增长动能逐渐从泛互联网向产业化快速渗透,增长持续加速。
白皮书指出,云计算的快速扩张带来了数据中心服务器数量的爆发式增长,随之而来的服务器运维管理复杂度和难度也越来越大,而传统的海量服务器故障运营面临着更大的挑战和更高昂的成本,从最初的脚本运维、工具运维到平台运维演进至今,人力已接近极限,越来越无法满足快速修复故障和恢复业务运行的要求。为高效管理十万甚至百万级服务器,智能化的监控诊断系统成为大规模数据中心必不可少的工具。
公布TIFDS系统架构,故障自动明确化率95%以上
TIFDS(Tencent & Inspur Fault Diagnosis System)是腾讯云与浪潮联合研发的故障诊断系统,是服务器健康监管技术及故障预警诊断技术的总称,旨在实现运维工作由人工离线分析向自动智能在线识别的方向发展,建立一套以带外BMC为中心的故障诊断系统。据白皮书介绍,TIFDS系统具有风险实时预警,故障精准诊断和日志定制化透明安全等特点,对提升大规模数据中心运维效率具有重要意义。
- 风险实时预警:该系统基于腾讯云现网运行的百万台服务器运维经验,结合AI智能算法,可对非宕机类故障进行实时预警,降低服务器高负荷运行下突然失效的风险。
- 故障精准诊断:浪潮构建专家经验库,将故障自动明确化率提升至95%以上,远高于业界平均标准,秒级告警,精准反馈故障触发源,提升运维效率。
- 日志定制化透明安全:创新性的按照腾讯云需求联合定制日志输出上报方式,使诊断过程清晰透明,并对疑难问题进行了识别并建立了线上联合诊断系统,不断提升系统运维效率。
腾讯云服务器运营中心副总经理严勇表示:“腾讯云在全球数据中心服务器数量早已超过百万台,此次发布的TIFDS系统,不仅能大幅提升自身数据中心的服务器运维效率,为腾讯云平台的稳定运行提供坚实的技术支撑,也将为各类新兴应用在公有云平台的大规模落地提供良好的技术储备。”
浪潮信息研发项目管理部总经理宋晓锋表示:“TIFDS是数据中心服务器运维技术的重要创新,是腾讯云与浪潮双方基于JDM模式,打破原有产业链上下游合作模式,进行联合研发的又一成果。此次,浪潮与腾讯云将TIFDS架构进行梳理,联合发布了业界首个数据中心故障运维白皮书,为提升数据中心运维效率和云计算稳定性具有重要的借鉴意义。”
相关文章
- 悬镜安全:穿越周期 在AI浪潮中定义数字供应链安全新范式
- 浪潮计算机亮相通信盛会!以多元智算产品赋能行业发展新未来
- 浪潮下,开目软件与国产工业软件的AI破局之道
- 浪潮 KaiwuDB 亮相 OpenClaw 开发者日,分享Agentic AI 时代数据底座建设思路
- 浪潮开务时序基础模型正式发布
- 数字峰会探新“智”|为AI装上“质检员”,浪潮软件集团发布大模型“体检”方案
- 传音控股出海新篇章:共创共享,融入新兴市场数字化浪潮
- DeepSeek-V4 上线国家超算互联网:以普惠算力与开发者共逐AI新浪潮
- 2026 Q1光通信电源收入同比增166.16%!鼎阳科技拥抱AI+光通信浪潮
- 从全域覆盖到价值深耕,浪潮云海超融合五大行业市占率第一
- Aginode安捷诺:OpenClaw开启的智能体浪潮,如何重塑下一代智算网络?
- 在时代的浪潮中前行:黄宏生与创维的务实之道
- 从Agent 浪潮到组织变革,腾讯云携手业界专家共探OpenClaw时代的安全边界与企业进化
- “十五五”开局之年,国产操作系统在AI浪潮中书写中国方案
- 资源全面利旧,助推云架构再升级,浪潮云海助力长城汽车云平台建设
- 养虾引爆执行式AI浪潮,微盟导购Agent打通零售AI全链路
人工智能企业
更多>>人工智能硬件
更多>>人工智能产业
更多>>人工智能技术
更多>>- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠
- Seedance 2.0面向企业公测,豆包大模型日均Token使用量突破120万亿
- 端到端OCR模型第一!百度千帆Qianfan-OCR正式发布
- 云知声Unisound U1-OCR大模型发布!首个工业级文档智能基础大模型,开启OCR 3.0时代
- 基石智算上线 MiniMax M2.5,超强编程与智能体工具调用能力
- 昇腾原生支持,科学多模态大模型Intern-S1-Pro正式发布并开源









