7月27日,由OCP社区主办、浪潮承办的第三届OCP China Day顺利举行。会上,浪潮联合腾讯云发布《数据中心服务器智能故障诊断TIFDS(Tencent & Inspur Fault Diagnosis System)系统技术白皮书》,白皮书详细解读了当前大规模数据中心运维面临的挑战,阐述了腾讯云与浪潮联合研发的TIFDS系统架构,为大规模数据中心提升服务器运维效率,保障数据中心稳定运行提供重要参考。

以腾讯云数百万服务器运营数据和浪潮深厚的固件研发专家经验库为基础,“TIFDS”系统可利用AI技术对海量服务器运行数据实时分析,对各类部件故障实时预警,故障诊断“火眼金睛”,故障自动明确化率提升至95%以上,远超业界平均水平。

OCP China Day现场腾讯云星星海实验室研发副总监刘超介绍白皮书内容

大规模数据中心服务器猛增 人力运维接近极限

伴随着互联网企业的崛起,云计算市场已走过十多年的时间,据Gartner数据统计,2020年全球云计算市场快速增长,增速超过40%,中国云计算市场也持续两位数增长,市场增长动能逐渐从泛互联网向产业化快速渗透,增长持续加速。

白皮书指出,云计算的快速扩张带来了数据中心服务器数量的爆发式增长,随之而来的服务器运维管理复杂度和难度也越来越大,而传统的海量服务器故障运营面临着更大的挑战和更高昂的成本,从最初的脚本运维、工具运维到平台运维演进至今,人力已接近极限,越来越无法满足快速修复故障和恢复业务运行的要求。为高效管理十万甚至百万级服务器,智能化的监控诊断系统成为大规模数据中心必不可少的工具。

公布TIFDS系统架构,故障自动明确化率95%以上

TIFDS(Tencent & Inspur Fault Diagnosis System)是腾讯云与浪潮联合研发的故障诊断系统,是服务器健康监管技术及故障预警诊断技术的总称,旨在实现运维工作由人工离线分析向自动智能在线识别的方向发展,建立一套以带外BMC为中心的故障诊断系统。据白皮书介绍,TIFDS系统具有风险实时预警,故障精准诊断和日志定制化透明安全等特点,对提升大规模数据中心运维效率具有重要意义。

风险实时预警:该系统基于腾讯云现网运行的百万台服务器运维经验,结合AI智能算法,可对非宕机类故障进行实时预警,降低服务器高负荷运行下突然失效的风险。 故障精准诊断:浪潮构建专家经验库,将故障自动明确化率提升至95%以上,远高于业界平均标准,秒级告警,精准反馈故障触发源,提升运维效率。 日志定制化透明安全:创新性的按照腾讯云需求联合定制日志输出上报方式,使诊断过程清晰透明,并对疑难问题进行了识别并建立了线上联合诊断系统,不断提升系统运维效率。

关注中国IDC圈官方微信:idc-quan 我们将定期推送IDC产业最新资讯

查看心情排行你看到此篇文章的感受是:


  • 支持

  • 高兴

  • 震惊

  • 愤怒

  • 无聊

  • 无奈

  • 谎言

  • 枪稿

  • 不解

  • 标题党
2021-08-02 10:08:26
市场情报 数据中心非接触式技术不仅用于应对疫情
全球冠状病毒疫情和COVID-19后的“新常态”促进了非接触式技术的大规模发展,并使其比以往任何时候都更加普及,包括在数据中心内外。 <详情>
2021-07-31 17:08:00
市场情报 独占鳌头,遥遥领先!华为数据中心间接蒸发冷却解决方案领跑中国市场
报告显示,华为凭借在间接蒸发冷却的持续创新,以绝对领先优势稳居中国数据中心蒸发冷却温控市场第一。 <详情>
2021-07-29 16:50:07
云资讯 IDC:2021Q1中国云市场规模超300亿 阿里云第一、腾讯华为位列二三
整体来看,中国公有云市场增速超过全球增速。据IDC 2020年全球公有云市场报告,全球公有云市场增速为24.1%,与中国市场增速差距明显。 <详情>
2021-07-22 14:09:48
国内资讯 汇金股份拟收购云兴网晟 加码数据中心业务
汇金股份主营业务主要分为智能制造业务、信息化系统集成业务、信息化数据中心业务及供应链业务。 <详情>
2021-07-22 14:08:18
国内资讯 积极布局建设新型数据中心 助力数字经济发展
随着5G、云计算、人工智能等新一代信息技术快速发展,信息技术与传统、产业加速融合,数字经济蓬勃发展,数据中心作为各个行业信息系统运行的物理载体,已成为经济社会运行 <详情>