从"监测"到"纠正",走好ITSM第一步

· 探索与观点

“从监测到纠正”的价值流是通过监测手段发现信息系统的异常,记录为“故障单”并界定故障的“原因”,通过整改和变更消除导致异常的“原因”。依托对信息系统进行一体化监测的技术机制,衔接故障管理、问题管理、整改管理的流程,使得监测和故障之间形成闭环,并触发对“原因”进行界定和消除的闭环。

目的:依托对信息系统进行一体化监测的技术机制,衔接了故障管理,问题管理,整改管理的流程,使得监测和故障之间形成了闭环,并且触发了“问题管理”和“整改管理”,形成了对“原因”进行界定和消除的闭环。

范围:通过“从监测到纠正”的价值流包括:系统监测,事态管理,故障管理,问题管理,变更控制,配置管理,整改管理流程衔接起来,形成了一个跨流程的端到端视角。

性能监测是对信息系统中的各类软件和硬件的性能指标进行持续监测,包括:网络、存储、服务器硬件、虚拟化平台、虚拟主机、数据库系统、中间件系统以及Web服务。对信息系统的一体化监测具有以下价值:

  1. 尽早发现隐患或定位故障;
  2. 量化系统资源的使用;
  3. 减少巡检的内容,减轻人力工作。

“监测”是通过软件对每一个IT资源的性能状态的数据进行持续采集的过程。通过“监测”量化了每一个IT设备的性能,量化了所有资源的分配和使用情况,为信息部门增加或减少资源的分配提供了依据。

性能监测:性能指标的采集和告警

对信息系统的性能监测只是性能数据采集和告警,更为关键的计算数据,利用数据,呈现数据。例如、在于通过特征分析形成预警机制,并通过逻辑关系模型,构成可视化预案,通过容量分析利用性能的历史数据,分析可能的潜在隐患。

监测的技术手段:软件系统为避免额外的安装和维护成本,以及额外开销。建议,主要通过标准协议进行监测。数据中心管理人员需要以“云”和“资源池”为单位统计资源的分配,虚拟机的增长情况。掌控资源的分配率和使用率,以便能够提前量化对物理资源的建设需求。

虚拟化的计算资源管理

  1. 运营企业私有云的资源:自动化盘点各个资源池的资源及使用情况,以及使用趋势。
  2. 发现资源不足的潜在隐患:自动化盘点各个资源池的超配情况。

性能监测:容量分析

“性能监测”可能带来了一些使用和管理方面便利的同时,最重要的是将各类软件和硬件的监测数据进行关联性分析。围绕“业务系统”为“主体”,将与之关联的软件和硬件的性能数据进行关联分析。

一个“信息化服务”是由多个应用系统,多个层面的软件和硬件相互作用,相互支撑的一个有机体。孤立的关注某个软件或硬件的性能,不足以说明一个“信息化服务”的整体性能。

只有将围绕同一个“主体”(信息化服务)的各个层面的性能指标关联起来,在统一时间维度下进行综合观测,才能在这些具有关联性的指标之中发现,哪些指标具有共同的性能波动,其中哪些是高负载运转,是可能的瓶颈。这些共同波动规律的指标是否发生了变化,高负载和变化是可能的隐患。

业务访问和系统处理的变化,会体现在支撑该信息化服务系统的各个层面。因此,需要根据“配置管理数据库(CMDB)”中的依存关系模型,围绕一个“业务系统”,将支撑同一个业务系统的不同层面的各个指标的数据关联起来,形成一个的跨设备的性能指标关联分析。

系统的容量会伴随着业务的变化而变化,也会因为软件的更新或硬件更替而产生变化。因此,需要对业务系统的容量趋势和变化进行定期分析。

业务变化往往不体现在短期,而反应在数据上的变化可能也不明显。但在长期(季度)的数据统计中能看到容量趋势的变化。因此,容量的分析需要有短期、中期、长期三个不同周期的视角,以此观测系统的容量趋势在长期的发展中是否有逐渐趋向崩溃的早期迹象,例如、短期以日和周为单位,中期以月为单位,长期为三个月以上的趋势统计。

想看看网智系统如何解决您的IT管理难题?

预约演示,我们根据您的行业和场景定制交流方案