网络信息中心机房环境主要监控目标对象为:电力供应、火情、空调异常。监控对象表征为:UPS可监控数据(包括输入、输出、负载等)、烟雾、环境温湿度值。
环境监控报警根据影响范围不同定为不同级别,予以不同处置,应急处置流程如下:
一、紧急告警
(一) 机房烟雾告警
1. 如消防系统已启动,立即通知相关区域同志撤离机房。
2. 如消防系统尚未启动,立刻调出该场地视频监控,确认是否有火情。一旦确认火情,立即疏散,并确认消防系统能正确启动。
3. 火警必须在第一时间电话通知中心主任、相关机房安全责任人、办公室主任和环境与设备工程师。
4. 按消防相关程序处置。
(二) UPS输入掉电告警
1. 立刻通知环境与设备工程师和相关机房负责人,环境与设备工程师即刻响应并处理,通知机房负责人电池放电情况。
2. 相关机房负责人待命响应,根据需要按预定程序逐级安全关闭各类系统或设备,并通知相关部门及人员。
3. 如影响中心关键业务,由机房负责人作出判断,并立即通知业务所属责任部门。
(三) 机房地湿告警
立刻通知相关机房负责人和环境与设备工程师,现场查看空调底下是否有水管爆裂漏水。
备注:漏水事故影响不可轻忽,某些情况下会引起灾难性事故,请务必关注。
(四) UPS输出故障
1. 立刻通知环境与设备工程师和相关机房负责人,环境与设备工程师即刻响应并处理,通知机房负责人影响范围。
2. 相关机房负责人立即响应,如影响中心关键业务,由机房负责人作出判断,并立即通知业务所属责任部门。
二、重要告警
(一) 监控数据通信中断告警
发现监控数据通信中断告警,需要综合查看,首先排查是否网络原因,其次排查是否服务器原因。以下状况考虑环境因素:
如果同时有大面积的网络故障和服务器故障,很可能是UPS输出故障,立即通知环境与设备工程师、运行部负责人和系统部负责人。
如果是单纯的数据数据通信中断,一般是监控设备死机,在工作时间通知环境与设备工程师处理。
1. 机房高温告警
立刻通知环境与设备工程师,如判断空调已失效,则需到现场处置。
备注:由于机柜上的温湿度仪因热通道和铁架的热传导作用使得感应温度偏高很多,只能做参考。因此,如夜间发现高温告警,可注意观察,如有持续异常升温则通知环境与设备工程师处理。
2. 冷冻水高温告警
发现冷冻水高温告警或空调进水高温告警,即刻通知环境与设备工程师处理。
3. 市电掉电告警
工作时间,立刻通知环境与设备工程师处理。非工作时间,如发生UPS输入掉电告警,按前述流程处置。
三、一般告警
其他机房环境监控告警,考虑都是设备故障或者部分功能异常,影响面有限,在工作时间通知环境与设备工程师处理。