服务器内存检测工具:每日5分钟硬件巡检防宕机

检测维修 0 44

占到意外宕机40%以上的是服务器硬件故障,然而许多管理员仅仅关注系统日志,却忽略了硬件“体检”。西安知见信息科技有限公司构建了一套基础却有效的硬件巡检流程,此流程适合中小企业的物理服务器。

每日巡检项(5分钟完成):

处于指示灯检查的情形下,不存在红灯亦或是黄灯状态,此红灯与黄灯分别对应硬盘、电源以及内存故障灯。针对IPMI或者带外管理这一方面,要 通过登录BMC界面,以此来查看硬件的健康状态,该健康状态涵盖温度、电压以及风扇转速这些方面。常用的IPMI命令为。

使用ipmitool工具列出传感器信息,然后通过grep命令,依据“Temp”、“Fan”、“PS”加上“Volt”的模式进行筛选,获得所需结果。

ipmitool sel list # 查看系统事件日志

对硬盘SMART信息而言,要去安装smartmontools,接着执行smartctl -a /dev/sda,然后重点关注。

重新分配的扇区计数,也就是Reallocated_Sector_Ct,大于50的时候,这属于警告情况。

当前的、处于未决状态的扇区,大于零,这意味着存在着坏道,有待进行处理。_。

服务器硬件故障预防_硬件巡检流程_服务器内存检测工具

Power_On_Hours 记录运行年限

系统日志,通过执行 dmesg -T 命令后使用 grep -i error 进行筛选,以及执行 tail -100 /var/log/messages 操作,来查找硬件相关报错,如“disk timeout”“mce memory error”这种情况。

每周深度检查:

自动化脚本示例(每日cron):

#!/bin/bash
# 硬盘健康阈值告警
bad=$(smartctl -A /dev/sda | awk '/Reallocated_Sector_Ct/ {print $10}')
if [ "$bad" -gt 50 ]; then
   echo "硬盘坏道过多" | mail -s "Alert" admin@zhijian.com
fi
# 温度检查(IPMI)
temp=$(ipmitool sensor get "CPU Temp" | grep "Sensor Reading" | awk '{print $4}')
if [ "$temp" -gt 85 ]; then
   curl -X POST 告警接口
fi

可操作经验:

借助基础巡检,能够在一至四周之前预先知晓硬盘出现故障、风扇发生失效、电源变得不稳等各类问题,从而把会突然出现的宕机变成按计划进行的维护。

相关推荐: