服务器日常巡检基础必查项目清单
前言:为何巡检是运维的基石
服务器作为企业IT架构的核心,其稳定运行直接关系到业务连续性。日常巡检通过系统化检查硬件、系统、服务及安全状态,能提前发现潜在风险,避免突发故障导致的数据丢失或业务中断。本文梳理一份基础必查项目清单,供运维人员参考执行。
一、硬件健康检查
1. CPU与内存
- CPU温度:检查是否接近或超过厂商阈值(如Intel Xeon通常建议低于85°C),过高可能引发降频或宕机。
- 内存状态:使用
dmidecode或BMC查看ECC错误计数,非ECC内存可关注系统日志中的Memory Error。
2. 存储设备
- 硬盘SMART信息:检查
Reallocated_Sector_Count、Current_Pending_Sector等关键属性,数值异常需尽快替换。 - RAID状态:查看RAID卡日志,确认阵列健康、无降级或重建失败。
3. 电源与散热
- 电源模块:检查指示灯状态,确认冗余电源均正常工作,无报警。
- 风扇转速:对比基线值,异常低速或高速可能预示风扇故障或积灰。
二、系统资源监控
1. CPU与内存使用率
使用top或htop观察CPU空闲率是否低于20%(预警值),内存使用率是否超过80%。注意SWAP使用量,持续增长可能表明内存不足。
2. 磁盘空间与I/O
- 分区使用率:重点关注
/、/var、/data等分区,建议阈值85%,超过90%需紧急处理。 - 磁盘I/O等待时间:
iostat中%wa若长期高于30%,需排查是否有慢盘或高IO进程。
3. 网络连通性
- 检查关键网络接口:确认
ping网关、外网及关键业务IP无丢包、延迟突变。 - 端口与连接数:使用
ss -s或netstat检查TIME_WAIT数量,过多可能影响新连接建立。
4. 系统日志
重点查看/var/log/messages、/var/log/syslog中的Error、Warning、Fatal级别条目,特别是硬件或文件系统相关报错。
三、应用服务状态
1. 关键进程存活
通过systemctl status或ps aux确认数据库、Web服务器、缓存服务等处于运行状态,且未出现频繁重启。
2. 端口监听
使用ss -tlnp检查预期端口(如80、443、3306、6379)是否在监听,并排除意外开放的高危端口。
3. 响应时间与错误率
对面向用户的服务,可通过模拟请求或APM工具获取平均响应时间和错误码比例(如5xx增多)。若偏离基线,需分析慢查询或代码异常。
四、安全与合规检查
1. 登录与权限
- 检查可疑登录:查看
/var/log/secure或auth.log中失败的SSH登录尝试次数,暴力破解可能预示攻击。 - 回收闲置账号:检查
/etc/passwd中非必要用户,禁用或删除。
2. 异常进程与文件
- 异常进程:使用
ps aux查找CPU或内存异常高的进程,确认是否为恶意软件。 - 敏感文件变更:关注
/tmp、/var/tmp下有无可疑脚本,以及crontab内容是否异常。
3. 防火墙与补丁
- 规则有效性:确认iptables或firewalld规则未意外放行关键端口。
- 安全更新:定期检查系统及核心软件版本,确保已应用最新安全补丁。
五、巡检频率建议
基础项目建议每日或每周自动化脚本轮询一次,硬件健康与安全日志可每日检查;应用服务响应时间可根据业务重要性每小时或每分钟监控。异常指标应立即触发告警并人工介入。
结语
上述清单覆盖了服务器日常巡检的核心维度。实际执行中应结合企业基础设施、业务特点及SLA要求进行裁剪与扩展。记录巡检历史并持续分析趋势,能有效提升运维主动性与系统可靠性。