服务器日常巡检核心阈值参考
在日常运维中,明确监控指标的告警阈值是保障业务稳定的基础。以下为IDC行业通用的CPU、磁盘及带宽标准阈值参考,适用于物理机与云服务器。
一、CPU使用率
CPU使用率(User + System)建议设置双重阈值:
- 警告阈值:持续5分钟超过75%
- 严重阈值:持续5分钟超过90%
长时间高负载可能引发进程排队、响应延迟。同时需关注CPU IOWait(等待磁盘IO时间),若超过10%应排查磁盘性能瓶颈。
二、磁盘指标
磁盘巡检需覆盖空间、IO及健康状态:
- 磁盘使用率:建议85%触发警告,95%触发严重告警(避免日志或临时文件撑满)
- 磁盘IO等待时间(await):≤10ms为正常,10-30ms需关注,>30ms可能影响业务
- 磁盘IOPS与吞吐量:根据业务基准值设定,通常峰值不可超过80%最大IOPS
建议使用iostat -x 1或dstat工具观察%util,若超过80%且await偏高表明磁盘负载过重。
三、带宽与网络
带宽利用率应根据链路类型差异化设定:
- 内网带宽:建议利用率≤70%,避免拥塞导致丢包
- 外网带宽:参考业务峰值的80%设定告警,突发流量可预留20%缓冲
- 丢包率:>0.1%需排查,>0.5%为严重
网络延迟(RTT)在同机房内应低于1ms,跨区域视距离而定。注意区分入/出方向流量,云服务商通常提供独立带宽计费。
四、其他注意事项
阈值并非固定值,需结合业务特性调整:
- 数据库服务器CPU建议比Web服务器更保守(60%告警)
- SSD磁盘IO等待时间通常低于HDD,可设置更严格阈值
- 突发性高负载(如促销活动)可临时调整阈值,事后恢复
推荐使用Zabbix、Prometheus等工具配置告警,并定期复盘阈值合理性。