日常巡检
巡检应覆盖最终业务,不只是进程存活。下面给出可直接纳入值班手册的最小基线。
flowchart LR
A[每班:在线率、流、录像、磁盘] --> B[每周:抽查真实业务与备份]
B --> C[每月:恢复演练、安全和容量复核]
C --> D[把手工发现的问题变成自动告警]
每班或每日
- WebUI/API liveness 与 readiness 正常。
- 主服务和 NodeAgent 在线,宿主守护没有反复拉起。
- 所有应在线 MediaServer 心跳、版本、端口和流数正常。
- 数据库连接、锁等待、慢查询和空间没有异常。
- 设备在线率与昨日基线相比没有突变。
- 协议命令超时率、认证失败和注册波动在基线内。
- 活跃录像会话持续产生文件,扫描与裁剪没有积压。
- 录像盘、系统盘字节和 inode 高于安全阈值。
- WebHook、异步命令和 RTC 释放失败没有持续增长。
- 证书距离到期时间足够,续期任务最近成功。
每周
- 抽查 ONVIF、GB28181、RTSP 各一条真实流。
- 抽查一段新录像的检索、Range 播放和下载。
- 检查配置版本漂移、待重启项和未关闭的失败任务。
- 复核新增管理员、角色、Token 与异常登录。
- 查看容量增长趋势,不只看当前剩余空间。
- 确认备份作业成功,并抽查备份文件可读。
每月或重大变更前
- 在隔离环境执行一次数据库与配置恢复。
- 在维护窗口验证宿主进程恢复与告警通知。
- 复核端口暴露、反向代理、TLS 和 TURN 配置。
- 更新设备型号/固件兼容记录。
- 清理过期 Token、无主设备、长期失败任务和到期裁剪文件。
- 评估版本升级并准备回滚材料。
关键指标建议
按宿主、AK 进程、Agent、MediaServer、MySQL、磁盘、协议、录像和 RTC 分层。指标至少带节点与环境标签,设备与通道类指标控制基数,避免把每个短时流都永久作为高基数标签。
巡检异常怎样处理
- 记录时间、指标值、阈值和影响范围。
- 与昨日/上周同一时间基线比较。
- 确认是否有计划变更或容量增长解释。
- 用 TraceId、设备 ID、流标识或任务 ID进入对应日志。
- 如果已影响用户,使用 问题定位器。
- 处理后验证指标恢复和最终用户路径,记录根因与防复发动作。
巡检完成标准
每项都有明确责任人、数据来源、阈值、处理动作和升级路径。手工巡检发现的问题应逐步转成自动告警;长期忽略的告警应调整阈值或删除,而不是形成噪声。