AKStream.Next · 文档中心

日常巡检

日常巡检

巡检应覆盖最终业务,不只是进程存活。下面给出可直接纳入值班手册的最小基线。

flowchart LR
    A[每班:在线率、流、录像、磁盘] --> B[每周:抽查真实业务与备份]
    B --> C[每月:恢复演练、安全和容量复核]
    C --> D[把手工发现的问题变成自动告警]

每班或每日

  • WebUI/API liveness 与 readiness 正常。
  • 主服务和 NodeAgent 在线,宿主守护没有反复拉起。
  • 所有应在线 MediaServer 心跳、版本、端口和流数正常。
  • 数据库连接、锁等待、慢查询和空间没有异常。
  • 设备在线率与昨日基线相比没有突变。
  • 协议命令超时率、认证失败和注册波动在基线内。
  • 活跃录像会话持续产生文件,扫描与裁剪没有积压。
  • 录像盘、系统盘字节和 inode 高于安全阈值。
  • WebHook、异步命令和 RTC 释放失败没有持续增长。
  • 证书距离到期时间足够,续期任务最近成功。

每周

  • 抽查 ONVIF、GB28181、RTSP 各一条真实流。
  • 抽查一段新录像的检索、Range 播放和下载。
  • 检查配置版本漂移、待重启项和未关闭的失败任务。
  • 复核新增管理员、角色、Token 与异常登录。
  • 查看容量增长趋势,不只看当前剩余空间。
  • 确认备份作业成功,并抽查备份文件可读。

每月或重大变更前

  • 在隔离环境执行一次数据库与配置恢复。
  • 在维护窗口验证宿主进程恢复与告警通知。
  • 复核端口暴露、反向代理、TLS 和 TURN 配置。
  • 更新设备型号/固件兼容记录。
  • 清理过期 Token、无主设备、长期失败任务和到期裁剪文件。
  • 评估版本升级并准备回滚材料。

关键指标建议

按宿主、AK 进程、Agent、MediaServer、MySQL、磁盘、协议、录像和 RTC 分层。指标至少带节点与环境标签,设备与通道类指标控制基数,避免把每个短时流都永久作为高基数标签。

巡检异常怎样处理

  1. 记录时间、指标值、阈值和影响范围。
  2. 与昨日/上周同一时间基线比较。
  3. 确认是否有计划变更或容量增长解释。
  4. 用 TraceId、设备 ID、流标识或任务 ID进入对应日志。
  5. 如果已影响用户,使用 问题定位器。
  6. 处理后验证指标恢复和最终用户路径,记录根因与防复发动作。

巡检完成标准

每项都有明确责任人、数据来源、阈值、处理动作和升级路径。手工巡检发现的问题应逐步转成自动告警;长期忽略的告警应调整阈值或删除,而不是形成噪声。