AKStream.Next · 文档中心

运维与排障

运维与排障

运维的目标是让问题在用户发现前被监控发现,在故障发生后能够用同一组证据快速定位,并且任何升级或恢复都有退路。

flowchart LR
    A[巡检与监控] --> B[发现异常]
    B --> C[固定时间和影响范围]
    C --> D[找到第一处失败]
    D --> E[只改一个变量]
    E --> F[验证用户路径并记录根因]

建立运行基线

  1. 使用 日常巡检 定义班次、每日和每周检查。
  2. 用 监控、日志与告警 覆盖宿主、控制面、协议、媒体、数据库和磁盘。
  3. 按 安全基线 管理账号、Token、密钥、网络与审计。
  4. 需要让第三方立即收到设备、RTC、MediaServer 异常、流和录像事件时,配置主系统第三方 Webhook。
  5. 在生产变更前完成 备份、恢复、升级与回滚。

发生故障时

如果还不知道问题在哪一层,先打开 按现象定位问题。常见专项:

一次有效排障

不要从“重启所有服务”开始。先固定现场:

  • 故障开始与恢复时间;
  • 受影响用户、设备、通道和节点;
  • 是全部失败还是某协议、某浏览器、某网络失败;
  • 最近的配置、证书、网络、版本或设备变更;
  • 命令 ID、任务 ID、TraceId、Call-ID、流标识或文件 ID;
  • 同时间窗口的应用、Agent、MediaServer、数据库和代理日志。

从用户最终结果向后检查,找到第一处不一致。每一步只改变一个变量,并记录改变前后结果。

重启原则

重启可以恢复状态,但也会破坏证据并影响更多用户。只有在已保存必要日志、明确影响范围和回退方案后执行。重启后仍需找出根因;“重启后好了”不是可关闭的问题结论。