深色模式
后台监控与历史趋势
Reeve 有两条互不相干的监控链路:一条给你「现在看」,一条给「回头查 + 告警判定」。分清楚这两条,才不会奇怪「为什么关了窗口就没数据」。
两条链路
| 工作台实时流 | 后台监控哨兵 | |
|---|---|---|
| 频率 | 约 2 秒一拍 | 默认 60 秒一拍(可调) |
| 何时跑 | 你正打开工作台概览页时 | 常驻后台,关掉窗口也继续采 |
| 数据去向 | 只在界面上滚动,不落库 | 落 metrics_history 表 |
| 用途 | 盯现场、看瞬时波动 | 历史趋势 + 告警判定 |
| 默认 | 打开页面即有 | 默认关闭,需逐台开启 |
后台监控是告警的前提
告警规则判定的是哨兵采集的数据。没开后台监控的机器,规则永远不会触发。
开启后台监控
[工作台] → 概览 → 顶部「后台监控」控制条:
| 项 | 说明 |
|---|---|
| 开关 | 逐台启用(不是全局一刀切) |
| 采集间隔 | 默认 60 秒 |
| 保留天数 | 超期的历史点自动清理 |
| 去配告警规则 | 一键跳告警页 |
采集是低频常驻的,只对「已启用」的服务器发探针,没开的机器一点开销都没有。
历史趋势卡
概览页的「历史趋势」卡支持 1 小时 / 6 小时 / 24 小时 / 7 天四档切换,与顶部的实时 sparkline(最近约 2 分钟)互补:
- sparkline 回答「此刻在抖吗」
- 趋势卡回答「这周是不是一直在涨」
没开后台监控的机器,这张卡是空的,并给出开启引导。
采集哪些指标
CPU 使用率、内存 / Swap 使用率、磁盘使用率、1 分钟平均负载,以及「是否失联」。这几项同时也是告警可用的规则维度。
数据存哪儿
落本机 reeve.db 的 metrics_history 表,按保留天数自动清理(每小时清一次)。
不进备份
监控历史与告警事件属于观测流水,不进备份——换机后重新采就是了,没必要把体积带走。