feat/monitoring-foundation
main
现有监控缺少 Kubernetes 对象状态、主机/ZFS 和 Telegram 投递失败告警。新增固定 chart 8.5.0 / kube-state-metrics 2.20.0 的 Flux HelmRelease,限制为所需资源的只读 collector/RBAC,并通过 ServiceMonitor 接入现有 VictoriaMetrics。
新增 21 条规则:集群状态 11 条、主机/ZFS 5 条、采集及通知链路 5 条。设置 1–15 分钟持续时间,忽略临时文件系统和重复 docker-hosts 主机指标;同容器 CrashLoop 抑制重复重启通知。保留现有告警路由与 etcd 规则。
NATS 的已有 PodMonitor 曾因 Operator 早于 CRD 启动而未转换;本次滚动重启 Operator 后已生成 VMPodScrape,:7777 target up。增加 Operator 对 prometheus-operator-crds 的 HelmRelease 依赖,约束首次部署顺序,不重启 NATS。
验证:21 条规则通过 promtool 3.5.0 检查,8 组语义测试通过(ZFS 零值、降级持续时间、重复 job、临时文件系统、滚动/缩零、目标消失、历史 OOM、Telegram 多原因合并)。Helm/Kustomize 渲染、amtool 配置检查与 server dry-run 通过。合并后核对当前样本、加载规则、评估错误,并通过临时 canary 验证 VMAlert 到 Telegram 的触发/恢复。
已知持续异常可能在 for 到期后通知。Telegram 完全中断时仍无法依靠同渠道发出自身故障告警,集群外心跳不在本批范围。运维文档同步 homelab-wiki。
No dependencies set.
The note is not visible to the blocked user.
现有监控缺少 Kubernetes 对象状态、主机/ZFS 和 Telegram 投递失败告警。新增固定 chart 8.5.0 / kube-state-metrics 2.20.0 的 Flux HelmRelease,限制为所需资源的只读 collector/RBAC,并通过 ServiceMonitor 接入现有 VictoriaMetrics。
新增 21 条规则:集群状态 11 条、主机/ZFS 5 条、采集及通知链路 5 条。设置 1–15 分钟持续时间,忽略临时文件系统和重复 docker-hosts 主机指标;同容器 CrashLoop 抑制重复重启通知。保留现有告警路由与 etcd 规则。
NATS 的已有 PodMonitor 曾因 Operator 早于 CRD 启动而未转换;本次滚动重启 Operator 后已生成 VMPodScrape,:7777 target up。增加 Operator 对 prometheus-operator-crds 的 HelmRelease 依赖,约束首次部署顺序,不重启 NATS。
验证:21 条规则通过 promtool 3.5.0 检查,8 组语义测试通过(ZFS 零值、降级持续时间、重复 job、临时文件系统、滚动/缩零、目标消失、历史 OOM、Telegram 多原因合并)。Helm/Kustomize 渲染、amtool 配置检查与 server dry-run 通过。合并后核对当前样本、加载规则、评估错误,并通过临时 canary 验证 VMAlert 到 Telegram 的触发/恢复。
已知持续异常可能在 for 到期后通知。Telegram 完全中断时仍无法依靠同渠道发出自身故障告警,集群外心跳不在本批范围。运维文档同步 homelab-wiki。