diff --git a/infrastructure/etcd/README.md b/infrastructure/etcd/README.md index 0f14960..b3b9b28 100644 --- a/infrastructure/etcd/README.md +++ b/infrastructure/etcd/README.md @@ -106,7 +106,7 @@ quota 初始 256 MiB,按 1 小时保留进行自动 compaction;defrag 另择 对应 VMRule 覆盖成员不可采集、少于两个可采集成员、无 leader、容量、WAL fsync 和频繁选举。 采集失败不等于 quorum 丢失,需结合管理员 endpoint health 判断。 备份年龄、证书到期与续签检查的主机采集已于 2026-09-27 部署, -告警规则待 [PR #166](https://git.ddupan.top/panxiao81/homelab-infra/pulls/166) 合并; +告警规则已随 [PR #166](https://git.ddupan.top/panxiao81/homelab-infra/pulls/166) 合并并由 Flux 接管; 部署、阈值和排障见 [维护监控](../shared-data-monitoring/README.md)。既有 Alertmanager 已接入 Telegram, 维护者已收到本次成员无 leader 与频繁选举通知;接收器配置由现有监控栈维护。 @@ -155,7 +155,7 @@ prefix 隔离、gateway 账号登录和单成员故障。假 Bao 不验证真实 现场验证:Bao PKI roles/policies 已应用,三成员已签发证书并启动;认证初始化与 `patroni-pg-prod` 账号创建成功,随机密码已保存 Bao,实际 gateway 登录验证通过。 两台 LXC 的 rootfs 均为 `pve-rg`,运行状态正常;迁移后全部端点成功提交健康探测。 -现有监控已接入;自动续签已启用;备份/证书年龄告警尚待补齐。PostgreSQL 部署状态见其 README。 +现有监控已接入;自动续签已启用;备份/证书年龄告警于 2026-09-27 补齐并启用。PostgreSQL 部署状态见其 README。 监控接入验收(2026-09-25):三个 `up{job="shared-etcd"}` 均为 1,六条规则 health=ok, 三端点健康检查通过。新增续签调度四项失败/成功路径测试通过,Terraform validate 与 Ansible lint 通过, diff --git a/infrastructure/shared-data-monitoring/README.md b/infrastructure/shared-data-monitoring/README.md index eea3113..bcfa99f 100644 --- a/infrastructure/shared-data-monitoring/README.md +++ b/infrastructure/shared-data-monitoring/README.md @@ -5,7 +5,9 @@ 实现由 [PR #166](https://git.ddupan.top/panxiao81/homelab-infra/pulls/166) 发布。 2026-09-27:三个主机端已部署并验证,Ansible 重跑均 `changed=0`;vmagent Pod 能访问三个 -内网 `:9109/metrics`。抓取声明和八条规则尚待 PR 合并,不能视为已启用告警。 +内网 `:9109/metrics`。PR #166 已合并,Flux observability Ready,应用版本 `589c34e`; +PrometheusRule 与 VMStaticScrape 已进入 inventory,converter 生成的 VMRule 为 operational。 +三个抓取目标均 up=1,八条规则均 health=ok、inactive,告警已启用。 ## 采集和阈值 @@ -53,7 +55,7 @@ sudo journalctl -u homelab-data-collect.service --since '2 hours ago' ``` 主机端 `check_success` 应全为 1、`dev_sql_ready=1`,`node_textfile_scrape_error=0`。 -合并后检查 `up{job="shared-data-maintenance"}` 三个目标及 `shared-data-maintenance` 规则组。 +日常检查 `up{job="shared-data-maintenance"}` 三个目标及 `shared-data-maintenance` 规则组。 告警声明使用 `monitoring.coreos.com/v1` 的 `PrometheusRule`,由现有 converter 生成 VMRule; 静态主机抓取使用 VMStaticScrape。Kubernetes 资源由现有 observability Kustomization 纳管; 主机端由此 Ansible 独立维护。 diff --git a/infrastructure/shared-postgresql/README.md b/infrastructure/shared-postgresql/README.md index 32cab3e..3992696 100644 --- a/infrastructure/shared-postgresql/README.md +++ b/infrastructure/shared-postgresql/README.md @@ -98,7 +98,7 @@ Ayatori 角色,随后停库清理;不覆盖生产 PGDATA。全站恢复及 现有 VictoriaMetrics/Alertmanager 已采集生产两节点 Patroni 原生指标,规则位于 `platform/observability/metrics/{scrapes,rules}/shared-postgresql.yaml`。覆盖成员不可采集、无可见主库、 多主、replica 未流复制及 PG 进程停止。没有部署另一套监控栈;数据库 SQL 级 exporter 仍后置。dev SQL、备份年龄、证书和续签检查的主机采集已于 2026-09-27 部署, -新增规则待 [PR #166](https://git.ddupan.top/panxiao81/homelab-infra/pulls/166) 合并; +新增规则已随 [PR #166](https://git.ddupan.top/panxiao81/homelab-infra/pulls/166) 合并并由 Flux 接管; 阈值、验证边界和排障见 [维护监控](../shared-data-monitoring/README.md)。 2026-09-25 已验证: