+3
-1
@@ -16,6 +16,7 @@ last_verified: null
|
||||
2026-09-25 的通知链路与采集故障验证范围见下文。
|
||||
|
||||
整体接入范围、已确认盲点和补齐顺序见 [监控覆盖与补齐计划](../guides/monitoring-coverage.md)。
|
||||
第一批已接入的规则、阈值、静默和排障方法见 [基础监控与告警运维](../guides/monitoring-foundation.md)。
|
||||
|
||||
## 先看主机内存与 Swap
|
||||
|
||||
@@ -95,7 +96,8 @@ VictoriaLogs 使用 LogsQL。上述 limit 限制返回数量,不保证返回
|
||||
- critical 首次分组等待 10 秒,未恢复每小时提醒;warning 等待 1 分钟,
|
||||
未恢复每 4 小时提醒。分组键为 `alertname, cluster, job, severity`,
|
||||
组内变更通知间隔 5 分钟;两类均发送恢复通知。info、缺失或其他 severity 暂不推送。
|
||||
- 采用 Alertmanager 默认 Telegram 消息模板;本次没有新增抑制规则。
|
||||
- 采用 Alertmanager 默认 Telegram 消息模板;同容器 CrashLoop 抑制重复重启通知,
|
||||
具体匹配范围见基础监控运维指南。
|
||||
|
||||
配置变更通过既有 Flux 流程发布,先确认 ExternalSecret Ready 和目标 Secret
|
||||
投射成功,再确认 Alertmanager 加载配置及到 Telegram API 的出站网络。
|
||||
|
||||
+8
-1
@@ -2,7 +2,7 @@
|
||||
title: NATS
|
||||
lifecycle: active
|
||||
evidence: documented
|
||||
last_reviewed: 2026-09-16
|
||||
last_reviewed: 2026-09-25
|
||||
last_verified: null
|
||||
sources:
|
||||
- 维护者于 2026-09-16 提供的部署与消费者说明
|
||||
@@ -40,3 +40,10 @@ Dynamic Runner 的 stream、subject、durable 名称、worker 配置和具体启
|
||||
|
||||
知识库只保留[Dynamic Runner 的用途与职责边界](gitea-dynamic-runner.md)。
|
||||
涉及 runner 的实际配置和实现进度时,先按项目文档接续工作;需要扩大查询范围时再向维护者确认。
|
||||
|
||||
## 指标与告警
|
||||
|
||||
2026-09-25 已现场确认既有 :7777 prom-exporter 经 PodMonitor → VMPodScrape 接入中央采集,
|
||||
job 为 `nats/nats`,target up 且 nats_* 指标有当前样本。已有采集不可用/整个 job 消失告警;
|
||||
JetStream 容量、consumer 积压等业务规则仍待第二批。
|
||||
转换器故障处理与验证依据见 [基础监控运维](../guides/monitoring-foundation.md#nats-转换故障经验)。
|
||||
|
||||
Reference in New Issue
Block a user