给每个指标都挂上阈值
系统上线初期团队本着"宁可多报不可漏报"的心态给每个指标都挂上阈值 CPU超过7
告警的价值不取决于发了多少条而取决于收到的人是否还愿意看
先说清本页判断
补足为什么
留下下一步
系统上线初期团队本着"宁可多报不可漏报"的心态给每个指标都挂上阈值 CPU超过7
大部分告警指向的是不需要立即处理的状态——CPU冲高两分钟又回落某个边缘接口偶发超时 夜间批处理任务
混淆这两者是疲劳的根源——把应该躺在仪表盘里的东西推送到了人的面前
判断一条告警该不该存在只需要一个问题收到它的人需要立即做什么
用户已经受影响的问题 一条都不能漏
把所有告警塞进同一个通道用同一种方式推送等于宣布所有问题同等重要——而"全都
先说清本页判断
补足为什么
留下下一步
分级之后 推送通道也要随之分开最高级走独立的强提醒通道绝不和普通消息混在同一个群里——否则
先说清本页判断
补足为什么
留下下一步
从真实任务开始
把想法变成可处理内容
用结果判断能力
把完成沉淀为流程