资讯动态

从告警风暴到一张工单:Keep开源告警管理平台15分钟上手

发布时间:2026/9/19 23:57:35 来源:尧图企业网站定制
从告警风暴到一张工单Keep开源告警管理平台15分钟上手【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep值班那晚你收到了多少条告警数据库连接池耗尽5分钟内通知刷屏等翻到监控面板真正的故障早被噪音埋掉了。Keep 就是一个开源的 AIOps 和告警管理平台专门解决这件事把多来源的告警收到一个地方再做去重、富集、关联、事件归拢和自动化工作流。适合值班 SRE 和运维团队评估使用。一句话看懂 KeepKeep 是一个告警聚合处理层。它自己不收指标、不跑告警规则这些活由 Prometheus、Datadog 们干它接手的是告警产生之后的事聚合、去重、关联、成事件、跑工作流。工具定位和 Keep 的关系Prometheus指标采集、告警规则评估Keep 的上游提供告警源Alertmanager告警路由、静默、升级处理 Prometheus 告警Keep 可再接下游做跨源聚合Keep告警聚合、去重关联、事件与工作流不替代上游只把多源告警收到一处一句话你的告警来自多个系统、多个渠道需要统一视图和自动化Keep 就有用武之地。它的集成全部走 Provider 插件机制代码在 keep/providers/内置了上百个监控工具与通知渠道。它真正帮你处理的四类场景告警降噪让同一告警别再每分钟弹一次痛点一台坏机器每 30 秒报一次CPU 高值班被吵醒十几遍。 操作Keep 的去重规则基于指纹字段每个 Provider 出厂就带一条预置的部分去重规则按服务、告警名等字段把告警归组你也可以自己加规则。 效果同一告警只保留一条后续重复只更新状态通知量直接降下来。关联分析把几百条告警拢成一个事件痛点网关一挂上下游几百条告警同时炸分不清谁是根因。 操作可以写手动关联规则用告警属性做条件、AND/OR 组合命中就生成 incident也可以开 AI 关联未归属告警的置信度超过阈值会自动聚类成事件。 效果排障先看事件再看告警明细值班入口就一个。自动响应把值班动作变成工作流痛点建工单、负责人、通知值班群每次都是手动复制粘贴。 操作工作流用 YAML 定义就三块——triggers何时跑、steps先查什么、actions做什么。 效果告警一到工单自动建好、人自动被叫上人只负责判断。多渠道通知别让各系统各发各的痛点Datadog、Prometheus 各发各的渠道出事了逐台翻。 操作Provider 连上之后Keep 可以经由这些渠道发通知Slack、Teams、邮件、PagerDuty 等不少 Provider 还支持状态回写比如 Keep 里关掉告警源系统里对应告警同步关闭。 效果通知统一出口团队看到的是同一份事件视图。Keep快速安装15分钟拿到第一条告警第一步拉代码启动git clone https://gitcode.com/GitHub_Trending/kee/keep cd keep docker compose up -dcompose 里有三个服务keep-backendFastAPI8080 端口、keep-frontend网页界面3000 端口、keep-websocket-server实时推送。默认数据库是 SQLite数据都落在 ./state 目录。第二步打开 http://localhost:3000 在 Providers 页添加第一个数据源比如 Prometheus再把告警通道指到 Keep 的告警接口或让它定期从源系统拉告警。第三步验证第一条告警curl -X POST http://localhost:8080/alerts \ -H Content-Type: application/json \ -d {name:Disk almost full,severity:critical,source:[prometheus]}刷新页面测试告警就躺在列表里了。想看看工作流长什么样翻 examples/workflows/ 里的官方样例从最简单的 console 打印例子开始看。⚠️ 最值得改的3个配置去重、关联阈值、工作流1. 去重规则默认每个 Provider 自带预置的部分去重规则指纹字段写在各 Provider 里同时默认开启全量去重——完全相同的事件lastReceived 除外直接丢弃不进列表。 什么时候改发现同一告警还被拆成多条就往规则里加 host、service 等指纹字段发现两个不同告警被并成一条就把指纹字段收窄。 坑在哪全量去重时忽略字段别配太狠忽略得越多越容易把不同的东西并掉配得越松噪音越清不干净。2. 关联阈值默认手动规则按你写的条件命中即成事件AI 关联有一道置信度阈值聚类分数超过阈值才会自动并入事件。 什么时候改自动生成太多待确认事件就调高阈值相关告警总被拆散就调低。 坑在哪AI 关联依赖大模型需要配置 LLM 密钥不配就用不了还要留一点 token 成本预算。3. 工作流默认一个都没有告警只会躺在列表里。 什么时候改出现重复动作就动手先写最小工作流——告警触发一个 console 打印确认触发链路通了再加步骤。 坑在哪工作流里的 Provider 和 Providers 页是同一套Provider 没配好工作流只是静默失败得去执行日志里找原因。选型与避坑什么场景不值得引适合监控工具多、告警量大、噪音高想要统一事件视图和自动化流程的团队。 不适合只有一套 PrometheusAlertmanager 的路由静默够用——Keep 的价值在多源聚合单源引它属于杀鸡用牛刀。坑说明裸奔暴露公网默认 docker-compose.yml 是 NO_AUTH无任何鉴权生产请用 docker-compose-with-auth.yml当 Prometheus 替代品它不收指标、不评规则只处理告警上游监控还是得留着忘了备份 state 目录默认 SQLite 加本地文件规则、Provider 配置、告警历史全在 ./state丢了就全没了没配 LLM 密钥AI 关联、摘要类功能依赖外部模型不配就只有手动规则可用部署细节、Provider 清单、工作流语法都在 docs/ 目录里按主题分好了。去哪找帮助Keep 的意义是把处理告警从人肉值班变成规则与工作流自动化。建议走最短路径先跑起来、接一个数据源、配一条去重规则噪音真降了再逐步铺工作流。有问题先查 官方文档看 Provider插件目录 找现成集成还不行就在仓库里提 issue。后续方向上Provider 覆盖和 AI 能力关联、摘要、工作流助手仍在开源代码里持续扩充留意版本更新即可。【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价