资讯动态

keep 三步跑起来:开源 AIOps 告警管理平台实战入门

发布时间:2026/9/14 15:56:04 来源:尧图企业网站定制
keep 三步跑起来开源 AIOps 告警管理平台实战入门【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep凌晨两点数据库磁盘告警先炸几分钟后依赖它的十几个服务接连变红手机震个不停团队群里刷出几十条重复通知。这就是运维口中的告警风暴真问题被噪音淹没值班的人只想知道到底该先修哪个。keep 是一个开源的 AIOps 告警管理平台把散落在各监控工具里的告警拉进一个统一视图做去重、关联分析再交给自动化工作流处理。这篇文章带你从部署到写出第一个工作流一次走通。功能概览开源 AIOps 平台的三大核心能力keep 的源码把这三件事放在了最显眼的位置也正好对应告警管理的三个老问题能力解决的痛点统一告警视图Prometheus、Datadog、Grafana 的告警各在一处切了七八个标签页才知道全局告警去重与关联同一个故障刷出几十条通知团队在重复劳动里消耗殆尽工作流自动化收到告警后查数据、建工单、发通知全靠手点慢且容易漏统一视图不只是把告警堆在一个页面。列表支持按来源、严重级别、状态多维筛选告警可以富化往告警上挂工单号、负责人等自定义字段也可以抑制、忽略、批量处理。去重分两种模式部分去重按你指定的指纹字段如 service、alertname把同类告警归组完整去重则直接丢弃字段完全一致的重复事件防止系统被同一条告警刷爆。每个已接入的 Provider 都自带一套预置去重规则开箱即用规则细节见 docs/overview/deduplication.mdx。3 条命令跑起来keep 部署教程keep 官方推荐用 Docker Compose 起本地环境一条命令拉起 UI、后端 API 和 Redis不需要提前准备数据库git clone https://gitcode.com/GitHub_Trending/kee/keep cd keep docker compose up -d容器起来后有两个入口浏览器访问http://localhost:3000进入 Web 界面也就是上面的告警列表页面8080 端口是后端 REST API工作流里调用第三方工具、外部系统回传告警都走它。如果容器起了一半报错九成是端口被占用docker compose ps看一下状态再改端口即可。接入 Prometheus 数据源推还是拉数据源在 keep 里叫Provider本质是一段可扩展的 Python 代码负责和第三方工具双向通信。接 Prometheus 有两条路官方明确推荐第一条Push推送推荐在 Provider 设置里勾选 Install Webhookkeep 会自动在 Prometheus Alertmanager 侧配置 webhook 推送。告警产生即送达只有这条路径能触发工作流实时性也是最好的。Pull拉取keep 定时从 Prometheus 拉历史告警拉取间隔由环境变量KEEP_PULL_INTERVAL控制默认 7 天窗口。适合先把存量告警灌进来看看但不带工作流能力。实操要点先到 Providers 页面安装 Prometheus Provider 并填好地址再勾上推送选项。验证是否成功很简单——故意让一条up 0的探针规则触发看告警列表里有没有出现新记录。写第一个告警工作流触发、动作、通知工作流是 keep 的另一半灵魂官方把它叫监控工具的 GitHub Actions。用 YAML 声明三个要素triggers触发定义什么时候跑steps步骤负责查数据做富化actions动作执行具体操作。拿电商订单指标举个完整的例子触发监听一条特定告警条件是来源为 Prometheus、severity为 critical、service匹配order相关服务——只有下单链路挂了才会醒半夜的磁盘 80% 告警不会惊动人。动作先跑一个 step 从数据库查该服务最近 10 分钟的订单失败率作为上下文挂到告警上富化再根据条件判断失败率超过阈值就调 Jira Provider 建一张 oncall 工单并把工单号回写到告警字段方便在列表里直接点过去。通知最后一个 action 走 Slack Provider 把告警摘要和工单链接发到值班群消息里用模板变量引用告警名、失败率、工单 URL。整条链路没有写一行脚本全在声明式 YAML 里完成支持if条件分支和foreach循环。仓库 examples/workflows/ 目录里有一百多个可直接改用的样例从发 Slack 消息到自动关单都有先抄一个再改比从零写快得多。AI 关联分析根因定位不再靠猜风暴来的时候最值钱的问题是这一堆告警根因是哪个。keep 的 AI 关联引擎拿历史告警做训练数据周期性地把未归类的告警自动聚类、挂进对应的事件incident置信度超过阈值即合入值班的人打开事件页就能看到按根因归组后的告警集合而不是几十个平铺的条目。⚠️ 注意AI 关联目前只在 Cloud 和 Enterprise 版本开放开源版可用规则式关联correlation rules达到类似效果。生产上线清单高可用、持久化与安全单机 Compose 只适合验证价值上生产前把这三件事做掉高可用用 docs/deployment/ 下的 Kubernetes 或 AWS ECS 方案部署API 与 UI 多副本横向扩展任务队列走 Redis单点挂了不影响告警接收。数据持久化接入 MySQL/PostgreSQL 存储告警与事件避免重启丢数据配置好数据备份AIOps 的模型质量完全依赖历史告警的完整性。安全与访问控制启用认证支持 SSO、SAML、OIDC、LDAP 等方案见 docs/deployment/authentication/配好 RBAC 权限控制谁能改工作流、谁能抑制告警Web 入口只经反向代理对外8080 API 不直接暴露公网。keep 的迭代节奏很快预测性告警、事件自愈这些能力还在路线图上值得定期翻一下版本记录。三个入口放这里接着往下读项目说明与集成清单README.md版本更新记录CHANGELOG.md工作流完整语法文档docs/workflows/overview.mdx【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价