ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Keep 告警管理平台实战指南:5分钟跑起来并接入第一个监控源

2026/9/14 17:21:51 拓冰建站 浏览量
Keep 告警管理平台实战指南:5分钟跑起来并接入第一个监控源 Keep 告警管理平台实战指南5分钟跑起来并接入第一个监控源【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep凌晨三点你被同一场数据库故障的第 37 条重复告警吵醒——同一个问题被 Datadog、Grafana、CloudWatch 各报了一遍。Keep 是一个开源的 AIOps 告警管理平台把各监控工具的告警收进同一张表去重、富化、关联、自动化处理。一图看懂 Keep 是什么Keep 部署在你的监控工具和 oncall 之间。它从 100 个工具拉取或接收告警把同一件事压成一条记录再按你写好的规则自动执行动作建 Jira 单、发 Slack、改状态。适合不想买企业级 AIOps、但已被告警量淹没的团队从两个监控源到几十个都行。能力地图从告警进来到动手处理告警进来时先收口再去重告警有两种进法Push勾选Install WebhookKeep 自动在你的监控工具里建 webhook 通道官方强烈推荐和 Pull按KEEP_PULL_INTERVAL定时拉取默认 7 天主要用来快速看数据。告警落库后先走富化再去重每个 provider 都预置了指纹字段fingerprint fields的去重规则同服务同错误的 firing/resolved 会合并成一条再叠一层全量去重完全相同的重复事件直接丢弃。需要上下文时拓扑 AI 关联单看一条告警很难判断影响面。Keep 把各 provider 上报的服务与依赖关系聚合成一张服务拓扑图Grafana、Kubernetes、Cilium 等 provider 都能贡献数据故障沿依赖路径的传播一眼可见。AI 关联则进一步把时间上相关、服务上相邻的一批告警归到同一事件下减少逐个告警排查。需要动手处理时工作流 事件管理告警确认后处理动作不该靠人肉。工作流后面单独讲负责自动化incident 管理把多条告警升级为一个事件带时间线和协作信息。跑起来3 行命令的最小路径git clone https://gitcode.com/GitHub_Trending/kee/keep cd keep docker compose up -d等几十秒后浏览器打开http://localhost:3000。默认 compose 是AUTH_TYPENO_AUTH免登录直接用开启 DB 认证时默认账号是keep/keepKEEP_DEFAULT_USERNAME/KEEP_DEFAULT_PASSWORD登录完第一件事是改密码。数据落在本地./state目录的 SQLite 文件里。接入第一个数据源以 Grafana 为例选 Grafana 是因为大多数团队都有它且它演示了 Push 的完整闭环Grafana 里建 Service Account授予alerting权限生成一个 Token。Keep 的 Providers 页添加 Grafana provider把 Token 填进authentication段勾选Install Webhook。Keep 会反过来在 Grafana 里自动创建keep-grafana-webhook-integration这个 contact point 和对应的 notification policy——你不用手写 webhook 配置。验证在 Grafana 的 Contact Points 里找到该集成点点 Test然后回 Keep 的告警列表应该能看到这条测试告警。其他 100 工具Prometheus、Datadog、CloudWatch、Zabbix……都在 keep/providers/ 下每个一个目录配置方式一致。值得深入的两件事用 YAML 写告警工作流工作流是 Keep 差异化的核心官方说法是监控工具的 GitHub Actions声明式 YAML由 triggers什么时候跑、steps读数据/富化、actions执行操作三段组成支持if条件、foreach循环、CEL 表达式动作结果还能回写富化到告警上比如把 Jira 单号挂回告警。workflow: id: payment-critical-alerts description: critical 告警来自 payment 服务时通知 Slack triggers: - type: alert filters: - key: service value: payment - key: severity value: critical actions: - name: notify-slack provider: type: slack with: message: payment 出 critical 了{{ alert.name }} - {{ alert.description }}工作流引擎源码在 keep/workflowmanager/完整语法和 100 可运行示例在 examples/workflows/。AI 关联与 AI 工作流助手关联分析、告警摘要、自然语言建工作流这些 AI 能力都走 LLM providerOpenAI、Ollama、DeepSeek 等都在支持列表里想用本地模型就换 Ollama provider。compose 部署时注入密钥即可export OPENAI_API_KEYsk-xxxx docker compose up -dAI 关联默认是半自动系统给出关联建议人确认后归并避免 LLM 误判直接改写告警归属。上生产Helm 是官方推荐的 K8s 部署方式helm repo add keephq https://keephq.github.io/helm-charts helm install keep keephq/keep -n keep --create-namespaceHA 的关键点只有一条默认 compose 用的是./state里的 SQLite 单文件生产必须把DATABASE_CONNECTION_STRING换成独立的 PostgreSQL并给 Helm chart 开启数据库持久化具体 values 项参考官方文档。两个真实场景某出行预订平台的支付团队 → 大促前压测时同一 DB 慢查询在 Datadog 和 Grafana 各触发 20 条告警 → 两个源都接入 Keep 后按 service告警名去重oncall 只面对一条带最新状态的主记录 → 排查路径从切 4 个平台变成看一张表。某 SaaS 团队的 oncall → 测试环境的告警每晚混进值班群 → 建一个工作流只把environment: production的告警转发 Slack其余留在告警表里备查 → 测试噪音不再触发电话。避坑速查症状原因处理webhook 建了但告警到不了 Keep监控工具访问不到 Keep 后端内网/防火墙检查网络连通性或该 provider 改用 Pull 模式历史告警缺失、更新滞后Pull 默认间隔是 7 天KEEP_PULL_INTERVAL单位分钟改 Push 模式或调小该值告警量上来后响应变慢默认 SQLite 单文件库无横向扩展能力换 PostgreSQL改DATABASE_CONNECTION_STRING下一步docs/overview/introduction.mdx官方入门文档AIOps 概念和术语表都在这examples/workflows/100 个工作流 YAML改改参数就能用CONTRIBUTING.md贡献指南报 bug 和提 provider 需求先看这里写在最后现在就可以做的事clone 下来docker compose up -d把你的 Prometheus 或 Grafana 接进去看今晚的告警能压剩几条。值得留在技术栈里的理由是它是开源的告警数据、去重规则、工作流全部在你手里团队规模从 3 个人到 300 个人都不需要换平台。【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考