
Keep3 步跑起来的多源警报管理完整指南【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep凌晨两点运维工程师小周被手机震醒Grafana 发来 3 条 Prometheus 告警Slack 里 Datadog 又转了 2 条看着像 5 个问题其实可能是同一台机器磁盘满了。翻到早上他也不知道哪条是真问题。这类警报看着多、真问题难找的处境就是 Keep 警报管理平台想解决的把散在各个监控工具里的警报收进同一个界面去重、关联再按规则自动处理。项目速览是什么开源的 AIOps用自动化和 AI 手段做运维与警报管理平台一个界面看全部告警给谁用被多个监控工具轰炸的小团队和 SRE/运维工程师不需要专职平台管理员最突出的点接一个数据源只配一次去重、工作流、服务关联都是内置能力部署方式docker-compose 一键拉起后端、前端、实时推送三个容器最小化上手前置条件机器上装好 Docker并且能运行docker compose。第 1 步拿到代码git clone https://gitcode.com/GitHub_Trending/kee/keep keep cd keep第 2 步启动docker compose up -d第 3 步打开浏览器访问http://localhost:3000。默认 compose 文件里AUTH_TYPENO_AUTH不用登录看到警报列表页此时是空的、Provider数据源页面和 Workflows工作流页面就算部署成功了。部署细节可以看 docs/deployment/docker.mdx。它能帮你做什么接入警报不用自己写脚本Keep 支持两种收警报的方式Push 和 Pull。Push 是监控工具主动把警报推给 KeepPull 是 Keep 定时拉取。推荐用 Push——以 Grafana 为例你在 Provider 设置里连上 Grafana 并勾选Install WebhookKeep 会自动在 Grafana 里创建一个 Webhook 联络点一种把消息发到外部地址的出口和通知策略之后 Grafana 的告警就会自动流进 Keep全程不用手写转发规则。细节见 docs/overview/howdoeskeepgetmyalerts.mdx。把一批相似警报变成一条警报风暴的大头是重复。Keep 的去重机制是指纹给每条警报按指定字段比如service和error_message算出一个指纹指纹相同的合并成一条并更新状态。比如payment服务连续 5 次报Database connection failed你在列表里只看到一条而不是 5 条。每个 Provider 都预置了适配其警报格式的默认指纹字段开箱就能用也可以自己改。官方文档里有一组真实的输入输出对照建议看一眼docs/overview/deduplication.mdx。警报一进来就自动干活工作流用 YAML 定义triggers写什么条件触发actions写触发后干什么。仓库里带了 100 多个现成例子比如 examples/workflows/ 里的 CloudWatch 转发 Slack 通知器核心逻辑就几行triggers: - type: alert filters: - key: source value: cloudwatch actions: - name: trigger-slack provider: type: slack with: message: Got alarm from aws cloudwatch! {{ alert.name }}类似的还有自动建 Jira 工单、给 OpenShift 扩容、给已恢复的旧警报发 resolve 等按需挑一个改改就能用。端到端实战一条警报从进到出挑最典型的链路走一遍接源 → 警报进来 → 工作流自动通知。配置打开http://localhost:3000的 Providers 页面连接一个警报源如 Prometheus、CloudWatch 或 Webhook勾选 Push等待状态变为健康。触发源端产生一条告警它经 Webhook 到达 Keep 后端在警报列表页实时出现同一问题的重复告警会被合并计数而不是刷屏。看到结果你在 Workflows 页面新建或导入一个 YAML参考上面的 Slack 例子点 Enable。下次同类警报进来Keep 自动完成动作——Slack 频道里出现格式化消息全程没人碰鼠标。工作原理警报是怎么被看懂的Keep 处理警报的核心思路像电房的总闸检修一栋楼一半区域的灯同时灭了电工不会挨个换灯泡而是先看哪个总闸跳了——灯泡只是症状总闸才是根因。去重对应先别慌指纹相同的警报归成一类先把噪音压下去人只看类别不看流水。关联对应找总闸Keep 的服务拓扑处理器默认关闭设置KEEP_TOPOLOGY_PROCESSORtrue开启会维护一张服务依赖图当同一应用下的多个服务同时有活动警报时自动开一个应用级事件Incident把相关警报挂进去。你排查时看的是哪个应用出了问题而不是哪台机器又报警了。此外 Keep 还支持接 LLM大语言模型Provider 做警报内容增强比如把原始警报让 AI 总结成人话再推送属于可选能力。资源导航名称位置说明项目介绍docs/overview/introduction.mdxKeep 解决什么问题、适合什么团队部署文档docs/deployment/Docker、Kubernetes 等多种部署方式工作流语法docs/workflows/overview.mdx触发器、动作、条件分支的完整写法现成工作流examples/workflows/100 多个可直接改用的 YAML 示例Provider 列表docs/providers/overview.mdx支持接入的全部监控与协作工具下一步如果你的团队也在多个监控工具之间来回切建议先在一台测试机上按最小化上手三步把 Keep 跑起来接一个你现在用得最多的警报源观察一两周警报列表比之前清爽多少再决定要不要把工作流铺开。【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考