跳到主要内容

概述

运维平台是服务私有部署版本的一体化监控诊断系统,面向 HAP/HDP 私有化环境提供 指标、日志、链路 三大可观测性能力与 智能告警。运维平台以旁路方式接入被监控目标,不改动业务系统,不采集业务数据,帮助运维团队在内网环境中统一查看基础设施、中间件、容器、Kubernetes 集群与业务微服务的运行状态。

运维平台重点解决以下问题:

  • 统一监控入口:集中查看主机资源、中间件性能、Kubernetes 对象状态、Flink 运行状态与服务日志。
  • 故障定位闭环:通过指标、日志、链路和慢查询诊断关联排查,减少在多套工具之间切换。
  • 告警收敛:内置告警规则、状态降噪、通知渠道和告警历史,支持从异常发现到恢复确认的完整流程。
  • 私有化交付:运维平台自身支持 Docker Compose 单机部署与 Kubernetes 集群部署,通常与被服务的 HAP/HDP 部署形态保持一致,数据默认保留在客户内网环境。

功能一览

运维平台概览

模块能力文档
概览系统健康度、监控任务统计、活跃告警与近 24 小时告警动态本页
资源监控主机、MySQL/MongoDB/Redis/Kafka/Elasticsearch 中间件、Kubernetes 集群、Flink 的可视化面板资源监控
告警七类场景原生告警规则,内置降噪,多渠道通知告警规则
日志基于 Loki 的容器日志与微服务结构化日志检索日志查询
链路追踪(仅集群部署)基于 Tempo 的分布式调用链分析(请求量/错误率/延迟/瀑布图)。单机部署不具备该能力链路追踪
慢查询诊断MongoDB 慢查询自动分析与索引优化建议MongoDB 慢查询分析
Kubernetes 监控:运维平台部署在 HAP/HDP Kubernetes 集群内时自动采集

运维平台以 Kubernetes 形态部署时,通常复用现有的 HAP/HDP Kubernetes 集群;此时自带的 Prometheus 直接采集该集群(ENV_K8S_MONITOR_MODE=incluster), 经 ServiceAccount 自动发现,无需 Token 与 NodePort,部署后自动采集数据

运维平台未部署在目标 HAP/HDP Kubernetes 集群内(如运维平台为单机部署),或需要同时监控多个 Kubernetes 集群时,在每个被监控集群里部署一套采集组件, 指标经 remote_write 推回运维平台——只要求被监控集群能出站访问运维平台。 见 Kubernetes 集群监控

技术架构

运维平台以 Prometheus + Grafana 为核心构建指标与可视化能力,并集成 Loki(日志聚合)、Tempo(分布式链路)、Grafana Alloy(统一采集代理),将指标、日志、链路汇聚到 Grafana 统一查询:

监控架构

数据流向:

  • 指标:node_exporter(主机)、各中间件 exporter、kube-state-metrics(Kubernetes 对象)被 Prometheus 抓取存储。
  • 日志:容器 stdout 由 Alloy 采集、微服务日志由 serilog 直推,统一进入 Loki。
  • 链路:应用通过 OTLP 上报到 Alloy,转发进 Tempo。
  • 展示与告警:Grafana 统一读取上述数据源出图;运维平台自研告警子系统独立于 Grafana,按规则周期检查并多渠道通知。

组件版本

组件版本作用
Prometheus3.1.0指标采集与存储
Grafana12.2.1统一可视化界面
Loki3.5.8日志聚合与检索
Tempo2.9.0分布式链路存储
Grafana Alloy1.11.3统一可观测性采集(容器日志/OTLP)
node_exporter1.8.2主机资源指标
kube-state-metrics2.10.1Kubernetes 集群对象状态
中间件 exporterkafka 1.6.0/elasticsearch 1.5.0/redis 1.44.0/mysqld 0.15.1/mongodb 0.42.0中间件性能指标
MongoDB4.4.28告警子系统自有存储(与被监控目标解耦)