高级可观测性仪表板
- 高级仪表板:这是可通过 Monitoring → Advanced dashboard 访问的主仪表板界面,可实时查看查询速率、资源使用情况、系统健康状态和存储性能。此仪表板无需单独身份验证,不会阻止实例进入空闲状态,也不会给生产系统带来额外的查询负载。每个可视化均由可自定义的 SQL 查询提供支持,开箱即用的图表按 ClickHouse 特定指标、系统健康指标和 Cloud 特定指标分组。你还可以直接在 SQL 控制台中创建自定义查询,以扩展监控能力。
访问这些指标不会向底层服务发起查询,也不会唤醒空闲服务。
- 原生高级仪表板:这是另一种可选的仪表板界面,可通过 Monitoring 部分中的“You can still access the native advanced dashboard”进入。它会在单独的标签页中打开,需要进行身份验证,并提供另一套用于监控系统和服务健康状态的 UI。该仪表板支持更高级的分析,你可以修改底层 SQL 查询。
Query insights 与资源监控
- Query Insights:用于分析查询性能并排查问题的内置界面
- Resource Utilization Dashboard:跟踪内存、CPU 分配和数据传输模式。CPU 使用率和内存使用量图表显示特定时间段内的最大利用率指标。CPU 使用率图表显示的是系统级 CPU 利用率指标 (而非 ClickHouse CPU 利用率指标) 。
兼容 Prometheus 的指标端点
- 过滤指标选项:可选参数
filtered_metrics=true可将 1000+ 个可用指标的载荷缩减为 125 个“关键”指标,从而优化成本,并让监控重点更清晰 - 缓存指标提供:使用每分钟刷新的 materialized view,以尽量降低生产系统上的查询负载
这种方式兼容服务的空闲行为,因此在服务未主动处理查询时可进一步优化成本。此 API 端点依赖 ClickHouse Cloud API 凭证。有关完整的端点配置详情,请参阅云端 Prometheus 文档。
集成示例
Grafana Cloud 监控
Datadog 监控
ClickStack
请注意,由于 HyperDX 会直接查询系统表,这种方式会唤醒空闲服务。
ClickStack 部署选项
- ClickHouse Cloud 中的 HyperDX (私有预览) :可在任何 ClickHouse Cloud 服务上运行 HyperDX。
- Helm:推荐用于基于 Kubernetes 的调试环境。支持与 ClickHouse Cloud 集成,并允许通过
values.yaml进行环境特定的配置、资源限制和扩缩容。 - Docker Compose:分别部署各个组件 (ClickHouse、HyperDX、OTel collector、MongoDB) 。与 ClickHouse Cloud 集成时,你可以修改 compose 文件,移除任何未使用的组件,尤其是 ClickHouse 和 OpenTelemetry Collector。
- 仅 HyperDX:独立的 HyperDX 容器。
你还可以通过 OpenTelemetry Collector 从 ClickHouse Cloud 的 Prometheus 端点收集指标,并将其转发到单独的 ClickStack 部署中进行可视化。
直接集成 Grafana 插件
Datadog 直接集成
clusterAllReplicas 功能提供具备集群感知能力的全面数据库监控。
由于该集成与为优化成本而设计的空闲机制以及 Cloud proxy 层的运行限制不兼容,因此不建议在 ClickHouse Cloud 部署中使用。
直接使用系统表
system.query_log,以便深入分析查询性能。团队可通过 SQL 控制台或 clickhouse client 识别慢查询、分析资源使用情况,并跟踪整个组织内的使用模式。
查询性能分析
你可以使用系统表中的查询日志来进行查询性能分析。
示例查询:查找所有集群副本中耗时最长的前 5 个查询:
社区监控解决方案
与其他直接监控数据库的方法一样,该方案会直接查询 ClickHouse 系统表,这会使实例无法进入空闲状态,从而影响成本优化。