使用 Grafana 信息中心监控 Spanner Omni

使用 Grafana 信息中心监控 Spanner Omni 部署的健康状况和性能。这些信息中心可直观呈现提取到 Prometheus 中的 Spanner Omni 指标,从而全面深入地了解部署的运行状态。您可以直观了解整体系统健康状况、资源消耗情况和关键内部流程。

信息中心清单

下表简要总结了可用的信息中心:

信息中心 关键指标 主要用途
概览 QPS、延迟时间、吞吐量 监控高级别部署性能,包括每秒查询次数 (QPS)、请求延迟时间和数据吞吐量。
系统数据分析 CPU,内存,锁定等待时间 重点关注所选数据库的数据库级资源消耗和健康状况(例如 CPU、内存和锁定等待时间)。
部署分析 CPU、内存和网络利用率 提供有关整体部署资源消耗和网络统计信息的详细洞见。
Spanner Omni 文件系统 文件操作、延迟时间和吞吐量 监控底层文件系统操作、性能、延迟时间和吞吐量。
gRPC RPC 数量、状态和延迟时间 跟踪服务器端和客户端通信的详细 RPC 统计信息。
压缩 压缩成功率和失败率、压缩延迟时间 直观呈现后台数据维护效果,重点关注压缩成功率和失败率以及压缩延迟。
拆分、合并和移动 拆分、合并和移动次数;群组大小 监控数据的动态分布,包括目录操作(拆分、合并和移动)、数据组大小和潜在的热点。
平板电脑 平板电脑数量、负载分布 深入了解平板电脑统计信息、操作和负载分布,并识别潜在的热点。
TrueTime 漂移、不确定性、违反服务等级协议 (SLA) 监控 Spanner Omni TrueTime 服务的健康状况和可靠性,包括漂移、不确定性和 SLA 违规情况。
共享日志 写入速率、排序错误率 监控共享日志性能,特别是写入速率和排序错误率。

以下是信息中心内提供的一些图表:

  • 计算容量 (vCPU):部署中预配的 vCPUs 总数。

  • 内存容量:部署中预配的物理内存总容量。

  • 存储空间容量:文件系统的总存储空间容量和可用存储空间容量。

  • 节点状态:跟踪部署中服务器的总数和不健康服务器的数量。

  • 计算利用率:已使用的总 vCPU 容量所占的百分比。

  • 内存利用率:整个部署的内存用量总计。由于 Spanner Omni 会将空闲内存用于缓存,因此预期用量会很高。

  • 存储空间利用率:已用存储空间占总存储空间容量的百分比。

  • 每个 vCPU 的已用存储空间:已用存储空间总数与 vCPU 总数的比率。

  • 服务器:一个详细的表格,显示了每个服务器和每个可用区的指标,包括 CPU 利用率、内存利用率、正常运行时间、总 vCPU、总内存、已用存储空间和存储空间容量。

系统分析洞见信息中心

系统分析洞见信息中心侧重于部署中数据库的健康状况和性能。此信息中心包含以下图表:

  • CPU 利用率概览:所选服务器的数据库总体 CPU 利用率汇总。

  • 按用户和系统划分的 CPU 利用率:所选数据库中 CPU 的利用率,按用户和系统任务以及优先级分组。

  • 按操作类型划分的 CPU 利用率:所选数据库的 CPU 利用率,按操作类型分组,并针对所选服务器进行汇总。

  • 按操作类型划分的 CPU 利用率 - 高优先级:CPU 的利用率,按操作类型分组,按高优先级过滤,针对所选数据库在所选服务器上进行汇总。

  • 按操作类型划分的 CPU 利用率 - 中优先级:CPU 的利用率,按操作类型分组,并按中优先级过滤,针对所选数据库在所选服务器上进行汇总。

  • 按操作类型划分的 CPU 利用率 - 低优先级:CPU 的利用率,按操作类型分组,并按低优先级进行过滤,适用于所选数据库(在所选服务器上汇总)。

  • 请求延迟时间(P50、P90、P99):所选数据库中的延迟时间,按所选服务器的读取和写入方法进行分组。

  • 按方法列出的请求延迟时间(P50、P90、P99):所选数据库中的延迟时间,按所选服务器中的 API 方法分组。

  • 事务延迟时间(P50、P90、P99):所选数据库中的请求延迟时间,按事务类型和所选服务器中的领导者参与情况进行分组。

  • 吞吐量:所选数据库在所选服务器中的读取和写入吞吐量。

  • 按方法划分的吞吐量:所选数据库中按方法分组的吞吐量(跨所选服务器)。

  • 每秒操作次数:所选数据库中的每秒操作次数,按所选服务器中的读取和写入方法分组。

  • 每秒操作次数(按方法):所选数据库中按方法分组的每秒操作次数(跨所选服务器)。

  • 各数据库的存储空间利用率:每个数据库使用的非复制物理字节数。每个群组的领导平板电脑都会提供此指标。一组中所有平板电脑的实际复制物理字节数可能会更高或更低,具体取决于每个平板电脑上的压缩状态,但此指标可大致了解每个数据库使用的非复制物理存储空间。

  • 锁定等待时间:所选数据库在 5 分钟间隔内的锁定冲突总锁定等待时间。

  • 事务取消率:已中止或已取消的事务的比率。当事务之间发生冲突时,取消率可能会更高。

  • 架构对象数:所选数据库的架构对象数。

  • 事务参与者:数据库中每次提交尝试的事务参与者数量的分布情况。

部署分析洞见信息中心

部署分析洞见信息中心可进一步深入了解部署资源消耗情况。此信息中心包含以下图表:

  • CPU 利用率:所选服务器的汇总 CPU 利用率。

  • 服务器 CPU 利用率:每个所选服务器的 CPU 利用率。

  • 进程 CPU 利用率:每个进程的 CPU 利用率(汇总了所选服务器的数据)。

  • 内存利用率:所选服务器的汇总内存利用率。由于 Spanner Omni 会在内存中缓存数据,因此预期值会很高,并且 Spanner Omni 可以根据需要释放内存。

  • 服务器内存利用率:每个所选服务器的内存利用率。由于 Spanner Omni 会在内存中缓存数据,因此预期值会很高,不过 Spanner Omni 可以在需要时释放内存。

  • 进程常驻内存大小:所选服务器上每个进程的常驻内存大小。

  • 进程虚拟内存大小:所选服务器上每个进程的虚拟内存大小。

  • 服务器内存细分:按类别(缓存、碎片、memtable_pinned、系统、更新、其他)汇总的所选服务器的内存利用率。此内存特定于 span_server 进程。

  • 网络发送的字节数:每个接口在所有服务器上汇总的发送字节数。

  • 网络接收的字节数:所有服务器上每个接口接收的字节数总和。

  • 按网络发送字节数排名的前 10 个服务器:按网络发送字节数排名的前 10 个服务器(表格视图)。

  • 按网络接收的字节数排名的前 10 个服务器:按网络接收的字节数排名的前 10 个服务器(表格视图)。

Spanner Omni 文件系统信息中心

Spanner Omni 文件系统信息中心会监控对性能至关重要的底层文件系统操作,包括操作速率、延迟时间和吞吐量。此信息中心包含以下图表:

  • 文件操作图:

    • 每秒操作次数:跟踪文件操作的总速率,按操作分组。

    • 每秒本地和远程操作数:跟踪文件操作速率,按本地访问与远程访问分开显示。

    • 每秒操作错误数:显示失败的文件系统操作的速率,按操作和状态分组。

  • 延迟时间图表:包含本地和远程文件操作的 P50、P90 和 P99 延迟时间图表,按操作分组。

  • 吞吐量图表:

    • 本地和远程读取和写入吞吐量:跟踪读取和写入吞吐率,按本地和远程访问分开显示。

    • 每次操作的字节数:包括本地和远程访问每次操作的 P50 和 P90 传输字节数。

  • 文件系统统计信息:

    • 按可用区划分的文件系统总大小:显示按 Spanner Omni 可用区分组的已配置文件系统总大小。

    • 按可用区划分的文件系统使用情况:显示当前已使用的文件系统大小,按 Spanner Omni 可用区分组。

gRPC 信息中心

gRPC 信息中心会跟踪部署中所有服务器的详细 RPC 统计信息。此信息中心包含以下图表:

  • 服务器端指标:从服务器的角度监控 RPC 性能。

    • 各方法的 RPC 延迟时间(P50、P90、P99):服务器端每个 RPC 方法的延迟时间。

    • 每种方法的服务器发送吞吐量:所选服务器上每种方法的每秒发送字节数。

    • Server Sent Throughput Per Process: Sent bytes per second per process for selected servers.

    • 服务器每种方法的接收吞吐量:所选服务器每种方法的每秒接收字节数。

    • 每个进程的服务器接收吞吐量:所选服务器上每个进程每秒接收的字节数。

    • 每个方法的服务器规范状态计数:所选服务器上每个方法的规范状态代码出现率。

    • 服务器上每个方法的已完成 RPC 数:所选服务器上每个方法的已完成 RPCs 比率。

    • 服务器活跃渠道:自应用启动以来创建的服务器端 gRPC 渠道总数,这些渠道目前仍处于活跃状态。

  • 客户端指标:从客户端的角度监控 RPC 性能。

    • 各方法的客户端往返延迟时间(P50、P90、P99):各方法的往返RPC 延迟时间,包括服务器延迟时间、网络延迟时间和排队时间。

    • 每个方法的客户端发送吞吐量:所选服务器上每个方法的每秒发送字节数。

    • 每个进程的客户端发送吞吐量:所选服务器上每个进程每秒发送的字节数。

    • 每个方法的客户端接收吞吐量:所选服务器上每个方法的每秒接收字节数。

    • 每个进程的客户端接收吞吐量:所选服务器上每个进程每秒接收的字节数。

    • 每个方法的客户端规范状态计数:作为 gRPC 客户端,每个方法的规范状态代码的出现率(针对所选服务器)。

    • 每个方法的客户端已完成 RPC 数:所选服务器上每个方法的已完成客户端 RPCs 的速率。

“压缩”信息中心

压缩信息中心会直观显示后台压缩任务的性能。此信息中心包含以下图表:

  • 成功和失败的压缩次数(过去 1 小时):按压缩类型和每个服务器跟踪压缩类型的成功和失败次数。

  • 压缩输出字节速率:跟踪 2 分钟间隔内压缩的输出字节速率,按压缩类型和每个服务器分组。

  • 压缩输入大小分布:热图显示压缩输入大小的分布情况。

  • 压缩输入大小(平均值):显示按压缩类型和每个服务器分组的平均压缩输入大小。

  • 压缩输入大小(百分位估计值):提供按压缩类型和每个服务器分组的压缩输入大小的百分位估计值(P50、P95、P99)。

  • 主要压缩滞后时间分布:热图显示了汇总所有服务器的主要压缩滞后时间分布。

  • 每个服务器的主要压缩延迟时间(平均值):显示每个服务器的主要压缩延迟时间的平均值。

  • 每个服务器的主要压缩延迟时间(百分位估计值):提供每个服务器的主要压缩延迟时间的百分位估计值(P50、P90、P99)。

拆分、合并和移动信息中心

“拆分、合并和移动”信息中心会跟踪集群中数据的动态分布情况,包括目录操作和群组大小。此信息中心包含以下图表:

  • 拆分大小分布:目录拆分的大小,包括第 P50、P90、P99 和 P100 百分位数,这些数据是根据所选服务器汇总得出的。

  • 组大小分布:为组分配的所有字节(持久性和内存中),包括 P50、P90、P99 和 P100 百分位,在所选服务器上汇总。

  • 内存中组大小分布:为内存中组数据结构分配的所有字节,包括第 P50、P90、P99 和 P100 百分位,这些数据是跨所选服务器汇总的。

  • 按可用区划分的组大小:组的所有已分配字节(持久性和内存中)的 P50、P90、P99 和 P100 大小,按 Spanner Omni 可用区分组。

  • 成功进行的内部数据移动次数:在 1 小时的时间窗口内,按发起者、操作和移动类型分组的目录和群组移动、拆分和合并次数。

  • 失败的内部数据移动次数:在 1 小时的时间范围内,尝试进行的目录和群组移动、拆分和合并操作中出现的错误数量。

  • 按原因和类型划分的无法拆分的错误:忽略过载拆分后,无法拆分的错误的发生率,因为相应范围无法拆分。

  • 分块 CPU 使用率最高分数:每个数据库的所有分块中的最高 CPU 使用率负载。

平板电脑信息中心

通过平板电脑信息中心,您可以深入了解平板电脑统计信息、操作和潜在的热点。此信息中心包含以下图表:

  • 平板电脑总数:部署中的 Paxos 平板电脑总数。

  • 按地区列出的平板电脑数量:按 Spanner Omni 地区分组的平板电脑数量。

  • 各服务器上的平板电脑数量:所选服务器上的平板电脑数量。

  • 按可用区列出的主要 tablet 数量:按 Spanner Omni 可用区分组的主要 tablet 数量。

  • 各服务器上的主平板电脑数量:所选服务器上的主平板电脑数量。

  • 每个可用区的未分配平板电脑数量:每个可用区的未分配平板电脑数量。

  • 按可用区列出的平板电脑加载次数:按可用区分组的平板电脑加载次数比率。

  • 按可用区和原因划分的平板电脑卸载次数:每个可用区的平板电脑卸载率,按卸载原因分类。

  • 每个服务器的平板电脑最大负载:表格视图,显示每个服务器上平板电脑的最大计算负载。

  • 热片数量:热片(计算负荷超过阈值的平板电脑)的总数量。

  • 平板电脑负载分布:平板电脑的计算负载分布,显示 P50 和 P90 百分位估计值以及确切的 MAX 值。

TrueTime 信息中心

TrueTime 信息中心可让您了解 Spanner Omni TrueTime 服务的健康状况和可靠性。此信息中心包含以下图表:

  • TrueTime 可用性:监控 TrueTime 服务的总体可用性。

  • P99 TrueTime 漂移:跟踪第 99 百分位的 TrueTime 漂移。

  • P99 TrueTime 不确定性:跟踪 TrueTime 不确定性的第 99 百分位。

  • 时钟 SLA 违规次数:显示违反时钟服务等级协议 (SLA) 的次数。

  • 虚拟机迁移次数:跟踪虚拟机迁移次数。

  • 领导者上的 TrueTime 漂移:专门监控领导者节点上的 TrueTime 漂移。

  • TrueTime 期望 ppm 和实际 ppm 转向值:比较期望的百万分比 (ppm) 转向值和实际的百万分比转向值。

  • TrueTime 转向误差:跟踪 TrueTime 转向机制中的误差。

共享日志信息中心

共享日志信息中心是一个专用信息中心,用于监控共享日志的性能和恢复状态。此信息中心包含以下图表:

  • 共享日志写入速率:每秒的共享日志条目数,按数据库汇总和细分。

  • 写入的共享日志字节数:每秒写入的共享日志字节数(吞吐量),按数据库汇总和细分。

  • 共享日志批次写入速率:每秒写入的共享日志批次数(在所选服务器上汇总)。

  • 共享日志批次写入延迟时间分布:共享日志批次写入的 P50、P90 和 P99 延迟时间分布。

  • 共享日志批次条目数分布:共享日志批次中条目数的 P50、P90 和 P99 分布。

  • LogSort 请求速率:在所选服务器上汇总的 LogSort 请求的速率。

  • LogSort 排序错误率:所选服务器上汇总的 LogSort 排序错误率。

  • 正在进行的共享日志读取器:正在进行平板电脑恢复的共享日志读取器的总数。

后续步骤