使用 Grafana 信息中心监控 Spanner Omni 部署的健康状况和性能。这些信息中心可直观呈现提取到 Prometheus 中的 Spanner Omni 指标,从而全面深入地了解部署的运行状态。您可以直观了解整体系统健康状况、资源消耗情况和关键内部流程。
信息中心清单
下表简要总结了可用的信息中心:
| 信息中心 | 关键指标 | 主要用途 |
|---|---|---|
| 概览 | QPS、延迟时间、吞吐量 |
监控高级别部署性能,包括每秒查询次数 (QPS)、请求延迟时间和数据吞吐量。
|
| 系统数据分析 | CPU,内存,锁定等待时间 |
重点关注所选数据库的数据库级资源消耗和健康状况(例如 CPU、内存和锁定等待时间)。
|
| 部署分析 | CPU、内存和网络利用率 |
提供有关整体部署资源消耗和网络统计信息的详细洞见。 |
| Spanner Omni 文件系统 | 文件操作、延迟时间和吞吐量 | 监控底层文件系统操作、性能、延迟时间和吞吐量。 |
| gRPC | RPC 数量、状态和延迟时间 |
跟踪服务器端和客户端通信的详细 RPC 统计信息。
|
| 压缩 | 压缩成功率和失败率、压缩延迟时间 | 直观呈现后台数据维护效果,重点关注压缩成功率和失败率以及压缩延迟。 |
| 拆分、合并和移动 | 拆分、合并和移动次数;群组大小 | 监控数据的动态分布,包括目录操作(拆分、合并和移动)、数据组大小和潜在的热点。 |
| 平板电脑 | 平板电脑数量、负载分布 | 深入了解平板电脑统计信息、操作和负载分布,并识别潜在的热点。 |
| TrueTime | 漂移、不确定性、违反服务等级协议 (SLA) | 监控 Spanner Omni TrueTime 服务的健康状况和可靠性,包括漂移、不确定性和 SLA 违规情况。 |
| 共享日志 | 写入速率、排序错误率 | 监控共享日志性能,特别是写入速率和排序错误率。 |
以下是信息中心内提供的一些图表:
计算容量 (vCPU):部署中预配的
vCPUs总数。内存容量:部署中预配的物理内存总容量。
存储空间容量:文件系统的总存储空间容量和可用存储空间容量。
节点状态:跟踪部署中服务器的总数和不健康服务器的数量。
计算利用率:已使用的总
vCPU容量所占的百分比。内存利用率:整个部署的内存用量总计。由于 Spanner Omni 会将空闲内存用于缓存,因此预期用量会很高。
存储空间利用率:已用存储空间占总存储空间容量的百分比。
每个 vCPU 的已用存储空间:已用存储空间总数与
vCPU总数的比率。服务器:一个详细的表格,显示了每个服务器和每个可用区的指标,包括
CPU利用率、内存利用率、正常运行时间、总vCPU、总内存、已用存储空间和存储空间容量。
系统分析洞见信息中心
系统分析洞见信息中心侧重于部署中数据库的健康状况和性能。此信息中心包含以下图表:
CPU 利用率概览:所选服务器的数据库总体
CPU利用率汇总。按用户和系统划分的 CPU 利用率:所选数据库中
CPU的利用率,按用户和系统任务以及优先级分组。按操作类型划分的 CPU 利用率:所选数据库的
CPU利用率,按操作类型分组,并针对所选服务器进行汇总。按操作类型划分的 CPU 利用率 - 高优先级:
CPU的利用率,按操作类型分组,按高优先级过滤,针对所选数据库在所选服务器上进行汇总。按操作类型划分的 CPU 利用率 - 中优先级:
CPU的利用率,按操作类型分组,并按中优先级过滤,针对所选数据库在所选服务器上进行汇总。按操作类型划分的 CPU 利用率 - 低优先级:
CPU的利用率,按操作类型分组,并按低优先级进行过滤,适用于所选数据库(在所选服务器上汇总)。请求延迟时间(
P50、P90、P99):所选数据库中的延迟时间,按所选服务器的读取和写入方法进行分组。按方法列出的请求延迟时间(
P50、P90、P99):所选数据库中的延迟时间,按所选服务器中的 API 方法分组。事务延迟时间(
P50、P90、P99):所选数据库中的请求延迟时间,按事务类型和所选服务器中的领导者参与情况进行分组。吞吐量:所选数据库在所选服务器中的读取和写入吞吐量。
按方法划分的吞吐量:所选数据库中按方法分组的吞吐量(跨所选服务器)。
每秒操作次数:所选数据库中的每秒操作次数,按所选服务器中的读取和写入方法分组。
每秒操作次数(按方法):所选数据库中按方法分组的每秒操作次数(跨所选服务器)。
各数据库的存储空间利用率:每个数据库使用的非复制物理字节数。每个群组的领导平板电脑都会提供此指标。一组中所有平板电脑的实际复制物理字节数可能会更高或更低,具体取决于每个平板电脑上的压缩状态,但此指标可大致了解每个数据库使用的非复制物理存储空间。
锁定等待时间:所选数据库在 5 分钟间隔内的锁定冲突总锁定等待时间。
事务取消率:已中止或已取消的事务的比率。当事务之间发生冲突时,取消率可能会更高。
架构对象数:所选数据库的架构对象数。
事务参与者:数据库中每次提交尝试的事务参与者数量的分布情况。
部署分析洞见信息中心
部署分析洞见信息中心可进一步深入了解部署资源消耗情况。此信息中心包含以下图表:
CPU 利用率:所选服务器的汇总
CPU利用率。服务器 CPU 利用率:每个所选服务器的
CPU利用率。进程 CPU 利用率:每个进程的
CPU利用率(汇总了所选服务器的数据)。内存利用率:所选服务器的汇总内存利用率。由于 Spanner Omni 会在内存中缓存数据,因此预期值会很高,并且 Spanner Omni 可以根据需要释放内存。
服务器内存利用率:每个所选服务器的内存利用率。由于 Spanner Omni 会在内存中缓存数据,因此预期值会很高,不过 Spanner Omni 可以在需要时释放内存。
进程常驻内存大小:所选服务器上每个进程的常驻内存大小。
进程虚拟内存大小:所选服务器上每个进程的虚拟内存大小。
服务器内存细分:按类别(缓存、碎片、
memtable_pinned、系统、更新、其他)汇总的所选服务器的内存利用率。此内存特定于span_server进程。网络发送的字节数:每个接口在所有服务器上汇总的发送字节数。
网络接收的字节数:所有服务器上每个接口接收的字节数总和。
按网络发送字节数排名的前 10 个服务器:按网络发送字节数排名的前 10 个服务器(表格视图)。
按网络接收的字节数排名的前 10 个服务器:按网络接收的字节数排名的前 10 个服务器(表格视图)。
Spanner Omni 文件系统信息中心
Spanner Omni 文件系统信息中心会监控对性能至关重要的底层文件系统操作,包括操作速率、延迟时间和吞吐量。此信息中心包含以下图表:
文件操作图:
每秒操作次数:跟踪文件操作的总速率,按操作分组。
每秒本地和远程操作数:跟踪文件操作速率,按本地访问与远程访问分开显示。
每秒操作错误数:显示失败的文件系统操作的速率,按操作和状态分组。
延迟时间图表:包含本地和远程文件操作的
P50、P90和P99延迟时间图表,按操作分组。吞吐量图表:
本地和远程读取和写入吞吐量:跟踪读取和写入吞吐率,按本地和远程访问分开显示。
每次操作的字节数:包括本地和远程访问每次操作的
P50和P90传输字节数。
文件系统统计信息:
按可用区划分的文件系统总大小:显示按 Spanner Omni 可用区分组的已配置文件系统总大小。
按可用区划分的文件系统使用情况:显示当前已使用的文件系统大小,按 Spanner Omni 可用区分组。
gRPC 信息中心
gRPC 信息中心会跟踪部署中所有服务器的详细 RPC 统计信息。此信息中心包含以下图表:
服务器端指标:从服务器的角度监控
RPC性能。各方法的 RPC 延迟时间(
P50、P90、P99):服务器端每个RPC方法的延迟时间。每种方法的服务器发送吞吐量:所选服务器上每种方法的每秒发送字节数。
Server Sent Throughput Per Process: Sent bytes per second per process for selected servers.
服务器每种方法的接收吞吐量:所选服务器每种方法的每秒接收字节数。
每个进程的服务器接收吞吐量:所选服务器上每个进程每秒接收的字节数。
每个方法的服务器规范状态计数:所选服务器上每个方法的规范状态代码出现率。
服务器上每个方法的已完成 RPC 数:所选服务器上每个方法的已完成
RPCs比率。服务器活跃渠道:自应用启动以来创建的服务器端
gRPC渠道总数,这些渠道目前仍处于活跃状态。
客户端指标:从客户端的角度监控
RPC性能。各方法的客户端往返延迟时间(
P50、P90、P99):各方法的往返RPC延迟时间,包括服务器延迟时间、网络延迟时间和排队时间。每个方法的客户端发送吞吐量:所选服务器上每个方法的每秒发送字节数。
每个进程的客户端发送吞吐量:所选服务器上每个进程每秒发送的字节数。
每个方法的客户端接收吞吐量:所选服务器上每个方法的每秒接收字节数。
每个进程的客户端接收吞吐量:所选服务器上每个进程每秒接收的字节数。
每个方法的客户端规范状态计数:作为
gRPC客户端,每个方法的规范状态代码的出现率(针对所选服务器)。每个方法的客户端已完成 RPC 数:所选服务器上每个方法的已完成客户端
RPCs的速率。
“压缩”信息中心
压缩信息中心会直观显示后台压缩任务的性能。此信息中心包含以下图表:
成功和失败的压缩次数(过去 1 小时):按压缩类型和每个服务器跟踪压缩类型的成功和失败次数。
压缩输出字节速率:跟踪 2 分钟间隔内压缩的输出字节速率,按压缩类型和每个服务器分组。
压缩输入大小分布:热图显示压缩输入大小的分布情况。
压缩输入大小(平均值):显示按压缩类型和每个服务器分组的平均压缩输入大小。
压缩输入大小(百分位估计值):提供按压缩类型和每个服务器分组的压缩输入大小的百分位估计值(
P50、P95、P99)。主要压缩滞后时间分布:热图显示了汇总所有服务器的主要压缩滞后时间分布。
每个服务器的主要压缩延迟时间(平均值):显示每个服务器的主要压缩延迟时间的平均值。
每个服务器的主要压缩延迟时间(百分位估计值):提供每个服务器的主要压缩延迟时间的百分位估计值(
P50、P90、P99)。
拆分、合并和移动信息中心
“拆分、合并和移动”信息中心会跟踪集群中数据的动态分布情况,包括目录操作和群组大小。此信息中心包含以下图表:
拆分大小分布:目录拆分的大小,包括第
P50、P90、P99和P100百分位数,这些数据是根据所选服务器汇总得出的。组大小分布:为组分配的所有字节(持久性和内存中),包括
P50、P90、P99和P100百分位,在所选服务器上汇总。内存中组大小分布:为内存中组数据结构分配的所有字节,包括第
P50、P90、P99和P100百分位,这些数据是跨所选服务器汇总的。按可用区划分的组大小:组的所有已分配字节(持久性和内存中)的
P50、P90、P99和P100大小,按 Spanner Omni 可用区分组。成功进行的内部数据移动次数:在 1 小时的时间窗口内,按发起者、操作和移动类型分组的目录和群组移动、拆分和合并次数。
失败的内部数据移动次数:在 1 小时的时间范围内,尝试进行的目录和群组移动、拆分和合并操作中出现的错误数量。
按原因和类型划分的无法拆分的错误:忽略过载拆分后,无法拆分的错误的发生率,因为相应范围无法拆分。
分块 CPU 使用率最高分数:每个数据库的所有分块中的最高
CPU使用率负载。
平板电脑信息中心
通过平板电脑信息中心,您可以深入了解平板电脑统计信息、操作和潜在的热点。此信息中心包含以下图表:
平板电脑总数:部署中的 Paxos 平板电脑总数。
按地区列出的平板电脑数量:按 Spanner Omni 地区分组的平板电脑数量。
各服务器上的平板电脑数量:所选服务器上的平板电脑数量。
按可用区列出的主要 tablet 数量:按 Spanner Omni 可用区分组的主要 tablet 数量。
各服务器上的主平板电脑数量:所选服务器上的主平板电脑数量。
每个可用区的未分配平板电脑数量:每个可用区的未分配平板电脑数量。
按可用区列出的平板电脑加载次数:按可用区分组的平板电脑加载次数比率。
按可用区和原因划分的平板电脑卸载次数:每个可用区的平板电脑卸载率,按卸载原因分类。
每个服务器的平板电脑最大负载:表格视图,显示每个服务器上平板电脑的最大计算负载。
热片数量:热片(计算负荷超过阈值的平板电脑)的总数量。
平板电脑负载分布:平板电脑的计算负载分布,显示
P50和P90百分位估计值以及确切的MAX值。
TrueTime 信息中心
TrueTime 信息中心可让您了解 Spanner Omni TrueTime 服务的健康状况和可靠性。此信息中心包含以下图表:
TrueTime 可用性:监控 TrueTime 服务的总体可用性。
P99 TrueTime 漂移:跟踪第 99 百分位的 TrueTime 漂移。
P99 TrueTime 不确定性:跟踪 TrueTime 不确定性的第 99 百分位。
时钟 SLA 违规次数:显示违反时钟服务等级协议 (SLA) 的次数。
虚拟机迁移次数:跟踪虚拟机迁移次数。
领导者上的 TrueTime 漂移:专门监控领导者节点上的 TrueTime 漂移。
TrueTime 期望 ppm 和实际 ppm 转向值:比较期望的百万分比 (
ppm) 转向值和实际的百万分比转向值。TrueTime 转向误差:跟踪 TrueTime 转向机制中的误差。
共享日志信息中心
共享日志信息中心是一个专用信息中心,用于监控共享日志的性能和恢复状态。此信息中心包含以下图表:
共享日志写入速率:每秒的共享日志条目数,按数据库汇总和细分。
写入的共享日志字节数:每秒写入的共享日志字节数(吞吐量),按数据库汇总和细分。
共享日志批次写入速率:每秒写入的共享日志批次数(在所选服务器上汇总)。
共享日志批次写入延迟时间分布:共享日志批次写入的
P50、P90和P99延迟时间分布。共享日志批次条目数分布:共享日志批次中条目数的
P50、P90和P99分布。LogSort 请求速率:在所选服务器上汇总的
LogSort请求的速率。LogSort 排序错误率:所选服务器上汇总的
LogSort排序错误率。正在进行的共享日志读取器:正在进行平板电脑恢复的共享日志读取器的总数。