中移动数据库停库问题分析解决


难度 中等
编写人 编写内容 编写时间
growdu 初稿 2023-06-03
growdu 补充完善解决方案 2023-06-07

问题描述

同城双中心,主中心数据库停库,且未触发中心间切换。

问题分析

主中心停库原因

主库停库分析

查看主库68的kbha.log,可以看到主库在2023-06-03 05:19:20失去了多数派。

少数派持续了一分多钟后,在2023-06-03 05:20:03重新进入多数派,这中间相差43秒

在这个过程中,数据库因为处于少数派超时导致数据库停库,可以看到从少数派到停库经过的时间为21秒

根据repmgr.conf中的配置,

reconnect_attempts=5
reconnect_interval=6

则数据库处于少数派的时间超过5*6-10=20秒时,就会停止数据库。

备库停库原因分析

查看备库78的kbha.log,与主库类似,在2023-06-03 05:19:32从多数派变为少数派,与主库相差12秒。

少数派持续了一分多钟后,在2023-06-03 05:20:03重新进入多数派,这中间相差31秒。可以看到备库与主库在同一时间重新进入多数派。

与主库一样,在这个过程中,数据库因为处于少数派超时导致数据库停库,可以看到从少数派到停库经过的时间为21秒

综上所述,主中心数据库停库的原因为corosync进入少数派超时。即corosync由于网络波动等因素导致进入少数派后,未在预期的20秒内恢复。

corosync进入少数派原因分析

经过上层应用日志分析,停库原因为corosync进入少数派,分析corosync日志。主库68上的corosync从05:19:20.764开始有节点离开并进入少数派,在05:20:03.692恢复,与上层应用时间相符。

但后续又出现token超时,且在恢复过程中,token出现多次超时,直到恢复。

综上所述,在06-03 05:19到06-03 05:42这段时间内,网络出现波动,导致corosync在这个过程中进入少数派。

备中心未切换原因

查看备中心伪主库hamgr.log日志,分析如下:

生产中心因为少数派导致kbha无法提供服务,observer在生产中心恢复之前无法连接到kbha,但在触发observer跨中心切换时,生产中心corosync恢复多数派,kbha正常提供服务,observer查询到节点信息,未触发中心间切换。

observer在2023-06-03 05:17:01时无法查询节点信息,在2023-06-03 05:19:39时恢复,此时observer又重新连接上生产中心的kbha。

observer在连接上生成中心的kbha服务后,其超时重传机制将会重置,将会重新开始计算超时。

observer未触发跨中心切换是因为生产中心的kbha服务在切换时间之前恢复。

问题结论

1.网络波动导致corosync进入少数派,其恢复时间超过了数据库停库允许的少数派时间,导致数据库停库。

2.生产中心corosync的故障恢复时间小于observer的跨中心切换时间,导致未进行跨中心切换。

问题解决

  1. 主要原因为corosync受网络波动影响进入少数派时间超过允许的故障时间(当前为20秒)建议调整配置参数增大允许的corosync网络波动时间;

按当前配置参数,允许的corosync网络波动为20秒,拟将允许的corosync网络波动调高,调整为50秒。

当前允许的corosync的网络波动时间的配置参数为:

reconnect_attempts=5
reconnect_interval=6

后续建议修改为:

reconnect_attempts=6
reconnect_interval=10

调整允许的corosync网络波动时间不需要更新补丁,仅需修改各节点的repmgr.conf文件中的配置,并重启kbha和repmgrd进程。但需要出操作文档。

  1. observer未触发跨中心切换的原因为当前处理逻辑中,若observer在生产中心故障后,在跨中心切换时间内重新连上corosync后不会进行跨中心切换,需要用户介入,手动启动生产中心的数据库;后续会增加配置开关,允许用户配置是否开启该功能:若observer在生产中心故障后,即使在跨中心切换时间内重新连上corosync,也会自动进行跨中心切换。

增加observer配置开关,有用户决定是否开启中心数据库全部停止时自动进行中心间切换。增加该逻辑需要更新补丁进行升级,会涉及到更新二进制、停库等操作。

当前中移动版本为ps002,这段时间新版本为PS006,修复了自测的一些bug,拟在2023年6月24日左右与中心数据库全部停止时自动进行中心间切换补丁一起升级。届时除需要提供补丁包外,还需要提供补丁升级文档和升级步骤。

调整允许的corosync网络波动时间操作步骤

待补充完善。


文章作者: growdu
版权声明: 本博客所有文章除特別声明外,均采用 CC BY 4.0 许可协议。转载请注明来源 growdu !
  目录
分类导航
随笔2 AI27 算法1 计算机基础13 博客搭建7 ChatGPT2 集群63 计算机通信1 数据库34 数据库深入80 DPDK26 Docker11 Elasticsearch4 编辑工具4 FAQ1 Go Web1 hometown2 编程语言16 网络9 OPC1 Linux38 openGauss4 页面12 PostgreSQL54 程序员自我修养1 协议11 成长之路1 stock1 存储5 工具20 VPP18 视频作品1 Vue13 Web1 代码示例11 数据库15 BenchmarkSQL1 PostgreSQL 源码修炼之路14
最热文章
1
13 逻辑复制深入
数据库深入🔥 1570
2
0 Postgresql存储、索引及系统优化、主备切换
PostgreSQL🔥 1495
3
一文读懂openguass dcf网络模块
集群🔥 1420
4
逻辑复制源码分析
数据库深入🔥 1327
5
PostgreSQL 分区表:从一行 `PARTITION BY` 到路由热路径的全链路拆解
数据库🔥 1094
6
applyparallelworker.c 之 LA 端源码深度解析:Leader Apply Worker 的指挥中枢
数据库深入🔥 1082
7
PostgreSQL Background Worker 全解:从 `RegisterBackgroundWorker` 到逻辑复制 4 类 worker 的全生命周期
数据库🔥 1078
8
PostgreSQL的后台进程walsender分析 - 关系型数据库 - 亿速云
PostgreSQL🔥 1033
9
PostgreSQL 逻辑复制的监控:六张视图 + 一组可执行 SQL,把 publisher/subscriber 的速率与健康度彻底看透
数据库🔥 1032
10
PostgreSQL 逻辑复制支持 DDL 之后:DDL 与 DML 的时序难题(重点:分区表)
数据库🔥 999
11
reorderbuffer.c 源码深度解析:PostgreSQL 逻辑复制的"事务重组引擎
数据库深入🔥 953
12
PostgreSQL 内核开发:读取一张表的 9 步标准流程与缓存全景
数据库🔥 938
13
从 `postgres` 二进制到生产级守护 —— PostgreSQL 最外层模块与启动全流程拆解
数据库🔥 936
14
支持逻辑复制同步 DDL 适配 SQL Server 方案
数据库深入🔥 934
15
PostgreSQL 逻辑复制的 ReorderBuffer 与事务机制:从一行 WAL 到一致性变更流的全链路绑定
数据库🔥 913
16
DDL同步架构(美化版)
数据库深入🔥 908
17
PostgreSQL Latch 机制详解:从一行 SetLatch 到 epoll 的内核之旅
数据库🔥 871
18
pgbench 源码全解:一个 C 文件如何撑起 PostgreSQL 官方压测工具
数据库🔥 860
19
PostgreSQL libpq 机制与缓冲区详解
数据库🔥 850
20
PostgreSQL 逻辑复制 spill 文件深度剖析:从 `xid-*.spill` 到 TPC-C 的增长方程
数据库🔥 845