tcp_user_timeout与keepalive的关系与生效机制


难度 中等

仅开启tcp_user_timeout

当tcp流中有数据交互时,tcp流不会进入keepalive,此时的超时主要受tcp_user_timeout影响。数据包被发送后未接收到ACK确认的达到tcp_user_timeout时会断开连接。tcp_user_timeout以毫秒为单位,例如设置为10000时,代表如果发送出去的数据包在十秒内未收到ACK确认,则下一次调用send或者recv,则函数会返回-1,errno设置为ETIMEOUT。

tcp_user_timeout主要解决tcp连接中有数据交互时数据未回复的超时断链。如丢包重传时的超时。

仅开启tcp keep-alive

  1. 由tcp_keepalive_idle 设置的时长控制进入keep-alive(表示连接没有数据交互持续多久进入keep-alive);
  2. 当进入keep-alive后,由tcp_keepalive_interval 设置的时长控制多久发送一个keepalive;
  3. 由tcp_keepalive_count 控制未收到多少个keep-alive-ack时进行拆链;收到keep-alive的一端需要回复keep-alive ack,若未收到keep-alive ack的报文个数达到tcp_keepalive_count时将会断开连接。

keep-alive 超时断开连接的时间为:tcp_keepalive_idle + (tcp_keepalive_interval * tcp_keepalive_count)
如设置tcp_keepalive_idle=10s,tcp_keepalive_interval=1s,tcp_keepalive_count=3时的报文截图如下:

keep-alive主要解决tcp链路中没有数据交互时的连接检测,keepalive通过主动发送报文来检测对端是否存活。如tcp长连接进入空闲状态时一端挂死就需要通过keep-alive来探测。

同时开启keepalive和tcp_user_timeout

当同时开启keepalive和tcp_user_timeout时,根据tcp_user_timeout和keepalive超时时间不一样,又分为两种情况(keep-alive 超时断开连接的时间为:tcp_keepalive_idle + (tcp_keepalive_interval * tcp_keepalive_count)):

  • tcp_user_timeout小于keepalive超时时间
  • tcp_user_timeout大于keepalive超时时间

tcp_user_timeout小于keepalive超时时间

tcp_user_timeout小于keepalive超时时间时,则当超时达到tcp_user_timeout就会断开连接,keep-alive未ack的报文不会达到tcp_keepalive_count个数。即断开时间会小于keepalive的超时时间。。

tcp_user_timeout=15,tcp_keepalive_idle=2s,tcp_keepalive_interval=1s,tcp_keepalive_count=20时,此时15<(2+20*1),抓包实例如下:

tcp_user_timeout大于keepalive超时时间

tcp_user_timeout大于keepalive超时时间时,只有当超时达到tcp_user_timeout才会断开连接,keep-alive未ack的报文可能会超过tcp_keepalive_count个数,即断开时间会大于keepalive的超时时间。

如tcp_user_timeout=15,tcp_keepalive_idle=2s,tcp_keepalive_interval=1s,tcp_keepalive_count=3时,此时15>(2+3*1),抓包实例如下:

当tcp_user_timeout和keepalive同时开启时,超时断链时间以tcp_user_timeout为准。

tcp_user_timeout无法处理没有数据交互时一端挂死的场景,因而需要keepalive机制配合;而当引入keep-alive机制后,keep-alive的报文就会受到tcp_user_timeout的控制,只有当某个keepalive报文未ack的时间超过tcp_user_timeout时,才会断开连接。若未达到tcp_user_timeout,则会按照tcp_keepalive_interval持续发送keepalive报文。即同时设置tcp_user_timeout和keepalive时,keepalive的tcp_keepalive_count将会失效,keepalive报文发送个数不会和tcp_keepalive_count严格一致。

tcp_keepalive是对tcp_user_timeout场景的补充,主要是在没有报文交互的长连接中,由tcp_keepalive触发报文发送,并触发tcp_user_timeout的超时机制,来控制tcp连接的超时断开。

reference

  1. https://datatracker.ietf.org/doc/html/rfc5482#page-10
  2. https://blog.cloudflare.com/when-tcp-sockets-refuse-to-die/
  3. https://man7.org/linux/man-pages/man7/tcp.7.html

文章作者: growdu
版权声明: 本博客所有文章除特別声明外,均采用 CC BY 4.0 许可协议。转载请注明来源 growdu !
  目录
分类导航
随笔2 AI27 算法1 计算机基础13 博客搭建7 ChatGPT2 集群63 计算机通信1 数据库34 数据库深入80 DPDK26 Docker11 Elasticsearch4 编辑工具4 FAQ1 Go Web1 hometown2 编程语言16 网络9 OPC1 Linux38 openGauss4 页面12 PostgreSQL54 程序员自我修养1 协议11 成长之路1 stock1 存储5 工具20 VPP18 视频作品1 Vue13 Web1 代码示例11 数据库15 BenchmarkSQL1 PostgreSQL 源码修炼之路14
最热文章
1
13 逻辑复制深入
数据库深入🔥 1570
2
0 Postgresql存储、索引及系统优化、主备切换
PostgreSQL🔥 1495
3
一文读懂openguass dcf网络模块
集群🔥 1420
4
逻辑复制源码分析
数据库深入🔥 1327
5
PostgreSQL 分区表:从一行 `PARTITION BY` 到路由热路径的全链路拆解
数据库🔥 1094
6
applyparallelworker.c 之 LA 端源码深度解析:Leader Apply Worker 的指挥中枢
数据库深入🔥 1082
7
PostgreSQL Background Worker 全解:从 `RegisterBackgroundWorker` 到逻辑复制 4 类 worker 的全生命周期
数据库🔥 1078
8
PostgreSQL的后台进程walsender分析 - 关系型数据库 - 亿速云
PostgreSQL🔥 1033
9
PostgreSQL 逻辑复制的监控:六张视图 + 一组可执行 SQL,把 publisher/subscriber 的速率与健康度彻底看透
数据库🔥 1032
10
PostgreSQL 逻辑复制支持 DDL 之后:DDL 与 DML 的时序难题(重点:分区表)
数据库🔥 999
11
reorderbuffer.c 源码深度解析:PostgreSQL 逻辑复制的"事务重组引擎
数据库深入🔥 953
12
PostgreSQL 内核开发:读取一张表的 9 步标准流程与缓存全景
数据库🔥 938
13
从 `postgres` 二进制到生产级守护 —— PostgreSQL 最外层模块与启动全流程拆解
数据库🔥 936
14
支持逻辑复制同步 DDL 适配 SQL Server 方案
数据库深入🔥 934
15
PostgreSQL 逻辑复制的 ReorderBuffer 与事务机制:从一行 WAL 到一致性变更流的全链路绑定
数据库🔥 913
16
DDL同步架构(美化版)
数据库深入🔥 908
17
PostgreSQL Latch 机制详解:从一行 SetLatch 到 epoll 的内核之旅
数据库🔥 871
18
pgbench 源码全解:一个 C 文件如何撑起 PostgreSQL 官方压测工具
数据库🔥 860
19
PostgreSQL libpq 机制与缓冲区详解
数据库🔥 850
20
PostgreSQL 逻辑复制 spill 文件深度剖析:从 `xid-*.spill` 到 TPC-C 的增长方程
数据库🔥 845