百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术教程 > 正文

Redis 高可用方案有哪些?(redis生产环境下的高可用)

mhr18 2024-11-09 12:19 22 浏览 0 评论

如果某个 slot 的数据只有部分迁移过去,没有迁移完成,节点收到客户端请求如果能根据 key -> slot -> node 映射关系定位到的节点存在该 key,则直接执行命令,否则就向客户端响应 ASK? 错误,表示该 key 所在的 slot 正在迁移到其他节点,客户端先给目标节点发送 ??ASKING?? 命令询问节点是否可以处理,接着才会发送操作指令。

Redis 高可用方案有哪些?

高可用有两个含义:一是数据尽量不丢失,二是服务尽可能提供服务。 Redis 高可用方案严格意义上来说有 3 种。

  1. 主从复制架构,这是后两个方案的基石。
  2. sentinel 哨兵集群。
  3. Redis Cluster 集群,极力推荐该方式。

一、主从异步复制架构

主从异步复制架构是高可用的基石,主要分为 RDB 内存快照文件全量同步增量同步

全量同步

Redis master 执行 bgsave 命令生成 RDB 内存快照文件,slave 收到 RDB 内存快照文件保存到磁盘,并清空当前数据库的数据,再加载 RDB 文件数据到内存中。最后,master 再把发送生成 RDB 文件至同步 slave 加载 RDB 期间接受到的新写命令同步到到 slave。

增量同步

只要主从连接不中断,就会持续进行基于长连接的命令传播复制。在 Redis 2.8 之前,如果主从复制在命令传播时出现了网络闪断,那么,slave 就会和 mater 重新进行一次全量复制,开销非常大。

从 Redis 2.8 开始,网络断了重连之后,slave 会尝试采用增量复制的方式继续同步。

增量复制:用于网络中断等情况后的复制,只将中断期间 mater 执行的写命令发送给 slave,与全量复制相比更加高效。

其中还涉及到 replication buffer 和 repl_backlog 的缓冲区的作用,说到这一块就已经让你脱颖而出了。

接着,你再补充在 Redis 7.0 之后,采用了共享缓冲区的设计。

“因为不管是全量复制还是增量复制,当写请求到达 master 时,指令会分别写入所有 slave 的 replication buffer 以及 repl_backlog_buffer。重复保存,太浪费内存了。

既然存储内容是一样,直接的做法就是主从复制在命令传播时,将这些写命令放在一个全局的复制缓冲区中,多个 slave 共享这份数据,不同 slave 引用缓冲区的不同内容,这就是共享缓冲区的核心思想。”

二、sentinel 集群

Sentinel 是 Redis 的一种运行模式,它专注于对 Redis 实例(主节点、从节点)运行状态的监控,并能够在主节点发生故障时通过一系列的机制实现选主及主从切换,实现自动故障转移,确保整个 Redis 系统的可用性。

sentinel 主要做四件事情。

  1. 监控 master 和 slave 状态,判断是否下线。
  • 每秒一次的频率向 master 和 slave 以及其他 sentinel 发送 PING 命令,如果该节点距离最后一次响应 PING 的时间超过 down-after-milliseconds 选项所指定的值, 则这个实例会被 Sentinel 标记为主观下线,当 master 被标记主观下线。
  • 其他正在监视这个 master 的所有 sentinel 会按照每秒一次的频率确认 master 是否主观下线。
  • 当足够多的 sentinel 都认为 master 主观下线,则标记这个 master 客观下线。
  1. 选举新 master,如果 master 出现故障,sentine 需要选举一个 slave 晋升为新 master。晋升为新 master 的 slave 是有条件的,先过滤不满足条件的,再打分排优先级。
  • slave 优先级,通过 replica-priority 100 配置,值越低,优先级越高。
  • 复制偏移量(processed replication offset),已复制的数据量越多越好,slave_repl_offset与 master_repl_offset 差值越小。
  • slave runID,在优先级和复制进度都相同的情况下,runID 最小的 slave 得分最高,会被选为新主库。
  • 过滤掉下线、网络异常的 slave。
  • 过滤掉经常与 master 断开的 slave。
  1. 执行主从切换,从 sentinel 集群中选举一个 leader 执行故障自动切换。
  • 成为 leader 的条件是收到的赞成票大于等于 quorum 的值且赞半数以上。
  • 第一个判定 master 主观下线的 sentinel 收到其他 sentinel 节点的回复并确定 master 客观下线后,就会给其他 sentinel 节点发送命令申请成为 leader。
  1. 通知,通知其他 slave 执行 replicaof 与新的 master 同步数据,并通知客户端与新 master 建立连接。

三、Redis Cluster

Redis Cluster 在 Redis 3.0 及以上版本提供,是一种分布式数据库方案,通过分片(sharding)来进行数据管理(分治思想的一种实践),并提供复制和故障转移功能。

Redis Cluster 并没有使用一致性哈希算法,而是将数据划分为 16384 的 slots ,每个节点负责一部分 slots,slot 的信息存储在每个节点中。

集群 mater 节点最大上限是 16384(官方建议最大节点数为 1000 个),数据库的每个 key 会映射到这 16384 个槽中的其中一个,每个节点可以处理 1 个或者最多 16384 个槽。

“集群各个节点之间是如何通信呢?”

通过 Gossip 协议进行通信,节点之间不断交换信息,交换的信息包括节点出现故障、新节点加入、主从节点变更, slots 信息变更等。常用的 Gossip 消息分为 4 种,分别是:ping、pong、meet、fail。

  • meet 消息:通知新节点加入。消息发送者通知接受者加入当前集群。
  • ping消息:每个节点每秒向其他节点发送 ping 消息,用于检测节点在线和交换刺激状态信息。
  • pong消息:节点接受到 ping 消息后,作为响应消息回复发送方确认正常,同时 pong 还包含了自身的状态数据,想集群广播 pong 消息来通知集群自身状态进行更新。
  • fail消息:节点 ping 不通某节点后,则向集群所有节点广播该节点挂掉的消息。

“Redis Cluster 如何实现自动故障转移呢?”

  1. 故障检测:集群中每个节点都会定期通过 Gossip 协议向其他节点发送 PING 消息,检测各个节点的状态(在线状态、疑似下线状态 PFAIL、已下线状态 FAIL)。并通过 Gossip 协议来广播自己的状态以及自己对整个集群认知的改变。
  2. master 选举:使用从当前故障 master 的所有 slave 选举一个提升为 master。
  3. 故障转移:取消与旧 master 的主从复制关系,将旧 master 负责的槽位信息指派到当前 master,更新 Cluster 状态并写入数据文件,通过 gossip 协议向集群广播发送 CLUSTERMSG_TYPE_PONG消息,把最新的信息传播给其他节点,其他节点收到该消息后更新自身的状态信息或与新 master 建立主从复制关系。

“新增节点或者重新分配 slots 导致 slots 与节点之间的映射关系改变了,客户端如何知道把请求发到哪里?”

Redis Cluster 提供了请求重定向机制解决:客户端将请求发送到某个节点上,这个节点没有相应的数据,该 Redis 节点会告诉客户端将请求发送到其他的节点。

MOVED 重定向

当重新分配或者负载均衡,slots 数据已经迁移到其他节点,节点会响应一个 MOVED 错误指引客户端重定向到正确的节点,并且客户端会更新本地 slots 与节点映射关系,以便下次可以正确访问。

ASK 重定向

如果某个 slot 的数据只有部分迁移过去,没有迁移完成,节点收到客户端请求如果能根据 key -> slot -> node 映射关系定位到的节点存在该 key,则直接执行命令,否则就向客户端响应 ASK 错误,表示该 key 所在的 slot 正在迁移到其他节点,客户端先给目标节点发送 ASKING 命令询问节点是否可以处理,接着才会发送操作指令。

注意:ASK 错误指令并不会更新客户端缓存的 slot 分配信息。

为什么集群的 slots 是 16384?

  • 正常的 ping 数据包携带节点的完整配置,用的是一个 bitmap 数据结构,它能以幂等方式来更新配置。如果采用 16384 个插槽,占空间 2KB (16384/8);如果采用 65536 个插槽,占空间 8KB (65536/8)。
  • Redis Cluster 不太可能扩展到超过 1000 个主节点,太多可能导致网络拥堵。
  • 16384 个 slot 范围比较合适,当集群扩展到 1000 个节点时,也能确保每个 master 节点有足够的 slot。

8KB 的心跳包看似不大,但是这个是心跳包每秒都要将本节点的信息同步给集群其他节点。比起 16384 个 slot ,header 大小增加了 4 倍,ping 消息的消息头太大了,浪费带宽。


相关推荐

B站收藏视频失效?mybili 收藏夹备份神器完整部署指南

本内容来源于@什么值得买APP,观点仅代表作者本人|作者:羊刀仙很多B站用户都有过类似经历:自己精心收藏的视频突然“消失”,点开一看不是“已被删除”,就是“因UP主设置不可见”。而B站并不会主动通知...

中间件推荐初始化配置

Redis推荐初始化配置bind0.0.0.0protected-modeyesport6379tcp-backlog511timeout300tcp-keepalive300...

Redis中缓存穿透问题与解决方法

缓存穿透问题概述在Redis作为缓存使用时,缓存穿透是常见问题。正常查询流程是先从Redis缓存获取数据,若有则直接使用;若没有则去数据库查询,查到后存入缓存。但当请求的数据在缓存和数据库中都...

后端开发必看!Redis 哨兵机制如何保障系统高可用?

你是否曾在项目中遇到过Redis主服务器突然宕机,导致整个业务系统出现数据读取异常、响应延迟甚至服务中断的情况?面对这样的突发状况,作为互联网大厂的后端开发人员,如何快速恢复服务、保障系统的高可用...

Redis合集-大Key处理建议

以下是Redis大Key问题的全流程解决方案,涵盖检测、处理、优化及预防策略,结合代码示例和最佳实践:一、大Key的定义与风险1.大Key判定标准数据类型大Key阈值风险场景S...

深入解析跳跃表:Redis里的"老六"数据结构,专治各种不服

大家好,我是你们的码农段子手,今天要给大家讲一个Redis世界里最会"跳科目三"的数据结构——跳跃表(SkipList)。这货表面上是个青铜,实际上是个王者,连红黑树见了都要喊声大哥。...

Redis 中 AOF 持久化技术原理全解析,看完你就懂了!

你在使用Redis的过程中,有没有担心过数据丢失的问题?尤其是在服务器突然宕机、意外断电等情况发生时,那些还没来得及持久化的数据,是不是让你夜不能寐?别担心,Redis的AOF持久化技术就是...

Redis合集-必备的几款运维工具

Redis在应用Redis时,经常会面临的运维工作,包括Redis的运行状态监控,数据迁移,主从集群、切片集群的部署和运维。接下来,从这三个方面,介绍一些工具。先来学习下监控Redis实时...

别再纠结线程池大小 + 线程数量了,没有固定公式的!

我们在百度上能很轻易地搜索到以下线程池设置大小的理论:在一台服务器上我们按照以下设置CPU密集型的程序-核心数+1I/O密集型的程序-核心数*2你不会真的按照这个理论来设置线程池的...

网络编程—IO多路复用详解

假如你想了解IO多路复用,那本文或许可以帮助你本文的最大目的就是想要把select、epoll在执行过程中干了什么叙述出来,所以具体的代码不会涉及,毕竟不同语言的接口有所区别。基础知识IO多路复用涉及...

5分钟学会C/C++多线程编程进程和线程

前言对线程有基本的理解简单的C++面向过程编程能力创造单个简单的线程。创造单个带参数的线程。如何等待线程结束。创造多个线程,并使用互斥量来防止资源抢占。会使用之后,直接跳到“汇总”,复制模板来用就行...

尽情阅读,技术进阶,详解mmap的原理

1.一句话概括mmapmmap的作用,在应用这一层,是让你把文件的某一段,当作内存一样来访问。将文件映射到物理内存,将进程虚拟空间映射到那块内存。这样,进程不仅能像访问内存一样读写文件,多个进程...

C++11多线程知识点总结

一、多线程的基本概念1、进程与线程的区别和联系进程:进程是一个动态的过程,是一个活动的实体。简单来说,一个应用程序的运行就可以被看做是一个进程;线程:是运行中的实际的任务执行者。可以说,进程中包含了多...

微服务高可用的2个关键技巧,你一定用得上

概述上一篇文章讲了一个朋友公司使用SpringCloud架构遇到问题的一个真实案例,虽然不是什么大的技术问题,但如果对一些东西理解的不深刻,还真会犯一些错误。这篇文章我们来聊聊在微服务架构中,到底如...

Java线程间如何共享与传递数据

1、背景在日常SpringBoot应用或者Java应用开发中,使用多线程编程有很多好处,比如可以同时处理多个任务,提高程序的并发性;可以充分利用计算机的多核处理器,使得程序能够更好地利用计算机的资源,...

取消回复欢迎 发表评论: