百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术教程 > 正文

Redis 性能调优记录

mhr18 2024-12-06 16:25 17 浏览 0 评论

一、背景


2023年03月08日,在某地域进行了线上压测,发现接口RT频繁超时,性能下降严重,P50 400ms+,P90 1200ms+,P99 2000ms+。

解释:压测中P50 P90 P99表示含义:

在性能测试中,P50、P90、P99等都是用来描述系统在不同负载下的性能表现的统计指标。这些指标通常用于描述系统响应时间的百分位数。

  • P50,也称为中位数,意味着在所有请求中,有50%的请求响应时间小于或等于该值。这意味着,如果P50的响应时间是100毫秒,那么有50%的用户会在100毫秒或更短的时间内收到响应。
  • P90,意味着在所有请求中,有90%的请求响应时间小于或等于该值。如果P90的响应时间是300毫秒,那么有90%的用户会在300毫秒或更短的时间内收到响应。
  • P99,意味着在所有请求中,有99%的请求响应时间小于或等于该值。如果P99的响应时间是500毫秒,那么有99%的用户会在500毫秒或更短的时间内收到响应


细致排查发现其中重要的原因是,访问缓存响应时间竟然飙到了1.2s左右。



二、为啥Redis访问延时如此高?


我们简化下Redis访问流程如下:



可能性1:服务端问题?


我们Redis使用的

redis_amber_master_4xlarge_multithread 16C32G+480G SSD 规格,最大QPS参考值24w,最大连接数3w,配置还是非常豪华的。


如下,QPS以及Load在峰值请求阶段,都仍然处于低位。



可能性2:物理网络问题?


如下,请求远远没有达到机器带宽,不是瓶颈,另外单独看了网卡重传率等指标也都正常。



可能性3:客户端问题?


那么很大概率就是客户端自身问题了。我们把客户端详细放大如下:



①JVM FGC STW?


根据当时ARMS监控结果如下,虽然YGC次数与耗时有所上升,但没有发生FGC:



②JedisPool问题?


通过对内存Dump的分析,我们发现与JedisConnectionFactory相关的几个关键指标揭示了两个主要的问题:

  1. maxBorrowWaitTimeMills的值过大:这一指标反映了获取连接的最大等待时间,其值高达1200毫秒。这个长的等待时间可能是由于在获取连接池的连接时产生的阻塞,从而导致请求处理速度减慢。
  2. Redis连接的创建和销毁次数过多:具体来说,createdCount达到了11555次,而destroyedCount为11553次。这表明max-idle参数可能设置不合理(当检查到idle大于maxIdle时,会立即销毁该连接)。每个对象的创建都相当于一次TCP连接的创建,这会产生较大的开销。因此,当遇到脉冲式的请求时,会导致频繁的创建和销毁操作,进而影响整体性能。

需要特别提出的是,maxBorrowWaitTimeMills、createdCount和destroyedCount这几个度量信息是JedisPool对象持续维护的全局变量信息,只要JVM没有重启,这些信息就会一直存在。这就解释了为什么我们不需要在进行压力测试的峰值时获取内存dump,而可以在事后进行dump。

此外,如果要深入探索JedisPool参数的工作机制,就需要理解apache的ObjectPool2的机制。我曾经研究过ObjectPool,将来会单独写一篇文章来详细阐述和对比ObjectPool、ObjectPool2、JedisPool以及常常出问题的DruidPool的实现原理和差异。

总的来说,我们定位到的问题是JedisPool的行为异常导致的。





三、如何解决问题?


线上JedisPool实际参数


部分参数是由 redis.clients.jedis.JedisPoolConfig 继承而来


spring.redis.jedis.pool.max-active=100
spring.redis.jedis.pool.max-idle=16


spring.redis.jedis.pool.time-between-eviction-runs-millis=30000


spring.redis.jedis.pool.min-idle=0
spring.redis.jedis.pool.test-while-idle=true
spring.redis.jedis.pool.num-tests-per-eviction-run=-1
spring.redis.jedis.pool.min-evictable-idle-time-millis=60000


参数行为解析


  • max-active:连接池的最大数量为100, 包括 idle + active. 注意, 这里spring.redis.jedis.pool.max-active被映射为了ObjectPool的maxTotal参数上。


  • 连接池的最大空闲数量为16,即如果return时,idleObject>=16,则该对象直接被销毁。


  • 启动后台线程,每30s执行一次,定时心跳保活与检测。


  • 连接池最小空闲的连接数量为0。即corePoolSize为0,不会长期maintain一个固定的容量。


脉冲式请求引发的问题


我们把问题简化为如下序列,即可发现问题所在。在T2~T3内,84个对象创建,84个对象销毁,造成了极大的损耗。



期望的行为模式


由于线上环境,Redis服务器配置较高,为了能充分压榨性能,同时应对容器场景下典型的突发峰值,因此如下行为:


  • 连接池的最大数量=连接池的最小数量=连接池的稳定数量即不要临时去创建连接,防止等待过久。

这里的优化策略和Weblogic 在JDBC 连接池的优化策略是一样的, 我们一般定义是150到200个JDBC连接,而且最大 最小设置一样

  • 需要定时心跳保活与检测,及时删除掉超时/无效的连接。
  • 不要因为idle时间过久而重建连接只因为连接失效而重建。防止无意义的大规模连接重建。


spring.redis.jedis.pool.max-active=500 // 线上稳定保有4台,4*500=2000,仍然远小于Redis规格支持的3w
spring.redis.jedis.pool.max-idle=50


spring.redis.jedis.pool.time-between-eviction-runs-millis=30000 // 定时心跳保活与检测


spring.redis.jedis.pool.min-idle=500 // 连接池的稳定数量
spring.redis.jedis.pool.test-while-idle=true //定时心跳保活与检测
spring.redis.jedis.pool.num-tests-per-eviction-run=-1 // 每次保活检测, 都需要把500个连接都检测一遍. 如果设置为-2, 则每次检测1/2比例的的连接.
spring.redis.jedis.pool.min-evictable-idle-time-millis=-1 // 不要因为idleTime大于某个阈值从而把连接给删除掉. 这样可以防止无意义的大规模连接重建。


四、效果验证


终于在20230413重新迎来了一波压测,流量模型与上次相同。结果如下:


  • maxBorrowWaitTimeMills 下降比例接近 80%
  • createdCount 也从之前的 11555次 下降到了 500次(即池子初始化的size)
  • 业务侧整体性能也大幅提升,P50与P90均下降了将近60%,P99更是夸张地下降了70%。简直是amazing,完结撒花!~





转载信息:

作者丨寒亭

来源丨公众号:阿里开发者(ID:ali_tech)

dbaplus社群欢迎广大技术人员投稿,投稿邮箱:editor@dbaplus.cn

相关推荐

【推荐】一个开源免费、AI 驱动的智能数据管理系统,支持多数据库

如果您对源码&技术感兴趣,请点赞+收藏+转发+关注,大家的支持是我分享最大的动力!!!.前言在当今数据驱动的时代,高效、智能地管理数据已成为企业和个人不可或缺的能力。为了满足这一需求,我们推出了这款开...

Pure Storage推出统一数据管理云平台及新闪存阵列

PureStorage公司今日推出企业数据云(EnterpriseDataCloud),称其为组织在混合环境中存储、管理和使用数据方式的全面架构升级。该公司表示,EDC使组织能够在本地、云端和混...

对Java学习的10条建议(对java课程的建议)

不少Java的初学者一开始都是信心满满准备迎接挑战,但是经过一段时间的学习之后,多少都会碰到各种挫败,以下北风网就总结一些对于初学者非常有用的建议,希望能够给他们解决现实中的问题。Java编程的准备:...

SQLShift 重大更新:Oracle→PostgreSQL 存储过程转换功能上线!

官网:https://sqlshift.cn/6月,SQLShift迎来重大版本更新!作为国内首个支持Oracle->OceanBase存储过程智能转换的工具,SQLShift在过去一...

JDK21有没有什么稳定、简单又强势的特性?

佳未阿里云开发者2025年03月05日08:30浙江阿里妹导读这篇文章主要介绍了Java虚拟线程的发展及其在AJDK中的实现和优化。阅前声明:本文介绍的内容基于AJDK21.0.5[1]以及以上...

「松勤软件测试」网站总出现404 bug?总结8个原因,不信解决不了

在进行网站测试的时候,有没有碰到过网站崩溃,打不开,出现404错误等各种现象,如果你碰到了,那么恭喜你,你的网站出问题了,是什么原因导致网站出问题呢,根据松勤软件测试的总结如下:01数据库中的表空间不...

Java面试题及答案最全总结(2025版)

大家好,我是Java面试陪考员最近很多小伙伴在忙着找工作,给大家整理了一份非常全面的Java面试题及答案。涉及的内容非常全面,包含:Spring、MySQL、JVM、Redis、Linux、Sprin...

数据库日常运维工作内容(数据库日常运维 工作内容)

#数据库日常运维工作包括哪些内容?#数据库日常运维工作是一个涵盖多个层面的综合性任务,以下是详细的分类和内容说明:一、数据库运维核心工作监控与告警性能监控:实时监控CPU、内存、I/O、连接数、锁等待...

分布式之系统底层原理(上)(底层分布式技术)

作者:allanpan,腾讯IEG高级后台工程师导言分布式事务是分布式系统必不可少的组成部分,基本上只要实现一个分布式系统就逃不开对分布式事务的支持。本文从分布式事务这个概念切入,尝试对分布式事务...

oracle 死锁了怎么办?kill 进程 直接上干货

1、查看死锁是否存在selectusername,lockwait,status,machine,programfromv$sessionwheresidin(selectsession...

SpringBoot 各种分页查询方式详解(全网最全)

一、分页查询基础概念与原理1.1什么是分页查询分页查询是指将大量数据分割成多个小块(页)进行展示的技术,它是现代Web应用中必不可少的功能。想象一下你去图书馆找书,如果所有书都堆在一张桌子上,你很难...

《战场兄弟》全事件攻略 一般事件合同事件红装及隐藏职业攻略

《战场兄弟》全事件攻略,一般事件合同事件红装及隐藏职业攻略。《战场兄弟》事件奖励,事件条件。《战场兄弟》是OverhypeStudios制作发行的一款由xcom和桌游为灵感来源,以中世纪、低魔奇幻为...

LoadRunner(loadrunner录制不到脚本)

一、核心组件与工作流程LoadRunner性能测试工具-并发测试-正版软件下载-使用教程-价格-官方代理商的架构围绕三大核心组件构建,形成完整测试闭环:VirtualUserGenerator(...

Redis数据类型介绍(redis 数据类型)

介绍Redis支持五种数据类型:String(字符串),Hash(哈希),List(列表),Set(集合)及Zset(sortedset:有序集合)。1、字符串类型概述1.1、数据类型Redis支持...

RMAN备份监控及优化总结(rman备份原理)

今天主要介绍一下如何对RMAN备份监控及优化,这里就不讲rman备份的一些原理了,仅供参考。一、监控RMAN备份1、确定备份源与备份设备的最大速度从磁盘读的速度和磁带写的带度、备份的速度不可能超出这两...

取消回复欢迎 发表评论: