百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术教程 > 正文

干货!Hive常用10大应用技巧(hive用法)

mhr18 2024-10-05 17:26 22 浏览 0 评论

推荐一个数据分析宝藏公众号「小火龙说数据」

无广告、无软文、纯干货,更多精彩原创文章与你分享!


01 Hive运行顺序

在应用Hive过程中,你是否有过这样的疑问?

「同层查询中,sum/avg聚合后的过滤是否可以放在where后面?」

针对类似问题,只要清楚了Hive SQL的运行顺序,便会迎刃而解,顺序如下:

(步骤7) SELECT count(*) as col1 (步骤8) DISTINCT
(步骤1) FROM
(步骤3) A JOIN B
(步骤2) ON A.x = B.x
(步骤4) WHERE A.y = 1
(步骤5) GROUP BY A.x
(步骤6) HAVING col1 > 100
(步骤9) ORDER BY col1
(步骤10) LIMIT 100

因此,针对上面的问题,由于group by是在where的后面,因此sum/avg聚合后的过滤是不可以放在where中的,而是需要放在having当中。


02 数据倾斜出现原因及解决方案

正所谓“不怕数据大,就怕发生数据倾斜”,数据倾斜是Hive经常遇到的问题,同时也是面试的高发问题。针对数据倾斜,小火龙为大家汇总了问题发生的情况,以及处理的方式,如下图:


03 过滤条件放置位置「join 场景」

Join场景中,过滤条件要放在左表和右表的子查询里面,而不要放置在join on外侧过滤。

不建议

Select 
  t1.x
  ,t2.x
from 
  qqq t1
left join 
  ppp t2
on 
  t1.key=t2.key 
  and t1.ds=d1 
  and t2.ds=d1
;

建议

Select 
  t1.x 
  ,t2.x 
from 
  (select * from a where ds=d1) t1
left join
  (select * from  b where ds=d1) t2 
on 
  t1.key=t2.key
;


04 AB两表放置位置「join场景」

内连接时小表放前面、大表放后面。将较大的表放在inner join操作符的右侧,可以提高查询效率,执行速度快,不容易出现计算内存溢出错误。

[A为小表]
A inner join B on A.key = B.key ;


05 hive与mysql/oracle差异「join场景」

内关联场景中,hive与mysql/oracle存在一些差异。

正确写法

A join B on A.key=B.key ;

错误写法

from A ,B where A.key=B.key ;

下面写法在mysql/oracle等价于内连接,但是在Hive中会导致笛卡尔积,查询无法运行。


06 分区缩小扫描范围「where场景」

有些同学在码SQL的时候,有时会忘记加分区筛选,这会导致全表扫描。不仅会影响自己的产出速度,还会占用过多资源,影响整个集群的使用。


07 distinct与group by的区别「计数场景」

在去重计数场景中,我们经常应用count(distinct)来进行处理;有时也会先在内层通过group by聚合,然后再在外层计数count(*)。那这两者的区别是什么呢?


「group by」适用于数据量级较大的情况

特点:时间复杂度高 + 空间复杂度低。

原理:group by先对列进行排序,类似sort方法,而排序的基本理论是,时间复杂度为nlog(n),空间复杂度为1。

优点:空间复杂度低,适用于大数据量级。


「distinct」适用于数据量级不大的情况

特点:时间复杂度低 + 空间复杂度高。

原理:distinct需要将col列中的全部内容都存储在一个内存中,可以理解为一个hash结构,key为col的值,最后计算hash结构中有多少个key即可得到结果。需要将所有不同值存储在一起,内存消耗较大。

优点:时间复杂度低,适用于中小数据量级。


08 order by与distribute by sort by的区别「排序场景」

在排序场景中,这两个函数使我们经常遇到的,这两者的区别在于:


「order by」

适用于全局排序,数据放在一个reduce中处理。


「distribute by sort by」

适用于分组排序及全局排序,数据放在多个reduce中处理。


09 union与union all的区别「merge场景」

当需要将多个数据源合并在一起的时候,会遇到union的情况。


「union」

合并过程中,数据集去重合并。例如:输入多相同行,输出保留一行。


「union all」

合并过程中,数据集全部合并。因此,union all支持并行执行。例如:输入多相同行,输出多相同行。


10 哪些场景提供加速查询「limit场景」

众所周知,Hive查询是基于MR执行的,但调用Map/Reduce是存在时间成本的。如果我们只需要取几条探查一下表数据,通常通过limit限制查询的条数,而当where中除分区外没有其他过滤条件时,是不会生成Map/Reduce,数据即可输出,提升效率。

limit不生成Map/Reduce场景(推荐使用)

Select * from A limit 10;
Select * from A where ds = 20121212 limit 10;

limit生成Map/Reduce场景

Select * from A where ds = 20220101 and guid=’xxx’ limit 10;
Select a from A limit 10;
Select a from A where ds = 20220101 limit 10;

以上就是本期的内容分享

如果你也对数据分析感兴趣,那就来关注我吧,更多「原创」文章,与你分享!!

微信公众号:小火龙说数据

相关推荐

SQL入门知识篇(sql入门新手教程视频)

一、什么是数据库?什么是SQL?1、数据库:存放数据,可以很多人一起使用2、关系数据库:多张表+各表之间的关系3、一张表需要包含列、列名、行4、主键:一列(或一组列),其值能够唯一区分表中的每个行。5...

postgresql实现跨库查询-dblink的妙用

技术导语:用惯了oracle的dblink,转战postgresql,会一时摸不着头脑。本期就重点详细讲解postgresql如何安装dblink模块及如何使用dblink实现跨库查询。安装cont...

Oracle VM VirtualBox虚拟机软件(oracle vm virtualbox win10)

OracleVMVirtualBox是一款完全免费的虚拟机软件,下载银行有提供下载,软件支持安装windows、linux等多个操作系统,让用户可以在一台设备上实现多个操作系统的操作。同时软件有着...

开源 SPL 轻松应对 T+0(开源srs)

T+0问题T+0查询是指实时数据查询,数据查询统计时将涉及到最新产生的数据。在数据量不大时,T+0很容易完成,直接基于生产数据库查询就可以了。但是,当数据量积累到一定程度时,在生产库中进行大数据...

中小企业佳选正睿ZI1TS4-4536服务器评测

随着科技的不断发展,各行各业对于数据使用越加频繁,同时针对服务器的选择方面也就越来越多样化和细分化。那么对于我们用户来说,如何选择符合自身业务需求和最优性价比的产品呢?笔者将通过刚刚购买的这台服务器的...

MFC转QT:Qt基础知识(mfc和qt的区别)

1.Qt框架概述Qt的历史和版本Qt是一个跨平台的C++应用程序开发框架,由挪威公司Trolltech(现为QtCompany)于1991年创建。Qt的发展历程:1991年:Qt项目启动1995年...

数据库,QSqlTableModel(数据库有哪些)

QMYSQL——mysqlQSQLITE——sqliteQOICQ——orcale所需头文件.pro增加sql#include<QSqlDatabase>#include<Q...

python通过oledb连接dbf数据库(python连接jdbc)

起因:因为工作需要,需要读取dbf文件和系统数据中数据进行校对,因为知道dbf文件可以用sql查询,所以想能不能像mysql/oracle那样连接,再调用执行sql方法,通过一系列百度,尝试,最终通过...

Excel常用技能分享与探讨(5-宏与VBA简介 VBA与数据库)

在VBA(VisualBasicforApplications)中使用数据库(如Access、SQLServer、MySQL等)具有以下优点,适用于需要高效数据管理和复杂业务逻辑的场景:1....

Excel常用技能分享与探讨(5-宏与VBA简介 VBA与数据库-二)

以下是常见数据库软件的详细配置步骤,涵盖安装、驱动配置、服务启动及基本设置,确保VBA能够顺利连接:一、MicrosoftAccess适用场景:小型本地数据库,无需独立服务。配置步骤:安装Acces...

Windows Docker 安装(docker安装windows容器)

Docker并非是一个通用的容器工具,它依赖于已存在并运行的Linux内核环境。Docker实质上是在已经运行的Linux下制造了一个隔离的文件环境,因此它执行的效率几乎等同于所部署的L...

Windows下安装Ubuntu虚拟机方法(windows下安装ubuntu20)

在Windows下安装Ubuntu虚拟机。选择使OracleVMVirtualBox安装Ubuntu虚拟机。1.下载和安装OracleVMVirtualBox:访问OracleVMVir...

java入门教程1 - 安装和配置(win和linux)

windows安装和配置安装javahttps://www.oracle.com/java/technologies/javase/javase-jdk8-downloads.html目前大部分项目的...

Centos7 安装Tomcat8服务及配置jdk1.8教程

1、下载jdk1.8压缩包下载地址:https://www.oracle.com/java/technologies/javase/javase8-archive-downloads.htmltom...

全网最完整的免费java教程讲义(一)——java配置和安装

一,安装Java1)安装JDK要学习和使用java,首先需要安装JDK(JavaDevelopemntKit),相当于java安装包。Java的下载页在甲骨文官网上:https://www.or...

取消回复欢迎 发表评论: