百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术教程 > 正文

Oracle对百万条记录的数据sqlldr加载(超详细)

mhr18 2024-10-15 10:42 33 浏览 0 评论

欢迎关注

奋进的码哥的博客_CSDN博客-Oracle,hadoop,PostgreSQL领域博主

https://blog.csdn.net/u010438126?type=blog

背景:

在实际工作中应用SQLLDR执行数据加载,多数情况是数据量已经达到了一定的级别,下面是我自己构建了100W条记录的场景,看看实际加载情况如何,以及如何进行加载优化。

1,找到一张合适的表

[root@dongjj-pc-01 file]#sqlplus /nolog

SQL*Plus: Release 12.2.0.1.0 Production on 星期三 12月 28 17:45:36 2022

Copyright (c) 1982, 2016, Oracle. All rights reserved.

SQL> conn sys/abcABC123 as sysdba

已连接。

SQL> select count(*) from dba_objects;

COUNT(*)

----------

72930

做笛卡尔积关联,生成130W的记录

select a.owner||',"'||a.object_name||'",'||a.object_id||','||to_char(a.created,'YYYY-MM-DD hh24:mi:ss')||','||a.status

from dba_objects a,(select rownum as rn from dual connect by rownum <=20) b;

SQL> select count(*) from (

2 select a.owner||',"'||a.object_name||'",'||a.object_id||','||to_char(a.created,'YYYY-MM-DD hh24:mi:ss')||','||a.status

3 from dba_objects a,(select rownum as rn from dual connect by rownum <=20) b

4 ) m

5 ;


COUNT(*)

----------

1458600

2,生成数据文件并初始化数据

生成140W的记录,到指定csv文件中,具体的操作步骤如下

首先创建一个sql文件,保存上面的语句,注意在sql后面已经带分号 ;

[root@dongjj-pc-01 sql]#ls

load.sql

[root@dongjj-pc-01 sql]#pwd

/file/sql

[root@dongjj-pc-01 sql]#cat load.sql

select a.owner||',"'||a.object_name||'",'||a.object_id||','||to_char(a.created,'YYYY-MM-DD hh24:mi:ss')||','||a.status

from dba_objects a,(select rownum as rn from dual connect by rownum <=20) b;

[root@dongjj-pc-01 sql]#

创建执行sql文件,getdata.sql

set echo off

set term off

set line 1000 pages 0

set feedback off

set heading off

spool /file/data/load_data.csv

@/file/sql/load.sql

spool off

set heading on

set feedback on

set term on

set echo on

[root@dongjj-pc-01 sql]#pwd

/file/sql

[root@dongjj-pc-01 sql]#cat getdata.sql

set echo off

set term off

set trims on --去掉空字符

set line 1000 pages 0

set feedback off

set heading off

spool /file/data/load_data.csv

@/file/sql/load.sql

spool off

set heading on

set feedback on

set term on

set echo on

[root@dongjj-pc-01 sql]#

然后到sqlplus中,命令行执行getdata.sql

@/file/sql/getdata.sql

[root@dongjj-pc-2005 data]#ll -h

总用量 1.4G

-rw-r--r-- 1 root root 1.4G 1月 8 18:08 load_data.csv

初始化,创建测试表

create table tb_getdata(

owner varchar2(30),

object_name varchar2(50),

object_id number,

status varchar2(50),

created date

);

create index idx_ob on tb_getdata(owner,object_name);

4,创建控制文件 ldr_tb_getdata.ctl

LOAD DATA

INFILE '/file/data/load_data.csv'

truncate into table tb_getdata

fields terminated by "," optionally enclosed by '"'

(OWNER,

OBJECT_NAME,

OBJECT_ID,

CREATED date 'yyyy-mm-dd hh24:mi:ss',

STATUS

)

注意时间列这个字段,已经指定了时间格式,并进行了转换,一定要和数据文件的时间格式相符。不然会导致失败。

5,sqlldr 命令常规导入

sqlldr c##djj/c##djj@orcl control=ldr_tb_getdata.ctl errors = 10

查看导入日志

SQL*Loader: Release 12.2.0.1.0 - Production on 星期日 1月 8 20:41:42 2023

Copyright (c) 1982, 2017, Oracle and/or its affiliates.  All rights reserved.

控制文件:      ldr_tb_getdata.ctl
数据文件:      /file/data/load_data.csv
  错误文件:    load_data.bad
  废弃文件:    未作指定
 
(可废弃所有记录)

要加载的数: ALL
要跳过的数: 0
允许的错误: 10
绑定数组: 64 行, 最大 256000 字节
继续:    未作指定
所用路径:       常规

表 TB_GETDATA,已加载从每个逻辑记录
插入选项对此表 TRUNCATE 生效

   列名                  位置   长度  中止 包装 数据类型
------------------------------ ---------- ----- ---- ---- ---------------------
OWNER                               FIRST     *   ,  O (") CHARACTER            
OBJECT_NAME                          NEXT     *   ,  O (") CHARACTER            
OBJECT_ID                            NEXT     *   ,  O (") CHARACTER            
CREATED                              NEXT     *   ,  O (") DATE yyyy-mm-dd hh24:mi:ss
STATUS                               NEXT     *   ,  O (") CHARACTER            


表 TB_GETDATA:
  已成功载入 1453560 行。
  由于数据错误, 0 行 没有加载。
  由于所有 WHEN 子句失败, 0 行 没有加载。
  由于所有字段都为空值, 0 行 没有加载。


为绑定数组分配的空间:                 82560 字节 (64 行)
读取   缓冲区字节数: 1048576

跳过的逻辑记录总数:          0
读取的逻辑记录总数:       1453560
拒绝的逻辑记录总数:          0
废弃的逻辑记录总数:        0

从 星期日 1月  08 20:41:42 2023 开始运行
在 星期日 1月  08 20:42:24 2023 处运行结束

经过时间为: 00: 00: 41.83
CPU 时间为: 00: 00: 05.31

5.1 sqlldr 优化,使用rows

sqlldr这个命令默认的加载行数是64行,因为现在导入的行数是百万级别,需要重新设置rows的值

--加载全部数据,同时指定errors参数值=10,指定出现10次错误就停止加载。rows = 640

sqlldr c##djj/c##djj@orcl control=ldr_tb_getdata.ctl errors = 10 rows = 640

经过重设rwos的值,发现本次的导入时间缩短


SQL*Loader: Release 12.2.0.1.0 - Production on 星期日 1月 8 20:49:13 2023

Copyright (c) 1982, 2017, Oracle and/or its affiliates.  All rights reserved.

控制文件:      ldr_tb_getdata.ctl
数据文件:      /file/data/load_data.csv
  错误文件:    load_data.bad
  废弃文件:    未作指定
 
(可废弃所有记录)

要加载的数: ALL
要跳过的数: 0
允许的错误: 10
绑定数组: 640 行, 最大 256000 字节
继续:    未作指定
所用路径:       常规

表 TB_GETDATA,已加载从每个逻辑记录
插入选项对此表 TRUNCATE 生效

   列名                  位置   长度  中止 包装 数据类型
------------------------------ ---------- ----- ---- ---- ---------------------
OWNER                               FIRST     *   ,  O (") CHARACTER            
OBJECT_NAME                          NEXT     *   ,  O (") CHARACTER            
OBJECT_ID                            NEXT     *   ,  O (") CHARACTER            
CREATED                              NEXT     *   ,  O (") DATE yyyy-mm-dd hh24:mi:ss
STATUS                               NEXT     *   ,  O (") CHARACTER            

ROWS 参数所用的值已从 640 更改为 198

表 TB_GETDATA:
  已成功载入 1453560 行。
  由于数据错误, 0 行 没有加载。
  由于所有 WHEN 子句失败, 0 行 没有加载。
  由于所有字段都为空值, 0 行 没有加载。


为绑定数组分配的空间:                255420 字节 (198 行)
读取   缓冲区字节数: 1048576

跳过的逻辑记录总数:          0
读取的逻辑记录总数:       1453560
拒绝的逻辑记录总数:          0
废弃的逻辑记录总数:        0

从 星期日 1月  08 20:49:13 2023 开始运行
在 星期日 1月  08 20:49:43 2023 处运行结束

经过时间为: 00: 00: 29.98
CPU 时间为: 00: 00: 04.45

5.2 sqlldr优化,使用bindsize

可以设置bindsize的值,默认是256K,可以改为10m(即 1024*1024*10 = 10485760),同时将一次加载的行数提高到5000

sqlldr c##djj/c##djj@orcl control=ldr_tb_getdata.ctl errors = 10 rows = 5000 bindsize = 10485760

SQL*Loader: Release 12.2.0.1.0 - Production on 星期日 1月 8 20:56:01 2023

Copyright (c) 1982, 2017, Oracle and/or its affiliates.  All rights reserved.

控制文件:      ldr_tb_getdata.ctl
数据文件:      /file/data/load_data.csv
  错误文件:    load_data.bad
  废弃文件:    未作指定
 
(可废弃所有记录)

要加载的数: ALL
要跳过的数: 0
允许的错误: 10
绑定数组: 5000 行, 最大 10485760 字节
继续:    未作指定
所用路径:       常规

表 TB_GETDATA,已加载从每个逻辑记录
插入选项对此表 TRUNCATE 生效

   列名                  位置   长度  中止 包装 数据类型
------------------------------ ---------- ----- ---- ---- ---------------------
OWNER                               FIRST     *   ,  O (") CHARACTER            
OBJECT_NAME                          NEXT     *   ,  O (") CHARACTER            
OBJECT_ID                            NEXT     *   ,  O (") CHARACTER            
CREATED                              NEXT     *   ,  O (") DATE yyyy-mm-dd hh24:mi:ss
STATUS                               NEXT     *   ,  O (") CHARACTER            


表 TB_GETDATA:
  已成功载入 1453560 行。
  由于数据错误, 0 行 没有加载。
  由于所有 WHEN 子句失败, 0 行 没有加载。
  由于所有字段都为空值, 0 行 没有加载。


为绑定数组分配的空间:               6450000 字节 (5000 行)
读取   缓冲区字节数:10485760

跳过的逻辑记录总数:          0
读取的逻辑记录总数:       1453560
拒绝的逻辑记录总数:          0
废弃的逻辑记录总数:        0

从 星期日 1月  08 20:56:01 2023 开始运行
在 星期日 1月  08 20:56:25 2023 处运行结束

经过时间为: 00: 00: 23.81
CPU 时间为: 00: 00: 03.58

发现又缩短了几秒的时间。

那还能不能在快点呢?下面该使用杀手锏了。。。。。

可以使用直接路径加载,需要设置direct参数

5.3 sqlldr 优化,direct参数

sqlldr c##djj/c##djj@orcl control=ldr_tb_getdata.ctl direct = true


SQL*Loader: Release 12.2.0.1.0 - Production on 星期日 1月 8 21:00:23 2023

Copyright (c) 1982, 2017, Oracle and/or its affiliates.  All rights reserved.

控制文件:      ldr_tb_getdata.ctl
数据文件:      /file/data/load_data.csv
  错误文件:    load_data.bad
  废弃文件:    未作指定
 
(可废弃所有记录)

要加载的数: ALL
要跳过的数: 0
允许的错误: 50
继续:    未作指定
所用路径:       直接

表 TB_GETDATA,已加载从每个逻辑记录
插入选项对此表 TRUNCATE 生效

   列名                  位置   长度  中止 包装 数据类型
------------------------------ ---------- ----- ---- ---- ---------------------
OWNER                               FIRST     *   ,  O (") CHARACTER            
OBJECT_NAME                          NEXT     *   ,  O (") CHARACTER            
OBJECT_ID                            NEXT     *   ,  O (") CHARACTER            
CREATED                              NEXT     *   ,  O (") DATE yyyy-mm-dd hh24:mi:ss
STATUS                               NEXT     *   ,  O (") CHARACTER            

表 TB_GETDATA 的以下索引已处理:
索引 C##DJJ.IDX_OB 已成功加载, 具有 1453560 个关键字

表 TB_GETDATA:
  已成功载入 1453560 行。
  由于数据错误, 0 行 没有加载。
  由于所有 WHEN 子句失败, 0 行 没有加载。
  由于所有字段都为空值, 0 行 没有加载。

  日期转换高速缓存由于溢出而被禁用 (默认大小: 1000)

在直接路径中没有使用绑定数组大小。
列数组  行数:    5000
流缓冲区字节数:  256000
读取   缓冲区字节数: 1048576

跳过的逻辑记录总数:          0
读取的逻辑记录总数:       1453560
拒绝的逻辑记录总数:          0
废弃的逻辑记录总数:        0
由 SQL*Loader 主线程加载的流缓冲区总数:      336
由 SQL*Loader 加载线程加载的流缓冲区总数:      169

从 星期日 1月  08 21:00:23 2023 开始运行
在 星期日 1月  08 21:00:38 2023 处运行结束

经过时间为: 00: 00: 14.80
CPU 时间为: 00: 00: 02.01

时间直接缩短了10多秒,相当不错了啊

那还能不能再快点啊?别着急,还有办法啊

5.4 sqlldr优化,streamsize参数和date_cache参数

streamsize :

直接路径加载默认读取全部数据,因此不需要设置row参数,读取的数据存入流缓存区。该参数默认值是256k,可以加载到10mb,即10485760

date_cache:

该参数指定一个转换后的时间格式缓存区,以条为单位,默认值是1000条,即保存1000条后转换时间格式。因为导入的数据中有时间列,所以把该参数设置5000,以降低日期转换操作带来的时间开销。

sqlldr c##djj/c##djj@orcl control=ldr_tb_getdata.ctl direct = true streamsize = 10485760 date_cache = 5000

SQL*Loader: Release 12.2.0.1.0 - Production on 星期日 1月 8 21:17:16 2023

Copyright (c) 1982, 2017, Oracle and/or its affiliates.  All rights reserved.

控制文件:      ldr_tb_getdata.ctl
数据文件:      /file/data/load_data.csv
  错误文件:    load_data.bad
  废弃文件:    未作指定
 
(可废弃所有记录)

要加载的数: ALL
要跳过的数: 0
允许的错误: 50
继续:    未作指定
所用路径:       直接

表 TB_GETDATA,已加载从每个逻辑记录
插入选项对此表 TRUNCATE 生效

   列名                  位置   长度  中止 包装 数据类型
------------------------------ ---------- ----- ---- ---- ---------------------
OWNER                               FIRST     *   ,  O (") CHARACTER            
OBJECT_NAME                          NEXT     *   ,  O (") CHARACTER            
OBJECT_ID                            NEXT     *   ,  O (") CHARACTER            
CREATED                              NEXT     *   ,  O (") DATE yyyy-mm-dd hh24:mi:ss
STATUS                               NEXT     *   ,  O (") CHARACTER            

表 TB_GETDATA 的以下索引已处理:
索引 C##DJJ.IDX_OB 已成功加载, 具有 1453560 个关键字

表 TB_GETDATA:
  已成功载入 1453560 行。
  由于数据错误, 0 行 没有加载。
  由于所有 WHEN 子句失败, 0 行 没有加载。
  由于所有字段都为空值, 0 行 没有加载。

  日期高速缓存:
   最大大小:      5000
   条目数:      1663
   命中数    :   1451897
   未命中数  :         0

在直接路径中没有使用绑定数组大小。
列数组  行数:    5000
流缓冲区字节数:10485760
读取   缓冲区字节数: 1048576

跳过的逻辑记录总数:          0
读取的逻辑记录总数:       1453560
拒绝的逻辑记录总数:          0
废弃的逻辑记录总数:        0
由 SQL*Loader 主线程加载的流缓冲区总数:      336
由 SQL*Loader 加载线程加载的流缓冲区总数:        0

从 星期日 1月  08 21:17:16 2023 开始运行
在 星期日 1月  08 21:17:24 2023 处运行结束

经过时间为: 00: 00: 07.65
CPU 时间为: 00: 00: 01.09

从以上结果看出,时间直接缩短了两倍不止啊。。。。。

相关推荐

Spring Boot 分布式事务实现简单得超乎想象

环境:SpringBoot2.7.18+Atomikos4.x+MySQL5.71.简介关于什么是分布式事务,本文不做介绍。有需要了解的自行查找相关的资料。本篇文章将基于SpringBoot...

Qt编写可视化大屏电子看板系统15-曲线面积图

##一、前言曲线面积图其实就是在曲线图上增加了颜色填充,单纯的曲线可能就只有线条以及数据点,面积图则需要从坐标轴的左下角和右下角联合曲线形成完整的封闭区域路径,然后对这个路径进行颜色填充,为了更美观...

Doris大数据AI可视化管理工具SelectDB Studio重磅发布!

一、初识SelectDBStudioSelectDBStudio是专为ApacheDoris湖仓一体典型场景实战及其兼容数据库量身打造的GUI工具,简化数据开发与管理。二、Select...

RAD Studio 、Delphi或C++Builder设计代码编译上线缩短开发时间

#春日生活打卡季#本月,Embarcadero宣布RADStudio12.3Athens以及Delphi12.3和C++Builder12.3,提供下载。RADStudio12.3A...

Mybatis Plus框架学习指南-第三节内容

自动填充字段基本概念MyBatis-Plus提供了一个便捷的自动填充功能,用于在插入或更新数据时自动填充某些字段,如创建时间、更新时间等。原理自动填充功能通过实现com.baomidou.myba...

「数据库」Sysbench 数据库压力测试工具

sysbench是一个开源的、模块化的、跨平台的多线程性能测试工具,可以用来进行CPU、内存、磁盘I/O、线程、数据库的性能测试。目前支持的数据库有MySQL、Oracle和PostgreSQL。以...

如何选择适合公司的ERP(选erp系统的经验之谈)

很多中小公司想搞ERP,但不得要领。上ERP的目的都是歪的,如提高效率,减少人员,堵住财务漏洞等等。真正用ERP的目的是借机提升企业管理能力,找出管理上的问题并解决,使企业管理更规范以及标准化。上ER...

Manus放开注册,但Flowith才是Agent领域真正的yyds

大家好,我是运营黑客。前天,AIAgent领域的当红炸子鸡—Manus宣布全面放开注册,终于,不需要邀请码就能体验了。于是,赶紧找了个小号去确认一下。然后,额……就被墙在了外面。官方解释:中文版...

歌浓酒庄总酿酒师:我们有最好的葡萄园和最棒的酿酒师

中新网1月23日电1月18日,张裕董事长周洪江及总经理孙健一行在澳大利亚阿德莱德,完成了歌浓酒庄股权交割签约仪式,这也意味着张裕全球布局基本成型。歌浓:澳大利亚年度最佳酒庄据悉,此次张裕收购的...

软件测试进阶之自动化测试——python+appium实例

扼要:1、了解python+appium进行APP的自动化测试实例;2、能根据实例进行实训操作;本课程主要讲述用python+appium对APP进行UI自动化测试的例子。appium支持Androi...

为什么说Python是最伟大的语言?看图就知道了

来源:麦叔编程作者:麦叔测试一下你的分析能力,直接上图,自己判断一下为什么Python是最好的语言?1.有图有真相Java之父-JamesGoshlingC++之父-BjarneStrou...

如何在Eclipse中配置Python开发环境?

Eclipse是著名的跨平台集成开发环境(IDE),最初主要用来Java语言开发。但是我们通过安装不同的插件Eclipse可以支持不同的计算机语言。比如说,我们可以通过安装PyDev插件,使Eclip...

联合国岗位上新啦(联合国的岗位)

联合国人权事务高级专员办事处PostingTitleIntern-HumanRightsDutyStationBANGKOKDeadlineOct7,2025CategoryandL...

一周安全漫谈丨工信部:拟定超1亿条一般数据泄露属后果严重情节

工信部:拟定超1亿条一般数据泄露属后果严重情节11月23日,工信部官网公布《工业和信息化领域数据安全行政处罚裁量指引(试行)(征求意见稿)》。《裁量指引》征求意见稿明确了行政处罚由违法行为发生地管辖、...

oracle列转行以及C#执行语句时报错问题

oracle列转行的关键字:UNPIVOT,经常查到的怎么样转一列,多列怎么转呢,直接上代码(sshwomeyourcode):SELECTsee_no,diag_no,diag_code,...

取消回复欢迎 发表评论: