Spark学习（三）：核心模块之RDD详解

andyshar

2018-09-17

关注关注

1. Spark核心模块整体简介

（1）Spark的关键运算组件图：

Spark学习（三）：核心模块之RDD详解

（2）总结：

Spark的核心组件总结包括RDD、Scheduler、Storage、Shuffle四部分：

1）RDD是Spark最核心最精髓的部分，spark将所有数据都抽象成RDD。

2）Scheduler是Spark的调度机制，分为DAGScheduler和TaskScheduler。

3）Storage模块主要管理缓存后的RDD、shuffle中间结果数据和broadcast数据

4）Shuffle分为Hash方式和Sort方式，两种方式的shuffle中间数据都写本地盘

2. 核心模块——RDD整体介绍

（1）RDD的概念：

1）RDD是Spark的基石，也是Spark的灵魂。

2）RDD是弹性分布式数据集，是只读的分区记录集合。

（2）每个RDD有5个主要的属性：

1）一组分片(Partition)：数据集的最基本组成单位

2）一个计算每个分片的函数：对于给定的数据集，需要做哪些计算

3）依赖（Dependencies）：RDD的依赖关系，描述了RDD之间的lineage

4）preferredLocations（可选）：对于data partition的位置偏好

5）partitioner（可选） -- 对于计算出来的数据结果如何分发

（3）RDD的举例1：

rdd1= sparkContext.textFile( “hdfs://…”)

rdd1是一个MappedRDD，该RDD是从外部文件创建的。

可以传入分片个数参数，否则采用defaultMinPartitions。

（4）RDD的举例2：

rdd2= rdd1.filter(_.startsWith( “ERROR”))

rdd2也是一个FilteredRDD，是从rdd1这个RDD衍生（即计算）得到的。

rdd1是rdd2的父节点，即rdd2依赖rdd1。

filter是RDD的操作，即每个分片需要计算的函数。

3. 核心模块——RDD操作

（1）RDD的操作工分为两类：转换transformations和动作actions

1）转换transformations

从现有的数据集创建一个新的数据集即数据集中的内容会发生更改，由数据集A转换成为数据集B

2）动作actions

在数据集上运行计算后，返回一个值给驱动程序。即数据集中的内容会被归约为一个具体的数值（Scala标量、集合类型的数据或存储）。

（2）具体的RDD方法举例如图：

Spark学习（三）：核心模块之RDD详解

4. 核心模块——RDD的持久化

（1）RDD持久化的时机：

1）默认情况下，每一个转换过的RDD都会在它之上执行一个动作时被重新计算。

2）如果rdd只被使用一次或者很少次，不需要持久化。如果rdd被重复使用或者计算其代价很高，才考虑持久化。另外，shuffle后生成的rdd尽量持久化，因为shuffle代价太高。

（2）RDD持久化的效果：

1RDD被缓存后，Spark将会在集群中，保存相关元数据，下次查询这个RDD时，它将能更快速访问，不需要计算。

2）如果持久化无谓的RDD，会浪费内存（或硬盘）空间，反而降低系统整体性能

（3）RDD持久化的方法：

1）使用 persist方法(或者cache方法)，持久化一个RDD在内存或磁盘中。

2）cache()过程是将RDD persist在内存里，persist()操作可以为RDD指定StorageLevel。

（4）RDD的存储级别StorageLevel

Spark学习（三）：核心模块之RDD详解

5. 核心模块——RDD依赖关系

（1）RDD之间存在依赖的原因：

1）RDD只能基于在稳定物理存储中的数据集和其他已有的RDD上执行确定性操作来创建。

2）能从其他RDD通过确定操作创建新的RDD的原因是RDD含有从其他RDD衍生（即计算）出本RDD的相关信息（即Lineage）

（2）RDD依赖的分类：

Dependency代表了RDD之间的依赖关系，即血缘（Lineage），分为窄依赖和宽依赖。

（3）窄依赖和宽依赖图形表示：

Spark学习（三）：核心模块之RDD详解

（4）依赖详解

窄依赖：

•一个父RDD最多被一个子RDD用

•常见的操作：map、filter、union等；

宽依赖：

•指子RDD的分区依赖于父RDD的所有分区，这是因为shuffle类操作要求所有父分区可用。

•常见的操作：比如groupByKey、reduceByKey、 sort、partitionBy等；

（5）基于RDD的依赖关系，spark的任务阶段划分原则：

根据RDD依赖关系的不同，Spark将每一个job分为不同的stage，stage之间的依赖关系形成了DAG图。具体来讲就是：

1）窄依赖Spark将其尽量划分在同一个stage中，因为它们可以进行流水线计算。

2）宽依赖往往意味着shuffle操作，这也是Spark划分stage的主要边界。

（6）阶段stage划分的示例图：

Spark学习（三）：核心模块之RDD详解

（7）针对示例图的解释：

1）一个Stage的开始就是从外部存储或者shuffle结果中读取数据；一个Stage的结束就是发生shuffle或者生成结果时。

2）由于rdd F是rdd G的宽依赖，所以将F与G分别划分到不同的stage，但是B是G的窄依赖（B的每个分区只被使用一次），所以B与G还保持在一个stage。

3）由于rdd A是rdd B的宽依赖，所以A和B划分在不同的stage

4）在图中Stage2中，从map到union都是窄依赖，在一个stage，这两步操作可以形成一个流水线操作，通过map操作生成的partition可以不用等待整个RDD计算结束，而是继续进行union操作，这样大大提高了计算的效率。

6. 核心模块——RDD的容错关系

如果transformation操作中间发生计算失败：

1）运算是窄依赖

只要把丢失的父RDD分区重算即可，跟其他节点没有依赖，这样可以大大加快场景恢复的开销。

2）运算是宽依赖

需要父RDD的所有分区都存在，重算代价就较高

3）增加检查点

当Lineage特别长时或者有宽依赖时，主动调用 checkpoint把当前数据写入稳定存储，作为检查点

spark rdd

andyshar

0 关注 0 粉丝 0 动态

关注关注

spark系列之基本概念

　　RDD是对象的分布式集合。　　RDD也提供数据沿袭——以图形形式给出每个中间步骤的祖先树，当RDD的一个分区丢失，可以根据祖先树重建该分区。　　RDD有两组操作，转换和行动，RDD转换是有惰性的，宽窄依赖。　　SparkSession是读取数据、处理元

Johnson0 2020-07-28

Spark DAG 依赖关系 Stage

记录了RDD之间的依赖关系，即RDD是通过何种变换生成的，如下图：RDD1是RDD2的父RDD，通过flatMap操作生成借助RDD之间的依赖关系，可以实现数据的容错，但是已经尽力避免产生shuffle. Task任务对应的是分区，即一个分区就是一个Ta

Hhanwen 2020-07-05

Spark RDD

②通过Spark读取外部存储文件，将文件数据转变为RDD。可以从本地磁盘读取，也可以从HDFS读取

adayan0 2020-07-05

Spark GraphX企业运用

Spark GraphX 是 Spark 的一个模块，主要用于进行以图为核心的计算还有分布式图的计算。GraphX 他的底层计算也是 RDD 计算，它和 RDD 共用一种存储形态，在展示形态上可以以数据集来表示，也可以图的形式来表示。边的表示用 RDD[E

zhixingheyitian 2020-05-29

spark企业运用

========== Spark SQL ==========1、Spark SQL 是 Spark 的一个模块，可以和 RDD 进行混合编程、支持标准的数据源、可以集成和替代 Hive、可以提供 JDBC、ODBC 服务器功能。统一的数据访问方式，Spa

Oeljeklaus 2020-05-29

Spark Streaming企业运用

========== Spark Streaming 是什么 ==========1、SPark Streaming 是 Spark 中一个组件，基于 Spark Core 进行构建，用于对流式进行处理，类似于 Storm。kafka、flume、HDFS

Hhanwen 2020-05-29

Spark RDD编程双Value类型交互

所谓双Value，就是两个数据集RDD之间进行操作。1 union：对源RDD和参数RDD合并后返回一个新的RDD，不会去重。2subtract：计算差的一种函数，去除两个RDD中相同的元素，不同的RDD将保留下来。5zip：将两个RDD组合成Key/Va

zhixingheyitian 2020-05-28

Spark原始码系列（五）分布式缓存

BlockManager与BlockManagerMaster的关系是什么？这个persist方法是在RDD里面的，所以我们直接打开RDD这个类。def persist: this.type = { // StorageLevel不能随意更改 if

粗茶淡饭 2020-05-27

spark系列-5、RDD、DataFrame、Dataset的区别和各自的优势

从一开始 RDD 就是 Spark 提供的面向用户的主要 API。从根本上来说，一个 RDD 就是你的数据的一个不可变的分布式元素集合，在集群中跨节点分布，可以通过若干提供了转换和处理的底层 API 进行并行处理。但与 RDD 不同的是，数据都被组织到有名

Hhanwen 2020-05-04

spark工作原理

它是被分区的，分为多个分区，每个分区分布在集群中的不同节点上，从而让RDD中的数据可以被并行操作。即如果某个节点上的RDD partition，因为节点故障，导致数据丢了，那么RDD会自动通过自己的数据来源重新计算该partition。

Hhanwen 2020-05-03

Spark RDD转DataFrame

* 导入包，支持把一个RDD隐式转换为DataFrame,

yanqianglifei 2020-04-22

小记--------sparkSQL - spark基础知识

本质上是一种分布式的内存抽象，表示一个只读的数据分区集合。一个RDD通常只能通过其他的RDD转换而创建，RDD定义了各种丰富的转换操作，通过转换操作，新的RDD包含了如何从其他RDD衍生所必须的信息。这些信息构成了RDD之间的依赖关系。而其中窄依赖的所有转

Oeljeklaus 2020-04-19

Spark SQL(6) OptimizedPlan

在这一步spark sql主要应用一些规则，优化生成的Resolved Plan，这一步涉及到的有Optimizer。之前介绍在sparksession实例化的是会实例化sessionState，进而确定QueryExecution、Analyzer，Op

Hhanwen 2020-07-26

spark 广播变量累加器

你还可以使用 destroy 方法彻底销毁广播变量，调用该方法后，如果计算任务中又用到广播变量，则会抛出异常。　　广播变量在一定数据量范围内可以有效地使作业避免 Shuffle，使计算尽可能本地运行，Spark 的 Map 端连接操作就是用广播变量实现的。

zhixingheyitian 2020-07-19

Spark 源码解读（五）SparkContext的初始化之创建和启动DAGScheduler

DAGScheduler主要用于在任务正式提交给TaskSchedulerImpl提交之前做一些准备工作，包括：创建job,将DAG中的RDD划分到不同的Stage,提交Stage等等。SparkContext中创建DAGScheduler的代码如下所示：

yanqianglifei 2020-07-07

Notebook Docker 安装spark环境

zhixingheyitian 2020-07-04

入门大数据---Spark开发环境搭建

Local 模式是最简单的一种运行方式，它采用单节点多线程方式运行，不用部署，开箱即用，适合日常测试开发。进入 spark-shell 后，程序已经自动创建好了上下文 SparkContext，等效于执行了下面的 Scala 代码：。安装完成后可以先做一个

Hhanwen 2020-06-25

Spark Streaming读取Kafka数据两种方式

Receiver从Kafka中获取的数据都是存储在Spark Executor的内存中的，然后Spark Streaming启动的job会去处理那些数据。在提交Spark Streaming任务后，Spark集群会划出指定的Receivers来专门、持续不

rongwenbin 2020-06-15

Apache Spark有哪些局限性

Apache Spark是行业中流行和广泛使用的大数据工具之一。Apache Spark已成为业界的热门话题，并且如今非常流行。但工业正在转移朝向apache flink。Apache Spark是为快速计算而设计的开源，闪电般快速的集群计算框架。Apac

sxyhetao 2020-06-12

使用经 EMRFS S3 优化的提交器提高 Apache Spark 写入 Apache Parquet 格式文件的性能

使用经 EMRFS S3 优化的提交器提高 Apache Spark 写入 Apache Parquet 格式文件的性能。经 EMRFS S3 优化的提交程序是一款新的输出提交程序，可用于Amazon EMR5.19.0 及更高版本的Apache Spar

hovermenu 2020-06-10

安科网

Spark学习（三）：核心模块之RDD详解

andyshar

andyshar

相关推荐

spark系列之基本概念

Spark DAG 依赖关系 Stage

Spark RDD

Spark GraphX企业运用

spark企业运用

Spark Streaming企业运用

Spark RDD编程双Value类型交互

Spark原始码系列（五）分布式缓存

spark系列-5、RDD、DataFrame、Dataset的区别和各自的优势

spark工作原理

Spark RDD转DataFrame

小记--------sparkSQL - spark基础知识

Spark SQL(6) OptimizedPlan

spark 广播变量累加器

Spark 源码解读（五）SparkContext的初始化之创建和启动DAGScheduler

Notebook Docker 安装spark环境

入门大数据---Spark开发环境搭建

Spark Streaming读取Kafka数据两种方式

Apache Spark有哪些局限性

使用经 EMRFS S3 优化的提交器提高 Apache Spark 写入 Apache Parquet 格式文件的性能

andyshar