Spark学习（七）：Spark1.6.2的单机安装

hangscer

2018-09-18

关注关注

1. 基础环境确认，单机安装Spark之前需要安装如下软件：

hadoop版本：2.6.4

JDK版本：1.8.0_92

2. 安装scala

1) 下载scala，地址是:

http://www.scala-lang.org/download/2.10.4.html

补充：Spark1.6.2对应的scala版本就是2.10.4

2)下载完后，将scala上传到linux服务器的目录下，这里以“/home/project/soft/scala”为例

3）在/home/project/soft/scala目录下解压scala

tar -xzvf scala-2.10.4.tgz

4) 配置环境变量，在/etc/profile文件中

vim /etc/profile

添加如下内容：

export SCALA_HOME=/home/project/soft/scala/scala-2.10.4

export PATH=$SCALA_HOME/bin:$PATH

5）保存并更新/etc/profile文件

source /etc/profile

6) 检查scala是否安装成功

scala -version

3. 安装Spark

1）下载spark，版本是1.6.2 ，地址是：

http://spark.apache.org/downloads.html

2）将下载的spark上传到linux服务器的目录下，这里以“/home/project/soft/spark”为例

3）在当前目录下解压

tar -xzvf spark-1.6.2-bin-hadoop2.6.tgz

4) 配置环境变量，在/etc/profile文件中

vim /etc/profile

添加如下内容：

export SPARK_HOME=/home/project/soft/spark/spark-1.6.2-bin-hadoop2.6

export PATH=$SPARK_HOME/bin:$PATH

5）保存并更新/etc/profile文件

source /etc/profile

6) 在conf目录下复制并重命名spark-env.sh.template为spark-env.sh：

cp spark-env.sh.template spark-env.sh vim spark-env.sh

添加如下内容：

export JAVA_HOME=/usr/java/jdk1.8.0_92

export SCALA_HOME=/home/project/soft/scala/scala-2.10.4

export SPARK_MASTER_IP=59.110.137.54

export SPARK_WORKER_MEMORY=1G

7) 启动spark. SPARK_HOME/sbin/start-all.sh

切换到spark的sbin目录下

cd sbin

执行命令：

./start-all.sh

8)测试Spark是否安装 /bin/run-example SparkPi

切换目录

cd ../bin

执行命令：

./run-example SparkPi

最终会出现：

Pi is roughly 3.1459即安装成功

9) 访问spark的webui

http://ip:端口（端口有的是8080，有的是8081）

10) 停止spark. SPARK_HOME/sbin/stop-all.sh

切换到spark的sbin目录下

cd ../sbin

执行命令：

./stop-all.sh

spark scala

hangscer

0 关注 0 粉丝 0 动态

关注关注

今天的收获

直接用jar包方便许多。编程似乎在不断完善，没有人知道未来是啥。因为map和reduce不够用。scala编写代码比java精简。sbt相对于scala来说就相当于 maven对java差不多。

zhixingheyitian 2020-06-08

spark集群环境搭建

1.安装jdk参考https://blog.51cto.com/13001751/1980999 2.安装scala下载路径： https://downloads.lightbend.com/scala/2.12.8/scala-2.12.8.tgz

Hhanwen 2020-05-04

Spark集群式安装部署

在master节点上安装配置完成Spark后，将整个spark目录拷贝到其他节点，并在各个节点上更新/etc/profile文件中的环境变量。- 在master节点启动Hadoop集群- 在master节点启动spark [spark-2.4.

飞鸿踏雪0 2020-04-16

Spark集群的搭建

Type in expressions for evaluation. Or try :help.export SCALA_HOME=/opt/soft/scala-2.13.1 #scala的安装目录。export SPARK_WORKER_CORES

kekeromer 2020-04-16

spark系列之基本概念

　　RDD是对象的分布式集合。　　RDD也提供数据沿袭——以图形形式给出每个中间步骤的祖先树，当RDD的一个分区丢失，可以根据祖先树重建该分区。　　RDD有两组操作，转换和行动，RDD转换是有惰性的，宽窄依赖。　　SparkSession是读取数据、处理元

Johnson0 2020-07-28

Spark SQL(6) OptimizedPlan

在这一步spark sql主要应用一些规则，优化生成的Resolved Plan，这一步涉及到的有Optimizer。之前介绍在sparksession实例化的是会实例化sessionState，进而确定QueryExecution、Analyzer，Op

Hhanwen 2020-07-26

spark 广播变量累加器

你还可以使用 destroy 方法彻底销毁广播变量，调用该方法后，如果计算任务中又用到广播变量，则会抛出异常。　　广播变量在一定数据量范围内可以有效地使作业避免 Shuffle，使计算尽可能本地运行，Spark 的 Map 端连接操作就是用广播变量实现的。

zhixingheyitian 2020-07-19

Spark 源码解读（五）SparkContext的初始化之创建和启动DAGScheduler

DAGScheduler主要用于在任务正式提交给TaskSchedulerImpl提交之前做一些准备工作，包括：创建job,将DAG中的RDD划分到不同的Stage,提交Stage等等。SparkContext中创建DAGScheduler的代码如下所示：

yanqianglifei 2020-07-07

Spark DAG 依赖关系 Stage

记录了RDD之间的依赖关系，即RDD是通过何种变换生成的，如下图：RDD1是RDD2的父RDD，通过flatMap操作生成借助RDD之间的依赖关系，可以实现数据的容错，但是已经尽力避免产生shuffle. Task任务对应的是分区，即一个分区就是一个Ta

Hhanwen 2020-07-05

Spark RDD

②通过Spark读取外部存储文件，将文件数据转变为RDD。可以从本地磁盘读取，也可以从HDFS读取

adayan0 2020-07-05

Notebook Docker 安装spark环境

zhixingheyitian 2020-07-04

入门大数据---Spark开发环境搭建

Local 模式是最简单的一种运行方式，它采用单节点多线程方式运行，不用部署，开箱即用，适合日常测试开发。进入 spark-shell 后，程序已经自动创建好了上下文 SparkContext，等效于执行了下面的 Scala 代码：。安装完成后可以先做一个

Hhanwen 2020-06-25

Spark Streaming读取Kafka数据两种方式

Receiver从Kafka中获取的数据都是存储在Spark Executor的内存中的，然后Spark Streaming启动的job会去处理那些数据。在提交Spark Streaming任务后，Spark集群会划出指定的Receivers来专门、持续不

rongwenbin 2020-06-15

Apache Spark有哪些局限性

Apache Spark是行业中流行和广泛使用的大数据工具之一。Apache Spark已成为业界的热门话题，并且如今非常流行。但工业正在转移朝向apache flink。Apache Spark是为快速计算而设计的开源，闪电般快速的集群计算框架。Apac

sxyhetao 2020-06-12

使用经 EMRFS S3 优化的提交器提高 Apache Spark 写入 Apache Parquet 格式文件的性能

使用经 EMRFS S3 优化的提交器提高 Apache Spark 写入 Apache Parquet 格式文件的性能。经 EMRFS S3 优化的提交程序是一款新的输出提交程序，可用于Amazon EMR5.19.0 及更高版本的Apache Spar

hovermenu 2020-06-10

spark考试

零，第0章-课程介绍。大数据的基本概念、关键技术和代表性软件。介绍Scala语言基础语法。Spark简介、运行架构、RDD的设计与运行原理、部署模式。Spark的基本安装方法，如何在spark-shell中运行代码以及如何开发Spark独立应用程序。RDD

Oeljeklaus 2020-06-10

Mr与spark的shuffle过程详解及对比

大数据的分布式计算框架目前使用的最多的就是hadoop的mapReduce和Spark，mapReducehe和Spark之间的最大区别是前者较偏向于离线处理，而后者重视实现性，下面主要介绍mapReducehe和Spark两者的shuffle过程。Map

Johnson0 2020-06-08

spark的编译

./build/mvn -Pyarn -Phadoop-2.7 -Dhadoop.version=2.7.7 -Phive -Phive-thriftserver -Pyarn -DskipTests clean package. 我们可以使用Spark源

zhixingheyitian 2020-06-01

Apache Spark

Apache Spark是一个开源集群运算框架，最初是由加州大学柏克莱分校AMPLab所开发。相对于Hadoop的MapReduce会在运行完工作后将中介数据存放到磁盘中，Spark使用了存储器内运算技术，能在数据尚未写入硬盘时即在存储器内分析运算。Spa

xclxcl 2020-05-31

Spark分区

在Spark中，RDD是其最基本的抽象数据集，其中每个RDD是由若干个Partition组成。在Job运行期间，参与运算的Partition数据分布在多台机器的内存当中。图一中，RDD1包含了5个Partition，RDD2包含了3个Partition，这

Hhanwen 2020-05-29

安科网

Spark学习（七）：Spark1.6.2的单机安装

hangscer

hangscer

相关推荐

今天的收获

spark集群环境搭建

Spark集群式安装部署

Spark集群的搭建

spark系列之基本概念

Spark SQL(6) OptimizedPlan

spark 广播变量累加器

Spark 源码解读（五）SparkContext的初始化之创建和启动DAGScheduler

Spark DAG 依赖关系 Stage

Spark RDD

Notebook Docker 安装spark环境

入门大数据---Spark开发环境搭建

Spark Streaming读取Kafka数据两种方式

Apache Spark有哪些局限性

使用经 EMRFS S3 优化的提交器提高 Apache Spark 写入 Apache Parquet 格式文件的性能

spark考试

Mr与spark的shuffle过程详解及对比

spark的编译

Apache Spark

Spark分区

hangscer