大数据学习之Hadoop环境搭建，真的是贼全

侯春强

2018-12-06

关注关注

一、Hadoop的优势

1）高可靠性：因为Hadoop假设计算元素和存储会出现故障，因为它维护多个工作数据副本，在出现故障时可以对失败的节点重新分布处理。

2）高扩展性：在集群间分配任务数据，可方便的扩展数以千计的节点。

3）高效性：在MapReduce的思想下，Hadoop是并行工作的，以加快任务处理速度。

4）高容错性：自动保存多份副本数据，并且能够自动将失败的任务重新分配。

二、Hadoop组成

1）Hadoop HDFS：一个高可靠、高吞吐量的分布式文件系统。

2）Hadoop MapReduce：一个分布式的离线并行计算框架。

3）Hadoop YARN：作业调度与集群资源管理的框架。

4）Hadoop Common：支持其他模块的工具模块。

2.1 HDFS（Hadoop Distributed File System）架构概述

1）NameNode（nn）：存储文件的元数据，如文件名，文件目录结构，文件属性（生成时间、副本数、文件权限），以及每个文件的块列表和块所在的DataNode等。

2）DataNode(dn)：在本地文件系统存储文件块数据，以及块数据的校验和。

3）Secondary NameNode(2nn)：用来监控HDFS状态的辅助后台程序，每隔一段时间获取HDFS元数据的快照。

2.2 YARN架构概述

1）ResourceManager(rm)：处理客户端请求、启动/监控ApplicationMaster、监控NodeManager、资源分配与调度；

2）NodeManager(nm)：单个节点上的资源管理、处理来自ResourceManager的命令、处理来自ApplicationMaster的命令；

3）ApplicationMaster：数据切分、为应用程序申请资源，并分配给内部任务、任务监控与容错。

4）Container：对任务运行环境的抽象，封装了CPU、内存等多维资源以及环境变量、启动命令等任务运行相关的信息。

2.3 MapReduce架构概述

MapReduce将计算过程分为两个阶段：Map和Reduce

1）Map阶段并行处理输入数据

2）Reduce阶段对Map结果进行汇总

三、Hadoop环境搭建

1 虚拟机网络模式设置为NAT

大数据学习之Hadoop环境搭建，真的是贼全

最后，重新启动系统。

2.修改为静态ip

1）使用命令 vim /etc/sysconfig/network-scripts/ifcfg-eth0

2）修改选项有五项：

IPADDR=192.168.110.61
 GATEWAY=192.168.110.2
 ONBOOT=yes
 BOOTPROTO=static
 DNS1=192.168.110.2

大数据学习之Hadoop环境搭建，真的是贼全

修改完成后保存退出（：wq ）

3）执行service network restart

4）如果报错，reboot，重启虚拟机

3.修改主机名　

1）修改linux的hosts文件

（1）进入Linux系统查看本机的主机名。通过hostname命令查看

大数据学习之Hadoop环境搭建，真的是贼全

（2）如果感觉此主机名不合适，我们可以进行修改。通过编辑/etc/sysconfig/network文件

大数据学习之Hadoop环境搭建，真的是贼全

（3）修改后保存退出

（4）编辑

vim /etc/hosts

大数据学习之Hadoop环境搭建，真的是贼全

（5）并重启设备，重启后，查看主机名，已经修改成功

4.关闭防火墙

1）查看防火墙开机启动状态

chkconfig iptables --list

2）关闭防火墙

chkconfig iptables off

5.安装jdk　

1）卸载现有jdk

（1）查询安装jdk的版本：

java -version

（2）查询是否安装java软件：

rpm -qa|grep java

（3）如果安装的版本低于1.7，卸载该jdk：

rpm -e 软件包

2）用filezilla工具将jdk导入到usr目录下面的java文件夹下面

3）在linux系统下的usr目录中查看软件包是否导入成功（使用.gz包或者.rpm包，本处使用.rpm包）。

大数据学习之Hadoop环境搭建，真的是贼全

4).gz包使用命令 tar -zxf jdk***.gz 解压到当前目录; .rpm包使用命令 rpm -ivh jdk***.rpm 进行安装.

5）配置jdk环境变量

（1）先获取jdk路径：使用命令pwd

大数据学习之Hadoop环境搭建，真的是贼全

（2）打开/etc/profile文件：

vi /etc/profile

在profie文件末尾添加jdk路径：

#set java environment JAVA_HOME=/usr/java/jdk1.8.0_171-amd64 JRE_HOME=/usr/java/jdk1.8.0_171-amd64/jre CLASS_PATH=.:$JAVA_HOME/lib/dt.jar:$JAVA_HOME/lib/tools.jar:$JRE_HOME/lib PATH=$PATH:$JAVA_HOME/bin:$JRE_HOME/bin export JAVA_HOME JRE_HOME CLASS_PATH PATH

（3）保存后退出：

:wq

（4）让修改后的文件生效：

大数据学习之Hadoop环境搭建，真的是贼全

6）重启（如果java –version可以用就不用重启）：

7) 测试jdk安装成功

大数据学习之Hadoop环境搭建，真的是贼全

四、安装Hadoop

1）通过用filezilla工具将Hadoop导入/usr/local/src/中，官方下载地址：http://mirrors.shu.edu.cn/apache/hadoop/common/

大数据学习之Hadoop环境搭建，真的是贼全

2）解压安装文件 tar -zxf hadoop-2.7.6.tar.gz

3）配置hadoop中的hadoop-env.sh

（1）Linux系统中获取jdk的安装路径：

大数据学习之Hadoop环境搭建，真的是贼全

(2）进入 hadoop-2.7.6/etc/hadoop/中，修改hadoop-env.sh文件中JAVA_HOME 路径：

export JAVA_HOME=/opt/module/jdk1.7.0_79

4）将hadoop添加到环境变量

（1）获取hadoop安装路径：

大数据学习之Hadoop环境搭建，真的是贼全

（2）打开/etc/profile文件：

在profie文件末尾添加hadoop路径：

#HADOOP_HOME
 export HADOOP_HOME=/usr/local/src/hadoop-2.7.6 export PATH=$PATH:$HADOOP_HOME/bin export PATH=$PATH:$HADOOP_HOME/sbin

（3）保存后退出：

:wq

（4）让修改后的文件生效：

大数据学习之Hadoop环境搭建，真的是贼全

（5）使用hadoop查看是否安装成功，如果hadoop命令不能使用则重启再查看。

大数据学习之Hadoop环境搭建，真的是贼全

作者：浪里套白龙

原文：大数据学习之Hadoop环境搭建 - 浪里套白龙 - 博客园

大数据学习之Hadoop环境搭建，真的是贼全

hadoop 大数据数据处理 hdfs hadoop集群搭建

侯春强

0 关注 0 粉丝 0 动态

关注关注

为什么Java仍将是未来的主流语言？

Java是一种通用编程语言，1995年由Sun Micro-systems公司开发。尽管已经有25年的历史，但它仍然统治着整个世界。根据Stack-overflow的开发者调查，它在2019年最受欢迎的语言中排名第5。超过41%的调查用户将Java标记为

minerd 2020-10-28

[AWS][大数据][Hadoop] 使用EMR做大数据分析

创建一个存储桶比如hadoop202006…这里我解释一下Hadoop集群中的一些组件，了解大数据的同学直接忽略就好。Apache Hadoop：在分布式服务器集群上存储海量数据并运行分布式分析应用的开源框架，其核心部件是HDFS与MapReduce。Ap

swazerz 2020-06-22

想了解大数据的鼻祖Hadoop技术栈，这里有一份优质书单推荐！

如何用形象的比喻描述大数据的技术生态？Hadoop、Hive、Spark 之间是什么关系？对于大部分人来说都是傻傻分不清楚。今年来大数据、人工智能获得了IT界大量的关注。程序猿们就是有这么实在，坐在地铁上还能那么投入的讨论技术问题。通常，一个技术的兴起，都

仁鱼 2020-06-20

Hive安装，以及一些问题处理

把apache-hive-1.2.1-bin.tar.gz上传到linux的/opt/software目录下。注意以tab键间隔。hive> create table student ROW FORMAT DELIMITED FIELDS TERMI

victorzhzh 2020-06-16

hadoop 数据处理总结

最近工作中用了了Hadoop，比如用Hadoop来处理广告的一些pv量数据、点击数据等，最后统计后给运营展示每个广告的数据报表。hadoop平台提供了分布式存储，分布式计算，任务调度、对象存储、和组件支撑服务。Hadoop主要用来存储以及处理大量并且复杂的

sujins 2020-05-30

hadoop伪分布式环境搭建

core-site.xml文件主要配置了访问Hadoop集群的主要信息，其中master代表主机名称，也可以使用IP替换，9000代表端口。外部通过配置的hdfs：//master：9000信息，就可以找到Hadoop集群。hdfs-site.xml配置文

WeiHHH 2020-09-23

hadoop框架三大组件hdfs、mapreduce、yarn 内容

1）分布式的运算程序往往需要分成至少2个阶段。2）第一个阶段的MapTask并发实例，完全并行运行，互不相干。3）第二个阶段的ReduceTask并发实例互不相干，但是他们的数据依赖于上一个阶段的所有MapTask并发实例的输出。4）MapReduce编程

tomli 2020-07-26

hdfs、hive、hbase的搭建总结

-- 完全分布式文件系统的名称：schema ip port -->. -- 分布式文件系统的其他路径的所依赖的一个基础路径，完全分布式不能使用默认值，因为临路径不安全，linux系统在重启时，可能会删除此目录下的内容-->. --

eternityzzy 2020-07-19

hadoop集群的启动与停止

漫长的启动时间…………思考：每次都一个一个节点启动，如果节点数增加到1000个怎么办？早上来了开始一个一个节点启动，到晚上下班刚好完成，下班？这些名称是我的三台机器的主机名，各位请改成自己的主机名！如果集群是第一次启动，需要格式化NameNode，这里使用

飞鸿踏雪0 2020-07-09

hadoop创建目录

//1.vm arguments中添加后面的参数来修改用户 -DHADOOP_USER_NAME=hadoop

硅步至千里 2020-06-25

Hadoop

8.在2008年，Doug加入了Yahoo，开源了Hadoop，在Yahoo期间设计实现了Pig、HBase等框架

HJWZYY 2020-06-21

大数据期末复习重点

系统上安装 jdk环境.基于/usr/local/ 目录下解压安装.注: 可检查目录大小: df-h/usr/local/　　。解压压缩包tar -zxvf jdk-7u80-linux.tar.gz 改名: mv jdk-7u80-linux jdk7　

ViMan0 2020-06-21

Hadoop之hadoop fs和hdfs dfs、hdfs fs三者区别

tackoverflow的解释Hadoop fs：使用面最广，可以操作任何文件系统。hadoop dfs与hdfs dfs：只能操作HDFS文件系统相关，前者已经Deprecated，一般使用后者。Following are the three comma

zzjmay 2020-06-08

hadoop两个namenode都是standby问题

经过不断地排查，发现在自己进行关闭和重启namenode的组件的时候，没有通过pip文件正常关闭，只能挨个关闭，这个也不是重点。经过修改pip文件的路径，解决了这个批量关闭启动的问题，原因是/tmpe目录系统会定期清理，导致进程号对不上了。关闭再启动hdf

sujins 2020-06-05

Hadoop之HDFS入门实战

某一个副本丢失后，它可以自动恢复。数据规模，可以达到PB级。文件规模，能够处理百万规模的文件数量。可构建在廉价机器上，通过多副本保证可靠性。不适合低延时数据访问。存储大量小文件，他会占用NameNode大量内存存储目录和块信息，这样不可取，因为NameNo

strongyoung 2020-06-01

Hadoop简介

要求被注入的属性 , 必须有set方法 , set方法的方法名由set + 属性首字母大写 , 如果属性是boolean类型 , 没有set方法 , 是 is .

sujins 2020-05-29

hadoop hdfs csv导入hive表

row format delimited fields terminated by ‘,‘ stored as textfile;

archive 2020-05-28

Hadoop3.2.0集群搭建常见注意事项

hadoop-env.sh中不光需要配置java-home,还需要声明下面这些用户变量,不然无法启动:. 如果出现这个说明连接配置有问题,查看core-site.xml配置,这个是配置datanode和namnode通信的:. hdfs应该配置成namno

changjiang 2020-11-16

hadoop 3.2.x 高可用集群搭建

配置 hadoop 高可用集群的原因：如果集群只有一个 NameNode，若NameNode 节点出现故障，那么整个集群都无法使用，也就是存在单点故障的隐患，hadoop 高可用集群能够实现 standby NameNode 自动切换为 active。HA

飞鸿踏雪0 2020-06-12

_服役新节点，退役旧节点，多目录配置。+_HDFS2.x的新特性

datanode会主动Namenode请求。这样服役新的节点就做完了。添加到白名单的主机节点，都允许访问NameNode，不在白名单的主机节点，都会被退出。在NameNode的/opt/module/hadoop-2.7.2/etc/hadoop目录下创建

Aleks 2020-08-19

安科网

大数据学习之Hadoop环境搭建，真的是贼全

侯春强

侯春强

相关推荐

为什么Java仍将是未来的主流语言？

[AWS][大数据][Hadoop] 使用EMR做大数据分析

想了解大数据的鼻祖Hadoop技术栈，这里有一份优质书单推荐！

Hive安装，以及一些问题处理

hadoop 数据处理总结

hadoop伪分布式环境搭建

hadoop框架三大组件hdfs、mapreduce、yarn 内容

hdfs、hive、hbase的搭建总结

hadoop集群的启动与停止

hadoop创建目录

Hadoop

大数据期末复习重点

Hadoop之hadoop fs和hdfs dfs、hdfs fs三者区别

hadoop两个namenode都是standby问题

Hadoop之HDFS入门实战

Hadoop简介

hadoop hdfs csv导入hive表

Hadoop3.2.0集群搭建常见注意事项

hadoop 3.2.x 高可用集群搭建

_服役新节点，退役旧节点，多目录配置。+_HDFS2.x的新特性

侯春强