Hadoop快速入门.pdf

zhangketuan

2015-01-13

Hadoop快速入门.pdf

http://hadoop.apache.org/docs/r1.0.4/cn/quickstart.html#%E4%B8%8B%E8%BD%BD

Hadoop快速入门

目的

这篇文档的目的是帮助你快速完成单机上的Hadoop安装与使用以便你对Hadoop分布式文件系统(HDFS)和Map-Reduce框架有所体会，比如在HDFS上运行示例程序或简单作业等。

先决条件

支持平台

GNU/Linux是产品开发和运行的平台。 Hadoop已在有2000个节点的GNU/Linux主机组成的集群系统上得到验证。
Win32平台是作为开发平台支持的。由于分布式操作尚未在Win32平台上充分测试，所以还不作为一个生产平台被支持。

所需软件

Linux和Windows所需软件包括:

Java^TM1.5.x，必须安装，建议选择Sun公司发行的Java版本。
ssh 必须安装并且保证 sshd一直运行，以便用Hadoop 脚本管理远端Hadoop守护进程。

Windows下的附加软件需求

Cygwin - 提供上述软件之外的shell支持。

安装软件

如果你的集群尚未安装所需软件，你得首先安装它们。

以Ubuntu Linux为例:

$ sudo apt-get install ssh
$ sudo apt-get install rsync

在Windows平台上，如果安装cygwin时未安装全部所需软件，则需启动cyqwin安装管理器安装如下软件包：

openssh - Net 类

下载

为了获取Hadoop的发行版，从Apache的某个镜像服务器上下载最近的稳定发行版。

运行Hadoop集群的准备工作

解压所下载的Hadoop发行版。编辑 conf/hadoop-env.sh文件，至少需要将JAVA_HOME设置为Java安装根路径。

尝试如下命令：
$ bin/hadoop
将会显示hadoop 脚本的使用文档。

现在你可以用以下三种支持的模式中的一种启动Hadoop集群：

单机模式
伪分布式模式
完全分布式模式

单机模式的操作方法

默认情况下，Hadoop被配置成以非分布式模式运行的一个独立Java进程。这对调试非常有帮助。

下面的实例将已解压的 conf 目录拷贝作为输入，查找并显示匹配给定正则表达式的条目。输出写入到指定的output目录。
$ mkdir input
$ cp conf/*.xml input
$ bin/hadoop jar hadoop-*-examples.jar grep input output 'dfs[a-z.]+'
$ cat output/*

伪分布式模式的操作方法

Hadoop可以在单节点上以所谓的伪分布式模式运行，此时每一个Hadoop守护进程都作为一个独立的Java进程运行。

配置

使用如下的 conf/hadoop-site.xml:

<configuration>

<property>

<name>fs.default.name</name>

<value>localhost:9000</value>

</property>

<property>

<name>mapred.job.tracker</name>

<value>localhost:9001</value>

</property>

<property>

<name>dfs.replication</name>

<value>1</value>

</property>

</configuration>

免密码ssh设置

现在确认能否不输入口令就用ssh登录localhost:
$ ssh localhost

如果不输入口令就无法用ssh登陆localhost，执行下面的命令：
$ ssh-keygen -t dsa -P '' -f ~/.ssh/id_dsa
$ cat ~/.ssh/id_dsa.pub >> ~/.ssh/authorized_keys

执行

格式化一个新的分布式文件系统：
$ bin/hadoop namenode -format

启动Hadoop守护进程：
$ bin/start-all.sh

Hadoop守护进程的日志写入到 ${HADOOP_LOG_DIR} 目录 (默认是 ${HADOOP_HOME}/logs).

浏览NameNode和JobTracker的网络接口，它们的地址默认为：

NameNode - http://localhost:50070/
JobTracker - http://localhost:50030/

将输入文件拷贝到分布式文件系统：
$ bin/hadoop fs -put conf input

运行发行版提供的示例程序：
$ bin/hadoop jar hadoop-*-examples.jar grep input output 'dfs[a-z.]+'

查看输出文件：

将输出文件从分布式文件系统拷贝到本地文件系统查看：
$ bin/hadoop fs -get output output
$ cat output/*

或者

在分布式文件系统上查看输出文件：
$ bin/hadoop fs -cat output/*

完成全部操作后，停止守护进程：
$ bin/stop-all.sh

完全分布式模式的操作方法

关于搭建完全分布式模式的，有实际意义的集群的资料可以在这里找到。

Java与JNI是Sun Microsystems, Inc.在美国以及其他国家地区的商标或注册商标。

padding margin hadoop

zhangketuan

0 关注 0 粉丝 0 动态

相关推荐

vmware扩展跟分区

进行的操作：在 windows 下运行 CMD , 转到 vmware 的安装目录,可执行vmware-vdiskmanager.exe；在Linux下，直接敲入vmware-vdiskmanager ,可执行该指令扩充使用的指令: vmware-vdis

周公周金桥 2020-09-06

Wyn Enterprise中如何转换数据类型？

在设计报表或者仪表板时，有时候从数据集获取到的数据类型和我们分析所需的类型并不匹配，不是同一种数据类型，可能会造成无法将数据正确分类或者过滤等情况。此处主要是仪表板数据集的数据类型转换。此处要注意，直接通过下拉选择调整类型可能部分情况不会生效。此时，需要使

大象从不倒下 2020-07-31

css基础--盒子模型

1 绝大多数标签都可以看作盒子，可以设置宽高或设置内容；在CSS中，"box model"这一术语是用来设计和布局时使用。　　CSS盒模型本质上是一个盒子，封装周围的HTML元素，它包括：边距，边框，填充，和实际内容。　　盒模型允许我们

AlisaClass 2020-07-19

多张图片懒加载

ul li { height: 900px; margin: 100px auto; text-align: center; }. oDiv.style.display = ‘block‘ : oDiv.style.display = ‘none‘

MaureenChen 2020-04-21

知识图谱如何改变银行业务模式？

知识图谱被构造为附加的虚拟数据层，位于现有数据库之上，并将数据大规模链接在一起。由于知识图谱基于知识和概念，因此要想创建良好的知识图谱，必须让整个组织内不同领域的主题专家都参与进来。试图建立自己的知识图谱的金融机构不必从头开始。由于知识图谱能够以智能的方式

xingguanghai 2020-03-13

web第六天，CSS优先级与盒子模型

　　　　通过设置inherit值，可以改变默认的继承方式。　　　　当设置相同样式时，后写的优先级较高，但不建议出现重复设置样式的情况。　　　　场景：紧急情况下使用。　　　　群组选择器与单一选择器的权重相同，靠后写的优先级高。　　　　3，padding属

teresalxm 2020-02-18

css布局及鼠标悬浮下拉框展现

<span class="span-left"> 信息。。。。。。。。。<span class="span-right"><span>评论|</span><spa

木四小哥 2013-05-14

Scope- ruby中变量的作用范围

当程序从一个class，或者module，或者method进入（退出）时，作用域就会改变，对应的3个关键字为：class module，和 def，每一个关键字的位置就是作用域的入口。class和module的作用域于method的不同，当定义class

SoShellon 2013-06-01

Nginx 下缓存静态文件（如css js)(转)

如css,js,htm,html,jpg,gif,png,flv,swf，这些文件都不是经常更新。便于缓存以减轻服务器的压力。proxy_cache cache_one;设置缓存共享内存区块，也就是keys_zone名称。proxy_cache_valid

Simagle 2013-05-31

浏览器缓存机制

Cache-Control 是最重要的规则。这个字段用于指定所有缓存机制在整个请求/响应链中必须服从的指令。这些指令指定用于阻止缓存对请求或响应造成不利干扰的行为。这些指令通常覆盖默认缓存算法。缓存指令是单向的，即请求中存在一个指令并不意味着响应中将存在同

羽化大刀Chrome 2013-05-31

css的margin与padding练习

DOCTYPE html><html lang="en"><head> <meta charset="UTF-8"> <title>margin<

waterv 2020-01-08

svn c命令

大数据资料共享。

ganyouxianjava 2012-05-31

inotify+rsync实现linux文件批量更新[转]

Timeout = 300通过该选项可以覆盖客户指定的IP超时时间.通过该选项可以确保rsync服务器不会永远等待一个崩溃的客户端.超时单位为秒钟,0表示没有超时定义,这也是默认值.对于匿名rsync服务器来说,一个理想的数字是600.#transfer

LutosX 2013-07-29

linux_5 个获取 Linux 主机信息的命令

Linux 系统管理员在接手一台新的服务器的时候，如果没有好的交接文档，我们可以得到的主机信息就要靠我们自己了。很多信息是可以直接通过命令从主机上获得的，下面就和大家分享 5 个获取 Linux 主机信息的命令。您可能会注意到，主机名通常也出现在命令提示符

vanturman 2013-06-27

Linux中SWAP交换分区

编辑 /etc/fstab文件，并增加如下第二行代码。如果您喜欢这篇文章。UUID=b45eed4a-b319-43fa-9d03-200c558b5d84 / ext4 defaults 1 1UUID=0ab45aeb-98f7-4f31-863d-7

wutongyuq 2013-04-12

mac系统如何显示和隐藏文件

显示Mac隐藏文件的命令：defaults write com.apple.finder AppleShowAllFiles YES. 隐藏Mac隐藏文件的命令：defaults write com.apple.finder AppleShowAllFil

luoqu 2013-04-10

【内测来袭】PerfDogService 一键搭建您的性能测试平台

PerfDog是一款移动平台的性能测试工具，快速定位分析性能问题，提升APP应用及游戏性能和品质。手机无需ROOT/越狱，手机硬件、游戏及应用APP也无需做任何修改，极简化即插即用，是全网唯一支持iOS/Android/小程序/H5等移动全平台性能测试的工

today0 2020-09-22

最靠谱的http协议无状态解释

3 每次的请求都是独立的，它的执行情况和结果与前面的请求和之后的请求是无直接关系的，它不会受前面的请求应答情况直接影响，也不会直接影响后面的请求应答情况。所以，这个状态，加上前面说的客户端也有cookie，就是指，客户端和服务器在临时会话中产生的数据！

89520292 2020-09-18

(转)[iOS概念]Apple Pay与IAP的区别

在Apple Pay的发布会上,Eddy Cue表示,苹果并没有兴趣建立一个收集用户数据的业务,苹果并不知道你购买了什么,不知道你是从哪里购买的,为了这个商品花了多少钱。所以这也就是苹果和支付宝,微信等最大的不同:Apple Pay并不会将资金存放在App

bigname 2020-08-25

QNET：APP弱网络测试专家

基本思路是在PC上装一个Fiddler网络抓包工具，然后再将Android设备的网络代理到PC上，通过在PC上的Fiddler在设置延时来进行弱网络模拟。

灵均兰草 2020-08-20

zhangketuan

W3CSchool教程: HTML 教程; CSS 教程; Bootstrap 教程; Javascript 教程; jQuery 教程

后端教程: C 教程; Java 教程; PHP 教程; Python 教程; Go 教程

移动开发: Android 教程; Swift 教程; Kotlin 教程; jQuery Mobile 教程; ionic 教程

关于我们: 新闻动态; 联系方式; 招聘英才; 安科实验室; 帮助与反馈

安科网(Ancii)，中国第一极客网

Copyright © 2013 - 2019 Ancii.com

京ICP备18063983号京公网安备11010802014868号