Hadoop架构: HDFS中数据块的状态及其切换过程，GS与BGS

IT智囊

2020-02-20

该系列总览: Hadoop3.1.1架构体系——设计原理阐述与Client源码图文详解 : 总览

首先，我们要提出HDFS存储特点：

1.高容错

2.一个文件被切成块(新版本默认128MB一个块)在不同的DataNode存储

3.客户端通过流水线，在NameNode的调节下，将数据以Packet的形式流式地输送到流水线上

如果不清楚NameNode，DataNode等概念请先阅读HDFS架构文档: Hadoop架构中文文档

为了确保上述这些特点，HDFS对块的状态进行了定义，以控制数据块在传输过程中的有效性。

在NameNode看来，块(Block)主要有以下4种状态。

1.UNDER_CONSTRUCTION

　　2.UNDER_RECOVERY

　　3.COMMITED

　　4.COMPLETED

在DataNode看来，块(Block)应该称为“备份 (Replica)”比较合适，在DataNode种，备份主要有以下几种状态

　　1.RBW (Replica Begin Written)

　　2.RWR (Replica Waiting To Be Recovered)

　　3.RUR (Replica Under Recovery)

　　4.FINALIZED

　　5.TEMP

前三个比较好记，都是以Replica开头，而且只有DataNode中的块被称为Replica(备份)

我们还需要介绍一下两个比较重要的概念BGS,GS。有了这两个概念才能展开讲。

1.GS ( Generation Stamp ) : 这是被NameNode维护的一个类似版本标签的全局唯一标识，他是一个8字节的整数，当一个NameNode格式化文件系统的时候，这个标识被初始化为1

以下的事件能够让GS+1

1.当客户端请求NameNode创建一个新的文件

2.当客户端请求NameNode打开一个文件来以便向里面追加(append)内容或者删减内容(truncate)

3.当客户端在流水线工作过程中失败，需要恢复流水线，客户端回向NameNode讨要一个新的GS

4.NameNode以客户端的名义续租(Lease Recovery) 详见 : Hadoop架构: 关于Recovery (Lease Recovery , Block Recovery, PipeLine Recovery)

GS + 1后将被写入到NameNode的日志记录里。

2.BGS (Block Generation Stamp) ：其实是没有这个概念的，但是为了区分GS，提出来了。BGS用来标记一个Block（以及他的Replica）的版本。以区分Replica是否过期

【在NameNode中数据块被称作Block，在DataNode中数据块是Block的备份，被称为Replica】的版本。

一.BGS在文件创建或者append时的处理。

1新建. 当客户端向NameNode申请创建文件或者打开文件进行追加的时候，往往都需要一个新的Block，NameNode会为这个Block打上一个新的BGS。新BGS产生方式很简单，NameNode将现在的GS + 1就得到了新的BGS（NameNode同时要把 + 1后的GS写到日志里）。一个块的创建不仅要新的BGS,而且还需要新的BlockId来表示这个Block，并且NameNode需要给出Block的Replica能放在哪些DataNode上，也就是Block的Locations。(Locations不会被写入日志，而是在NameNode启动后接收DataNode的报告来获取)。

　　2获取. 客户端将得到的新BGS和BlockId发布到流水线中，让DataNode获取，DataNode获取到新的BlockId和BGS。如果客户端的意图是创建文件的话，会新建一个块文件，如果是追加的话，会打开一个块文件，最后的结果都是把新的BGS和BlockId写入DataNode的MetaFile(存储文件元数据的文件，元数据比如BGS,BlockId)。

　　3回复.如果第2步没有错误，客户端将通知NameNode，新建一个OpenFile事务，并且写入日志。该事务包含当前正在写入文件的完整路径信息，以及每一个块的BlockId和BGS。

二.在写入时新建Block时

　　1.当在对一个块进行写入，如果客户端要求NameNode创建一个新的Block，NameNode会创建新的Block并且新建StoreGS事务和OpenFile事务，并且写入日志。前者记录新产生的GS(每个Block被新建都要让NameNode的GenerationStamp + 1)，后者记录文件所有Block的BGS和BlockId。

　　2.客户端将从NameNode那里获得的新Block的相关信息发布到流水线上，和一中的2差不多

简单地理解，GS是整个文件系统的版本号，BGS是块的版本号。

当某些退出DataNode集群很久的节点加入时，根据GS可以识别出他们是否是旧的节点。

BGS用来识别一个块是否过期。只有未过期的块才会被进行特定操作，下文会提及。

聪明的你可能已经发现，上述状态中出现了一个难以理解的词 “Recovery”

这个词在客户端记录DataStreamer运作状态的枚举类BlockConstructionStage中也有出现

我们先聊一聊什么是 “Recovery”。详见 Hadoop架构: 关于Recovery (Lease Recovery , Block Recovery, PipeLine Recovery)

如果你对Recovery有了大体理解，我们就可以来谈谈这些复杂的状态之间是怎么转换的了。

首先是在NameNode中

1.当客户端Writer申请新建一个块，NameNode就会在本地新建一个块，这个block的状态是UNDER_CONSTRUCTION

2.当NameNode为某个文件进行租约恢复（Lease Recovery），该文件的最后一个块的状态转为UNDER_RECOVERY

3.当客户端在写文件的时候向NameNode申请一个新的Block(上一个Block写满了或者以不明原因endBlock)，或者请求关闭文件，NameNode会把上一个Block的状态设置为Commited，如果没有最小备份数(可以在配置里自行设置)的DataNode向NameNode汇报自己收到了和NameNode中Block同BGS的Finalized态Replica，那么Commited状态会保持下去。

4.当有最小备份数的DataNode向NameNode汇报，自己已经有关于这个块的FINALIZED态Replica，并且BGS和NameNode的Block的BSG一样。那么NameNode就会把自己的Block设置成COMPLETE态。

注：客户端写完一个块，或者客户端关闭某个文件，都会告知流水线上的DataNode，DataNode们收到了前述信息(关闭或者写完)，认为这个块将被结束操作，会试图把自己的Replica设置成FINALIZED态，并且向NameNode汇报。

其次是在DataNode中

1.当一个备份(块的备份)被写入数据的时候，被设置成RBW(Replica Being Writen)，一个块被创建，意味着要被写入，所以处于RBW态。

当客户端打开某个现有的文件打算追加(append)或者删减(truncate)，一般是最末尾的Replica被设置成RBW,因为一般是在文件末尾追加或者删减。

RBW状态的块对Reader客户端是可见的

2.RWR(Replica Waitting To Be Recovery),等待恢复的块，当一个DataNode在流水线传输过程中宕机，那么当他重启后，所有的之前在流水线中正在被写的RBW态Replica都会转换成RWR态

RWR态的Replica是不会再加入流水线了的，但是如果DataNode和写客户端Writer一同宕机，NameNode在租约恢复（Lease Recovery）时，会让领袖DataNode对这些Replica进行操作。当租

约恢复，这些RWR状态将成为FINALIZED。

3.RUR(Replica Under Recovery) 正在恢复的备份，租约恢复文件的当前备份中，可能有RBW(正在被写入的备份)的，RWR(需要被恢复，DataNode宕机重启导致RBW -> RWR)的，FINALIZED（流水线关闭阶段会通知DataNode将Replica设置成FINALIZED）的，在租约恢复执行阶段会被设置成RUR态。(在Hadoop架构: 关于Recovery (Lease Recovery , Block Recovery, PipeLine Recovery) 中有详细讲解)

4.FINALIZED,当客户端Writer在一个Block写满后，将会通知流水线上的DataNode将对于Replica设置成FINALIZED态，尔后关闭流水线

5.TEMP 这个状态是用来暂存Replica的，某个Block的最小备份数是3，原本有3台DataNode存有Replica，但是其中一台宕机了，那么NameNode需要把备份复制到新的一台DataNode A上，于是在A

那创建了一个TEMP状态的Replica来将数据复制进去，如果复制成功那么又恢复到3个Replica了。如果A宕机，那么下次重启的时候，这个TEMP的Replica将被删除。

hdfs bgs hadoop recovery

IT智囊

0 关注 0 粉丝 0 动态

相关推荐

hadoop伪分布式环境搭建

core-site.xml文件主要配置了访问Hadoop集群的主要信息，其中master代表主机名称，也可以使用IP替换，9000代表端口。外部通过配置的hdfs：//master：9000信息，就可以找到Hadoop集群。hdfs-site.xml配置文

WeiHHH 2020-09-23

hadoop框架三大组件hdfs、mapreduce、yarn 内容

1）分布式的运算程序往往需要分成至少2个阶段。2）第一个阶段的MapTask并发实例，完全并行运行，互不相干。3）第二个阶段的ReduceTask并发实例互不相干，但是他们的数据依赖于上一个阶段的所有MapTask并发实例的输出。4）MapReduce编程

tomli 2020-07-26

hdfs、hive、hbase的搭建总结

-- 完全分布式文件系统的名称：schema ip port -->. -- 分布式文件系统的其他路径的所依赖的一个基础路径，完全分布式不能使用默认值，因为临路径不安全，linux系统在重启时，可能会删除此目录下的内容-->. --

eternityzzy 2020-07-19

hadoop集群的启动与停止

漫长的启动时间…………思考：每次都一个一个节点启动，如果节点数增加到1000个怎么办？早上来了开始一个一个节点启动，到晚上下班刚好完成，下班？这些名称是我的三台机器的主机名，各位请改成自己的主机名！如果集群是第一次启动，需要格式化NameNode，这里使用

飞鸿踏雪0 2020-07-09

hadoop创建目录

//1.vm arguments中添加后面的参数来修改用户 -DHADOOP_USER_NAME=hadoop

硅步至千里 2020-06-25

[AWS][大数据][Hadoop] 使用EMR做大数据分析

创建一个存储桶比如hadoop202006…这里我解释一下Hadoop集群中的一些组件，了解大数据的同学直接忽略就好。Apache Hadoop：在分布式服务器集群上存储海量数据并运行分布式分析应用的开源框架，其核心部件是HDFS与MapReduce。Ap

swazerz 2020-06-22

Hadoop

8.在2008年，Doug加入了Yahoo，开源了Hadoop，在Yahoo期间设计实现了Pig、HBase等框架

HJWZYY 2020-06-21

大数据期末复习重点

系统上安装 jdk环境.基于/usr/local/ 目录下解压安装.注: 可检查目录大小: df-h/usr/local/　　。解压压缩包tar -zxvf jdk-7u80-linux.tar.gz 改名: mv jdk-7u80-linux jdk7　

ViMan0 2020-06-21

Hadoop之hadoop fs和hdfs dfs、hdfs fs三者区别

tackoverflow的解释Hadoop fs：使用面最广，可以操作任何文件系统。hadoop dfs与hdfs dfs：只能操作HDFS文件系统相关，前者已经Deprecated，一般使用后者。Following are the three comma

zzjmay 2020-06-08

hadoop两个namenode都是standby问题

经过不断地排查，发现在自己进行关闭和重启namenode的组件的时候，没有通过pip文件正常关闭，只能挨个关闭，这个也不是重点。经过修改pip文件的路径，解决了这个批量关闭启动的问题，原因是/tmpe目录系统会定期清理，导致进程号对不上了。关闭再启动hdf

sujins 2020-06-05

Hadoop之HDFS入门实战

某一个副本丢失后，它可以自动恢复。数据规模，可以达到PB级。文件规模，能够处理百万规模的文件数量。可构建在廉价机器上，通过多副本保证可靠性。不适合低延时数据访问。存储大量小文件，他会占用NameNode大量内存存储目录和块信息，这样不可取，因为NameNo

strongyoung 2020-06-01

hadoop 数据处理总结

最近工作中用了了Hadoop，比如用Hadoop来处理广告的一些pv量数据、点击数据等，最后统计后给运营展示每个广告的数据报表。hadoop平台提供了分布式存储，分布式计算，任务调度、对象存储、和组件支撑服务。Hadoop主要用来存储以及处理大量并且复杂的

sujins 2020-05-30

Hadoop简介

要求被注入的属性 , 必须有set方法 , set方法的方法名由set + 属性首字母大写 , 如果属性是boolean类型 , 没有set方法 , 是 is .

sujins 2020-05-29

hadoop hdfs csv导入hive表

row format delimited fields terminated by ‘,‘ stored as textfile;

archive 2020-05-28

HDFS分布式存储中NameNode 和DataNode 有什么区别？

随着互联网不断得突飞猛进，数据就逐渐演变为科技和经济发展的核心。更是对于互联网时代的人类和企业来说，是至关重要的，可能对于普通人来说没有太大影响，但是对于国家和大型企业来说，数据就是其命脉，人工智能就是对数据海量化的最好证明之一。所以，数据存储的稳定在一定

憧憬 2020-08-21

2020年首个存储挖矿项目HDFS是什么？

2020年首个存储挖矿项目HDFS是什么？通过去中心化金融DEFI已经积累了数十亿美元的市值，另一边以Fecoin为代表的存储挖矿项目却一直处于雷声大雨点小的状态，因为Fecoin已经连续跳票数次，对于矿工而言则颇为扫兴，好在HDFS及时出现补上了Feco

ViMan0 2020-08-14

Spark RDD

②通过Spark读取外部存储文件，将文件数据转变为RDD。可以从本地磁盘读取，也可以从HDFS读取

adayan0 2020-07-05

HDFS

hdfs dfs -put [-f] [-p] [-l] <本地路径> <目标路径>hdfs dfs -put /opt/a.txt /usr/root//txtdir. 本人已经设置了环境变量，则可以在任意的路径下可直接使用hdf

zzjmay 2020-07-04

HDFS【概述、数据流】

能处理PB级别数据、能处理百万的文件数据量。1）客户端通过Distributed FileSystem模块向NameNode请求上传文件，NameNode检查目标文件是否已存在，父目录是否存在。4）NameNode返回3个DataNode节点，分别为dn1

sujins 2020-06-14

HDFS【shell操作hdfs命令】

-moveFromLocal：从本地剪切粘贴到HDFS. -copyFromLocal：从本地文件系统中拷贝文件到HDFS路径去。-appendToFile：追加一个文件到已经存在的文件末尾。2）-get：等同于copyToLocal，就是从HDFS下载文

sujins 2020-06-14

IT智囊

W3CSchool教程: HTML 教程; CSS 教程; Bootstrap 教程; Javascript 教程; jQuery 教程

后端教程: C 教程; Java 教程; PHP 教程; Python 教程; Go 教程

移动开发: Android 教程; Swift 教程; Kotlin 教程; jQuery Mobile 教程; ionic 教程

关于我们: 新闻动态; 联系方式; 招聘英才; 安科实验室; 帮助与反馈

安科网(Ancii)，中国第一极客网

Copyright © 2013 - 2019 Ancii.com

京ICP备18063983号京公网安备11010802014868号