京东大数据资料hdfs 存储（一）

懒惰的帮主

2015-05-13

关注关注

【漫画系列】HDFS存储原理分析（一）

提交

我的评论

加载中

已评论

【漫画系列】HDFS存储原理分析（一）

2015-05-06 京东大数据专家京东大数据专家

京东大数据专家 京东大数据资料hdfs 存储（一）

微信号 jdjcbp

功能介绍关注京东大数据专家，随时报名参加认证，即时了解培训计划，文档丰富，自助学习。

本次分享共分为三期，结合Maneesh Varshney的漫画改编，为大家分析HDFS存储机制与运行原理。

一、角色出演

京东大数据资料hdfs 存储（一）

如上图所示，HDFS存储相关角色与功能如下：

Client：客户端，系统使用者，调用HDFS API操作文件；与NN交互获取文件元数据；与DN交互进行数据读写。

Namenode：元数据节点，是系统唯一的管理者。负责元数据的管理；与client交互进行提供元数据查询；分配数据存储节点等。

Datanode：数据存储节点，负责数据块的存储与冗余备份；执行数据块的读写操作等。

二、写入数据

1、发送写数据请求

京东大数据资料hdfs 存储（一）
HDFS中的存储单元是block。文件通常被分成64或128M一块的数据块进行存储。与普通文件系统不同的是，在HDFS中，如果一个文件大小小于一个数据块的大小，它是不需要占用整个数据块的存储空间的。

2、文件切分

京东大数据资料hdfs 存储（一）
3、DN分配

京东大数据资料hdfs 存储（一）

4、数据写入

京东大数据资料hdfs 存储（一）

5、完成写入

京东大数据资料hdfs 存储（一）

6、角色定位

京东大数据资料hdfs 存储（一）
三、HDFS存储写操作分析

通过写过程，我们可以了解到：

1、HDFS属于Master与Slave结构。一个集群中只有一个NameNode，可以有多个DataNodes；

2、HDFS存储机制保存了多个副本，当写入1T文件时，我们需要3T的存储，3T的网络流量带宽；系统提供容错机制，副本丢失或宕机可自动恢复，保证系统高可用性。

3、HDFS默认会将文件分割成block。然后将block按键值对存储在HDFS上，并将键值对的映射存到内存中。如果小文件太多，会导致内存的负担很重。

四、思考

1、数据写入时出错怎么办？

2、元数据是如何存储的？

未完待续……

阅读

微信扫一扫
关注该公众号

hdfs 大数据

懒惰的帮主

0 关注 0 粉丝 0 动态

关注关注

hadoop伪分布式环境搭建

core-site.xml文件主要配置了访问Hadoop集群的主要信息，其中master代表主机名称，也可以使用IP替换，9000代表端口。外部通过配置的hdfs：//master：9000信息，就可以找到Hadoop集群。hdfs-site.xml配置文

WeiHHH 2020-09-23

HDFS分布式存储中NameNode 和DataNode 有什么区别？

随着互联网不断得突飞猛进，数据就逐渐演变为科技和经济发展的核心。更是对于互联网时代的人类和企业来说，是至关重要的，可能对于普通人来说没有太大影响，但是对于国家和大型企业来说，数据就是其命脉，人工智能就是对数据海量化的最好证明之一。所以，数据存储的稳定在一定

憧憬 2020-08-21

2020年首个存储挖矿项目HDFS是什么？

2020年首个存储挖矿项目HDFS是什么？通过去中心化金融DEFI已经积累了数十亿美元的市值，另一边以Fecoin为代表的存储挖矿项目却一直处于雷声大雨点小的状态，因为Fecoin已经连续跳票数次，对于矿工而言则颇为扫兴，好在HDFS及时出现补上了Feco

ViMan0 2020-08-14

hadoop框架三大组件hdfs、mapreduce、yarn 内容

1）分布式的运算程序往往需要分成至少2个阶段。2）第一个阶段的MapTask并发实例，完全并行运行，互不相干。3）第二个阶段的ReduceTask并发实例互不相干，但是他们的数据依赖于上一个阶段的所有MapTask并发实例的输出。4）MapReduce编程

tomli 2020-07-26

hdfs、hive、hbase的搭建总结

-- 完全分布式文件系统的名称：schema ip port -->. -- 分布式文件系统的其他路径的所依赖的一个基础路径，完全分布式不能使用默认值，因为临路径不安全，linux系统在重启时，可能会删除此目录下的内容-->. --

eternityzzy 2020-07-19

hadoop集群的启动与停止

漫长的启动时间…………思考：每次都一个一个节点启动，如果节点数增加到1000个怎么办？早上来了开始一个一个节点启动，到晚上下班刚好完成，下班？这些名称是我的三台机器的主机名，各位请改成自己的主机名！如果集群是第一次启动，需要格式化NameNode，这里使用

飞鸿踏雪0 2020-07-09

Spark RDD

②通过Spark读取外部存储文件，将文件数据转变为RDD。可以从本地磁盘读取，也可以从HDFS读取

adayan0 2020-07-05

HDFS

hdfs dfs -put [-f] [-p] [-l] <本地路径> <目标路径>hdfs dfs -put /opt/a.txt /usr/root//txtdir. 本人已经设置了环境变量，则可以在任意的路径下可直接使用hdf

zzjmay 2020-07-04

hadoop创建目录

//1.vm arguments中添加后面的参数来修改用户 -DHADOOP_USER_NAME=hadoop

硅步至千里 2020-06-25

[AWS][大数据][Hadoop] 使用EMR做大数据分析

创建一个存储桶比如hadoop202006…这里我解释一下Hadoop集群中的一些组件，了解大数据的同学直接忽略就好。Apache Hadoop：在分布式服务器集群上存储海量数据并运行分布式分析应用的开源框架，其核心部件是HDFS与MapReduce。Ap

swazerz 2020-06-22

Hadoop

8.在2008年，Doug加入了Yahoo，开源了Hadoop，在Yahoo期间设计实现了Pig、HBase等框架

HJWZYY 2020-06-21

大数据期末复习重点

系统上安装 jdk环境.基于/usr/local/ 目录下解压安装.注: 可检查目录大小: df-h/usr/local/　　。解压压缩包tar -zxvf jdk-7u80-linux.tar.gz 改名: mv jdk-7u80-linux jdk7　

ViMan0 2020-06-21

HDFS【概述、数据流】

能处理PB级别数据、能处理百万的文件数据量。1）客户端通过Distributed FileSystem模块向NameNode请求上传文件，NameNode检查目标文件是否已存在，父目录是否存在。4）NameNode返回3个DataNode节点，分别为dn1

sujins 2020-06-14

HDFS【shell操作hdfs命令】

-moveFromLocal：从本地剪切粘贴到HDFS. -copyFromLocal：从本地文件系统中拷贝文件到HDFS路径去。-appendToFile：追加一个文件到已经存在的文件末尾。2）-get：等同于copyToLocal，就是从HDFS下载文

sujins 2020-06-14

hdfs读数据流程

1，客户端通过Distributed FileSystem 向namenode请求下载文件，namenode 通过查找元数据，返回文件块所在datanode的地址。2，客户端挑选一台datanode服务器，建立连接，请求读取数据；如果dn异常，则从第二优先

Cloudeep 2020-06-14

hdfs写数据流程

1，客户端向nn请求上传文件，nn检查该文件和父目录是否存在。4，nn根据副本原则，返回给客户端块上传的dn节点信息。5，客户端和dn1建立连接，请求上传数据，dn1接着和dn2建立连接，dn2和dn3建立连接，通信管道就建立完成。6，dn1，dn2，dn

ViMan0 2020-06-14

HDFS【Java API操作】

* conf > 工程下的xxx-site.xml > 集群中xxx-site.xml > 集群中xxx-default.xml. //配置副本数 - 该配置只针对本次的操作有效。* boolean overwrite --如果

sujins 2020-06-13

15.HA高可用

HA即高可用，实现高可用最关键的策略就是消除单点故障。HA严格地来说应该分成各个组件的HA机制，HDFS的HA和YARN的HA。Hadoop2.0之前，在HDFS集群中NameNode存在单点故障。HDFS HA功能通过配置Active/Standby两个

sujins 2020-06-10

Hadoop之hadoop fs和hdfs dfs、hdfs fs三者区别

tackoverflow的解释Hadoop fs：使用面最广，可以操作任何文件系统。hadoop dfs与hdfs dfs：只能操作HDFS文件系统相关，前者已经Deprecated，一般使用后者。Following are the three comma

zzjmay 2020-06-08

flume

Flume是一个分布式、可靠、和高可用的海量日志采集、聚合和传输的系统。a)Source：采集组件，用于跟数据源对接，以获取数据。c)Channel：传输通道组件，用于从source将数据传递到sink. #因为要存到hdfs上，所以下沉组件位hdfs.

zzjmay 2020-06-07

安科网

京东大数据资料hdfs 存储（一）

懒惰的帮主

【漫画系列】HDFS存储原理分析（一）

【漫画系列】HDFS存储原理分析（一）

懒惰的帮主

相关推荐

hadoop伪分布式环境搭建

HDFS分布式存储中NameNode 和DataNode 有什么区别？

2020年首个存储挖矿项目HDFS是什么？

hadoop框架三大组件hdfs、mapreduce、yarn 内容

hdfs、hive、hbase的搭建总结

hadoop集群的启动与停止

Spark RDD

HDFS

hadoop创建目录

[AWS][大数据][Hadoop] 使用EMR做大数据分析

Hadoop

大数据期末复习重点

HDFS【概述、数据流】

HDFS【shell操作hdfs命令】

hdfs读数据流程

hdfs写数据流程

HDFS【Java API操作】

15.HA高可用

Hadoop之hadoop fs和hdfs dfs、hdfs fs三者区别

flume

懒惰的帮主