HDFS的读写流程-JobPlus

HDFS写流程

NameNode负责管理存储在HDFS.上所有文件的元数据，它会确认客户端的请求，并记录下文件的名字和存储这个文件的DataNode集合。它把该信息存储在内存中的文件分配表里。例如，客户端发送一个请求给NameNode,说它要将“wjw. log”文件写入到HDFS。那么，其执行流程如图1所示。具体为:

第一步:客户端发消息给NameNode，说要将“wjw.1og”文件写入。(如上图中的①)

第二步: NameNode发消息给客户端，叫客户端写到DataNode A、B和D，并直接联系DataNodeB。(如上图中的②)

第三步:客户端发消息给DataNodeB，叫它保存一份“wjw.log"文件，并且发送-一份副本给DataNodeA和DataNodeD。(如上图中的③)
第四步: DataNodeB发消息给DataNodeA，叫它保存一一份“wjw. log”文件，并且发送一-份副本给DataNodeD。(如上图中的④)

第五步: DataNodeA发消息给DataNodeD,叫它保存一份“wjw.log”文件。(如上图中的⑤)

第六步: DataNodeD发确认消息给DataNodeA。(如上图中的⑤)

第七步: DataNodeA发确认消息给DataNodeB。(如上图中的④)

第八步: DataNode B发确认消息给客户端，表示写入完成。(如上图中的⑥)

在分布式文件系统的设计中，挑战之一是如何确保数据的一一致性。对于HDFS来说，直到所有要保存数据的DataNodes确认它们都有文件的副本时，数据才被认为写入完成。因此，数据一-致性是在写的阶段完成的。-一个客户端无论选择从哪个DataNode读取，都将得到相同的数据。

HDFS读流程

为了理解读的过程，可以认为一个文件是由存储在DataNode.上的数据块组成的客户端查看之前写入的内容的执行流程如图2所示，具体步骤为:
  第一步:客户端询问NameNode它应该从哪里读取文件。(如上图中的①)
  第二步: NameNode发送数据块的信息给客户端。数据块信息包含了保存着文件副本的DataNode的IP地址，以及DataNode在本地硬盘查找数据块所需要的数据块ID。 (如_上图中的②)
  第三步:客户端检查数据块信息，联系相关的DataNode,请求数据块。(如上图中的③)
  第四步: DataNode返回文件内容给客户端，然后关闭连接，完成读操作。(如上图中的④)
客户端并行从不同的DataNode中获取一一个文件的数据块，然后联结这些数据块拼成完整的文件。

HDFS写流程<img src="https://file.jobplus.com.cn/2018/07/19/ceccf16d2d2948fc9ab1d8eafc178fdb.png" _src="https://file.jobplus.com.cn/2018/07/19/ceccf16d2d2948fc9ab1d8eafc178fdb.png"/>  NameNode负责管理存储在HDFS.上所有文件的元数据，它会确认客户端的请求，并记录下文件的名字和存储这个文件的DataNode集合。它把该信息存储在内存中的文件分配表里。例如，客户端发送一个请求给NameNode,说它要将“wjw. log”文件写入到HDFS。那么，其执行流程如图1所示。具体为:  第一步:客户端发消息给NameNode，说要将“wjw.1og”文件写入。(如上图中 的①)  第二步: NameNode发消息给客户端，叫客户端写到DataNode A、B和D，并直接联系DataNodeB。(如上图中的②)  第三步:客户端发消息给DataNodeB，叫它保存一份“wjw.log"文件，并且发送-一份副本给DataNodeA和DataNodeD。(如上图中的③)   第四步: DataNodeB发消息给DataNodeA，叫它保存一一份“wjw. log”文件，并且发送一-份副本给DataNodeD。(如上图中的④)   第五步: DataNodeA发消息给DataNodeD,叫它保存一份“wjw.log”文件。(如上图中的⑤)  第六步: DataNodeD发确认消息给DataNodeA。(如 上图中的⑤)  第七步: DataNodeA发确认消息给DataNodeB。(如 上图中的④)  第八步: DataNode B发确认消息给客户端，表示写入完成。(如上图中的⑥)  在分布式文件系统的设计中，挑战之一是如何确 保数据的一一致性。对于HDFS来说，直到所有要保存数据的DataNodes确认它们都有文件的副本时，数据才被认为写入完成。因此，数据一-致性是在写的阶段完成的。-一个客户端无论选择从哪个DataNode读取，都将得到相同的数据。  HDFS读流程 <img src="https://file.jobplus.com.cn/2018/07/19/44953c84b37b436e910dca3bfe5247d6.png" _src="https://file.jobplus.com.cn/2018/07/19/44953c84b37b436e910dca3bfe5247d6.png"/>  为了理解读的过程，  可以认为一个文件是由存储在DataNode.上的数据块组成的客户端查看之前写入的内容的执行流程如图2所示，具体步骤为:   第一步:客户端询问NameNode它应该从哪里读取文件。(如 上图中的①)   第二步: NameNode发送数据块的信息给客户端。数据块信息包含了保存着文件副本的DataNode的IP地址，以及DataNode在本地硬盘查找数据块所需要的数据块ID。  (如_上图中的②)   第三步:客户端检查数据块信息，联系相关的DataNode,请求数据块。(如 上图中的③)   第四步: DataNode返回文件内容给客户端，然后关闭连接，完成读操作。(如上图中的④)   客户端并行从不同的DataNode中获取一一个文件的数据块，然后联结这些数据块拼成完整的文件。