HDFS写流程
NameNode负责管理存储在HDFS.上所有文件的元数据,它会确认客户端的请求,并记录下文件的名字和存储这个文件的DataNode集合。它把该信息存储在内存中的文件分配表里。例如,客户端发送一个请求给NameNode,说它要将“wjw. log”文件写入到HDFS。那么,其执行流程如图1所示。具体为:
第一步:客户端发消息给NameNode,说要将“wjw.1og”文件写入。(如上图中 的①)
第二步: NameNode发消息给客户端,叫客户端写到DataNode A、B和D,并直接联系DataNodeB。(如上图中的②)
第三步:客户端发消息给DataNodeB,叫它保存一份“wjw.log"文件,并且发送-一份副本给DataNodeA和DataNodeD。(如上图中的③)
第四步: DataNodeB发消息给DataNodeA,叫它保存一一份“wjw. log”文件,并且发送一-份副本给DataNodeD。(如上图中的④)
第五步: DataNodeA发消息给DataNodeD,叫它保存一份“wjw.log”文件。(如上图中的⑤)
第六步: DataNodeD发确认消息给DataNodeA。(如 上图中的⑤)
第七步: DataNodeA发确认消息给DataNodeB。(如 上图中的④)
第八步: DataNode B发确认消息给客户端,表示写入完成。(如上图中的⑥)
在分布式文件系统的设计中,挑战之一是如何确 保数据的一一致性。对于HDFS来说,直到所有要保存数据的DataNodes确认它们都有文件的副本时,数据才被认为写入完成。因此,数据一-致性是在写的阶段完成的。-一个客户端无论选择从哪个DataNode读取,都将得到相同的数据。
HDFS读流程
为了理解读的过程, 可以认为一个文件是由存储在DataNode.上的数据块组成的客户端查看之前写入的内容的执行流程如图2所示,具体步骤为:
第一步:客户端询问NameNode它应该从哪里读取文件。(如 上图中的①)
第二步: NameNode发送数据块的信息给客户端。数据块信息包含了保存着文件副本的DataNode的IP地址,以及DataNode在本地硬盘查找数据块所需要的数据块ID。 (如_上图中的②)
第三步:客户端检查数据块信息,联系相关的DataNode,请求数据块。(如 上图中的③)
第四步: DataNode返回文件内容给客户端,然后关闭连接,完成读操作。(如上图中的④)
客户端并行从不同的DataNode中获取一一个文件的数据块,然后联结这些数据块拼成完整的文件。
登录 | 立即注册