02hdfs简介

本文最后更新于 2021-08-05 11:42:59

HDFS

hdfs：分布式文件系统
hdfs有着文件系统共同的特征：
- 有目录结构，顶层目录是： /
- 系统中存放的就是文件
- 系统可以提供对文件的：创建、删除、修改、查看、移动等功能
hdfs跟普通的单机文件系统有区别：
- 单机文件系统中存放的文件，是在一台机器的操作系统中
  hdfs的文件系统会横跨N多的机器
- 单机文件系统中存放的文件，是在一台机器的磁盘上
- hdfs文件系统中存放的文件，是落在n多机器的本地单机文件系统中（hdfs是一个基于==linux==本地文件系统之上的文件系统）
hdfs的工作机制
- 客户把一个文件存入hdfs，其实hdfs会把这个文件切块后，分散存储在N台linux机器系统中（负责存储文件块的角色：==data node==）<准确来说：切块的行为是由客户端决定的>
- 一旦文件被切块存储，那么，hdfs中就必须有一个机制，来记录用户的每一个文件的切块信息，及每一块的具体存储机器（负责记录块信息的角色是：==name node==）
- 为了保证数据的安全性，hdfs可以将每一个文件块在集群中存放多个副本（到底存几个副本，是由当时存入该文件的客户端指定的）

DataNode负责将实际数据储存在HDFS中
DataNode也成为Slave
NameNode和DataNode将保持不断通信
DataNode启动时，将自己发布到NameNode并汇报自己持有的块列表
但某个NameNode关闭时，不会影响数据和集群的可用性，有备份
DataNode所在机器通常配置有大量的硬盘空间，因为实际数据储存在DataNode中
DataNode会定期（dfs.heartbeat.interval配置，默认时3秒）先NameNode发送心跳，如果长期没有收到DateNode发送的心跳信息，NameNode将会认为DataNode失效
block汇报时间配置（dfs.blockreport.intervalMsec 默认为6小时）

bigdata > 01hadoop

#bigdata #01hadoop

02hdfs简介

https://jiajun.xyz/2020/10/10/bigdata/01hadoop/02hdfs简介/

作者

Lambda

发布于

2020年10月10日

更新于

2021年8月5日

许可协议