1.Hadoop是什么?
适合大数据的分布式与计算平台。
HDFS:Hadoop Distributed File System 分布式文件系统
MapReduce:并行计算框架
2.HDFS的架构
主从结构
主节点,仅仅有一个:namenode
从节点,有非常多个:datanodes
namenode负责:
接收用户操作请求
维护文件系统的文件夹结构
管理文件与block之间关系,block与datanode之间关系
datanode负责:
存储文件
文件被分成block存储在磁盘上
为保证数据安全。文件会有多个副本
3.MapReduce的架构
主从结构
主节点。仅仅有一个:JobTracker
从节点,有非常多个:TaskTrackers
JobTracker负责:
接收客户提交的计算任务
把任务分给TaskTrackers
监控TaskTracker的运行情况
TaskTrackers负责:
运行JobTrackers分配的计算任务
4.Hadoop的特点
扩容能力(Scalable):能可靠的(reliably)存储和处理千兆(PB)数据。
成本低(Economical):能够通过普通机器组成server来分发以及处理数据。
这些server群总计可达数千个节点
高效率(Efficient):通过分发数据。hadoop能够再数据所在的节点上并行(parallel)处理它们,这使得处理的很的高速。
可靠性(Reliable):hadoop能自己主动的维护数据的多份副本。而且在任务失败后能自己主动的又一次部署(redeploy)计算任务。