Hbase学习指南

zoukankan html css js c++ java

Hbase学习指南
本篇Hbase组件基于CDH5进行安装，安装过程：https://www.cnblogs.com/dmjx/p/10037066.html

Hbase简介

HBase是一个高可靠、高性能、面向列、可伸缩的分布式存储系统，利用HBase技术可在廉价的PC Server上搭建大规模结构化存储集群。

Hbase设计模型

HBase中的每一张表就是所谓的BigTable。BigTable会存储一系列的行记录，行记录有三个基本类型的定义：
- RowKey：是行在BigTable中的唯一标识。
- TimeStamp：是每一次数据操作对应关联的时间戳，可以看作SVN的版本。
- Column：定义为<family>:<label>，通过这两部分可以指定唯一的数据的存储列，family的定义和修改需要对HBase进行类似于DB的DDL操作，而label，不需要定义直接可以使用，这也为动态定制列提供了一种手段。family另一个作用体现在物理存储优化读写操作上，同family的数据物理上保存的会比较接近，因此在业务设计的过程中可以利用这个特性。
物理存储模型

Table在行的方向上分割为多个HRegion，每个HRegion分散在不同的RegionServer中。每个HRegion由多个Store构成，每个Store由一个MemStore和0或多个StoreFile组成，StoreFile以HFile格式存储在HDFS中。

memstore和storefile
- 一个region由多个store组成，每个store包含一个列族的所有数据
- store包括位于内存的memstore和我与硬盘的storefile
- 写操作先写memstore，当memstore中的数据达到某个阈值，hregionserver会启动flashcache进程写入storefile，每次写入行成一个单独的storefile
- 当storefile大小超过一定阈值后，会把当前的region分割为两个，由hmaster分配到相应的region服务器，实现负载均衡
- 客户端检索数据时，现在memstore找，找不到再找storefile
hbase存储架构

从HBase的架构图上可以看出，HBase中的存储包括HMaster、HRegionSever、HRegion、HLog、Store、MemStore、StoreFile、HFile等，以下是HBase存储架构图：

HMaster的作用：

　　Hmaster进程负责管理所有HRegionserver。新Regionserver的注册，Regionserver Failover处理；
　　负责建表、修改表、删除表以及一些集群操作
　　Master进程负责所有Region的转移操作，新表创建时的Region分配，运行期间负载均衡保障，Regionserver Failover后的Region接管
　　Master进程可以有主备角色。集群可以配置多个master角色，集群启动时这些master角色通过竞争获得主master角色。主master只能有一个，所有备master进程在集群运行期间处于休眠状态，不干涉任何集群事务。

HRegionServer的作用：

　　维护HMaster分配给它的HRegion，处理对这些HRegion的IO请求
　　负责切分正在运行过程中变得过大的HRegion

Hregion：

Table在行的方向上分割为多个HRegion，HRegion是HBase中分布式存储和负载均衡的最小单元，即不同的HRegion可以分别在不同的HRegionServer上，但同一个HRegion是不会拆分到多个HRegionServer上的。HRegion按大小分割，每个表一般只有一个HRegion，随着数据不断插入表，HRegion不断增大，当HRegion的某个列簇达到一个阀值（默认256M）时就会分成两个新的HRegion。

HRegion被分配给哪个HRegionServer是完全动态的，所以需要机制来定位HRegion具体在哪个HRegionServer，HBase使用三层结构来定位HRegion：

　　通过zk里的文件/hbase/rs得到-ROOT-表的位置。-ROOT-表只有一个region。

　　通过-ROOT-表查找.META.表的第一个表中相应的HRegion位置。其实-ROOT-表是.META.表的第一个region；

　　.META.表中的每一个Region在-ROOT-表中都是一行记录。

　　通过.META.表找到所要的用户表HRegion的位置。用户表的每个HRegion在.META.表中都是一行记录。

Store：

　　每一个HRegion由一个或多个Store组成，至少是一个Store，HBase会把一起访问的数据放在一个Store里面，即为每个ColumnFamily建一个Store，如果有几个ColumnFamily，也就有几个Store。一个Store由一个MemStore和0或者多个StoreFile组成。 HBase以Store的大小来判断是否需要切分HRegion。

MemStore：

MemStore 是放在内存里的，保存修改的数据即keyValues。当MemStore的大小达到一个阀值（默认64MB）时，MemStore会被Flush到文件，即生成一个快照。目前HBase会有一个线程来负责MemStore的Flush操作。

StoreFile：

　　MemStore内存中的数据写到文件后就是StoreFile，StoreFile底层是以HFile的格式保存。

Hfile：

　　HBase中KeyValue数据的存储格式，是Hadoop的二进制格式文件。首先HFile文件是不定长的，长度固定的只有其中的两块：Trailer和FileInfo。（flush之后或者是memstore到达一定数量之后，生成的文件就是Hfile）

HLog ：

　　HLog(WAL log)：WAL意为write ahead log，用来做灾难恢复使用，HLog记录数据的所有变更，一旦region server 宕机，就可以从log中进行恢复。

LogFlusher ：

　　定期的将缓存中信息写入到日志文件中

读取操作流程

1. client访问Zookeeper，查找-ROOT-表，获取.META.表信息。
2. 从.META.表查找，获取存放目标数据的HRegion信息，从而找到对应的HRegionServer。
3. 通过HRegionServer获取需要查找的数据。
4. HRegionserver的内存分为MemStore和BlockCache两部分，MemStore主要用于写数据，BlockCache主要用于读数据。读请求先到MemStore中查数据，查不到就到BlockCache中查，再查不到就会到StoreFile上读，并把读的结果放入BlockCache。

HBase Shell操作：此处参考博客--https://blog.csdn.net/qq_22222499/article/details/69808525
查看全文

相关阅读:
HDU-1702-ACboy needs your help again!(Stack)
HDU1276-士兵队列训练问题 (Queue)
HDU1285-确定比赛名次（拓扑+优先队列）
The Preliminary Contest for ICPC Asia Nanjing 2019
拓扑排序板子 hihocoder-1174
BZOJ1066 [SCOI2007]蜥蜴
 BZOJ3888 [Usaco2015 Jan]Stampede
BZOJ1718 [Usaco2006 Jan] Redundant Paths 分离的路径
 BZOJ1112 [POI2008]砖块Klo
BZOJ1031 [JSOI2007]字符加密Cipher

原文地址：https://www.cnblogs.com/dmjx/p/10173596.html

Hbase简介

Hbase设计模型

物理存储模型

hbase存储架构

读取操作流程