面试题百日百刷-HBase中HTable API有没有线程安全问题，在程序是单例还是多例？

2023-04-08 11:43 由 demo锁屏面试题发表于 #数据库

锁屏面试题百日百刷，每个工作日坚持更新面试题。请看到最后就能获取你想要的,接下来的是今日的面试题：

1.HBase内部机制是什么？

Hbase是一个能适应联机业务的数据库系统

物理存储：hbase的持久化数据是将数据存储在HDFS上。

存储管理：一个表是划分为很多region的，这些region分布式地存放在很多regionserver上Region内部还可以

划分为store，store内部有memstore和storefile。

版本管理：hbase中的数据更新本质上是不断追加新的版本，通过compact操作来做版本间的文件合并Region

的split。

集群管理：ZooKeeper + HMaster + HRegionServer。

2.HTable API有没有线程安全问题，在程序是单例还是多例？

在单线程环境下使用hbase的htable是没有问题，但是突然高并发多线程情况下就可能出现问题。

以下为Htable的API说明：

This class is not thread safe for updates; the underlying write buffer can be corrupted if multiple threads contend over a single HTable instance. 当有多个线程竞争时可能把当前正在写的线程corrupted，那么原因是什么呢？

根据Htable的源码：

public HTable(final byte [] tableName)throws IOException{  this(HBaseConfiguration.create(), tableName);}public static Configuration create() {  Configuration conf = new Configuration();  return addHbaseResources(conf);}

从上面我们可以看到每一个HTable的实例化过程都要创建一个新的conf，我们甚至可以认为一个conf对应的是一个HTable的connection，因此如果客户端对于同一个表，每次新new 一个configuration对象的话，那么意味着这两个HTable虽然操作的是同一个table，但是建立的是两条链接connection，它们的socket不是共用的，在多线程的情况下，经常会有new Htable的情况发生，而每一次的new都可能是一个新的connection，而我们知道zk上的链接是有限制的如果链接达到一定阈值的话，那么新建立的链接很有可能挤掉原先的connection，而导致线程不安全。

因此hbase官方文档建议我们：HTable不是线程安全的。建议使用同一个HBaseConfiguration实例来创建HTable实例，这样可以共享ZooKeeper和socket实例。例如，最好这样做：

HBaseConfiguration conf = HBaseConfiguration.create();HTable table1 = new HTable(conf, "myTable");HTable table2 = new HTable(conf, "myTable");

而不是这样：

HBaseConfiguration conf1 = HBaseConfiguration.create();HTable table1 = new HTable(conf1, "myTable");HBaseConfiguration conf2 = HBaseConfiguration.create();HTable table2 = new HTable(conf2, "myTable");

当然最方便的方法就是使用HTablepool了，维持一个线程安全的map里面存放的是tablename和其引用的映射，可以认为是一个简单的计数器，当需要new 一个HTable实例时直接从该pool中取，用完放回。

3.HBase有没有并发问题？

针对HBase在高并发情况下的性能，我们进行如下测试：

测试版本：hbase 0.94.1、 hadoop 1.0.2、 jdk-6u32-linux-x64.bin、snappy-1.0.5.tar.gz

测试hbase搭建：14台存储机器+2台master、DataNode和regionserver放在一起。

测试一：高并发读(4w+/s) + 少量写(允许分拆、负载均衡)

症状：1-2天后，hbase挂掉(系统性能极差，不到正常的10%)。其实并非全部挂掉，而是某些regionserver挂了，并在几个小时内引发其他regionserver挂掉。系统无法恢复：单独启regionserver无法恢复正常。重启后正常。

测试二：高并发读(4w+/s)

症状：1-2天后，hbase挂掉(系统性能极差，不到正常的10%)。后发现是由于zookeeper.session.timeout设置不正确导致(参见regionserver部分：http://hbase.apache.org/book.html#trouble)。重启后正常。

测试三：高并发读(4w+/s)

症状：1-2天后，hbase挂掉(系统性能极差，不到正常的10%)。从log未看出问题，但regionserver宕机，且datanode也宕机。重启后正常。

测试四：高并发读(4w+/s)+禁止分拆、禁止majorcompaction、禁止负载均衡(balance_switch命令)症状：1-2天后，hbase挂掉(系统性能极差，不到正常的10%)。从log未看出问题，但regionserver宕机，且datanode也宕机。重启后正常。

测试期间，还发现过：无法获取".MATE."表的内容(想知道regionserver的分布情况)、hbase无法正确停止、hbase无法正确启动(日志恢复失败，文件错误，最终手动删除日志重启)。

全部内容在[git](https://gitee.com/zjlalaforgit/interview)上,了解更多请点我头像或到我的主页去获得，谢谢