Hbase集群搭建
一、集群搭建准备
(1)、在之前的Kafka镜像基础上搭建的,整个镜像依赖为:Hadoop->Hive->sqoop->flume->kafka->hbase
hbase依赖ZK和Hadoop
二、HBase部署
2.1、部署
2.1.1、Zookeeper正常部署
首先保证Zookeeper集群的正常部署,并启动之:
$ bin/zkServer.sh start
$ bin/zkServer.sh status
2.1.2、Hadoop正常部署
Hadoop集群的正常部署并启动:
$ start-dfs.sh
$ start-yarn.sh
2.1.3、HBase的解压
解压HBase到指定目录:
$ tar -zxf hbase-1.3.1-bin.tar.gz /opt/module
2.1.4、HBase的配置文件
需要修改HBase对应的配置文件。
hbase-env.sh修改内容:
export JAVA_HOME=/opt/module/jdk1.8
export HBASE_MANAGES_ZK=false
hbase-site.xml修改内容:
<configuration>
<property>
<name>hbase.rootdir</name>
<value>hdfs://hadoop0:9000/hbase</value>
</property>
<property>
<name>hbase.cluster.distributed</name>
<value>true</value>
</property>
<!-- 0.98后的新变动,之前版本没有.port,默认端口为60000 -->
<property>
<name>hbase.master.port</name>
<value>16000</value>
</property>
<property>
<name>hbase.zookeeper.quorum</name>
<value>hadoop0:2181,hadoop1:2181,hadoop2:2181</value>
</property>
<property>
<name>hbase.zookeeper.property.dataDir</name>
<value>/opt/module/zookeeper/zkData</value>
</property>
</configuration>
regionservers:
hadoop0
hadoop1
hadoop2
2.1.5、HBase需要依赖的Jar包
由于HBase需要依赖Hadoop,所以替换HBase的lib目录下的jar包,以解决兼容问题:
1) 删除原有的jar:
$ rm -rf /opt/module/hbase/lib/hadoop-*
$ rm -rf /opt/module/hbase/lib/zookeeper-3.4.6.jar
2) 拷贝新jar,涉及的jar有:
hadoop-annotations-2.7.3.jar
hadoop-auth-2.7.3.jar
hadoop-client-2.7.3.jar
hadoop-common-2.7.3.jar
hadoop-hdfs-2.7.3.jar
hadoop-mapreduce-client-app-2.7.3.jar
hadoop-mapreduce-client-common-2.7.3.jar
hadoop-mapreduce-client-core-2.7.3.jar
hadoop-mapreduce-client-hs-2.7.3.jar
hadoop-mapreduce-client-hs-plugins-2.7.3.jar
hadoop-mapreduce-client-jobclient-2.7.3.jar
hadoop-mapreduce-client-jobclient-2.7.3-tests.jar
hadoop-mapreduce-client-shuffle-2.7.3.jar
hadoop-yarn-api-2.7.3.jar
hadoop-yarn-applications-distributedshell-2.7.3.jar
hadoop-yarn-applications-unmanaged-am-launcher-2.7.3.jar
hadoop-yarn-client-2.7.3.jar
hadoop-yarn-common-2.7.3.jar
hadoop-yarn-server-applicationhistoryservice-2.7.3.jar
hadoop-yarn-server-common-2.7.3.jar
hadoop-yarn-server-nodemanager-2.7.3.jar
hadoop-yarn-server-resourcemanager-2.7.3.jar
hadoop-yarn-server-tests-2.7.3.jar
hadoop-yarn-server-web-proxy-2.7.3.jar
zookeeper-3.4.11.jar
尖叫提示:这些jar包的对应版本应替换成你目前使用的hadoop版本,具体情况具体分析。
查找jar包举例:
find /opt/module/hadoop/ -name hadoop-annotations*
然后将找到的jar包复制到HBase的lib目录下即可。
2.1.6、HBase软连接Hadoop配置
$ ln -s /opt/module/hadoop/etc/hadoop/core-site.xml /opt/moduel/hbase/conf/core-site.xml
$ ln -s /opt/module/hadoop/etc/hadoop/hdfs-site.xml /opt/moduel/hbase/conf/hdfs-site.xml
2.1.7、HBase远程scp到其他集群
2.1.8、HBase服务的启动
启动方式1:
$ bin/hbase-daemon.sh start master
$ bin/hbase-daemon.sh start regionserver
尖叫提示:如果集群之间的节点时间不同步,会导致regionserver无法启动,抛出ClockOutOfSyncException异常。
修复提示:
a、同步时间服务
b、属性:hbase.master.maxclockskew设置更大的值
<property>
<name>hbase.master.maxclockskew</name>
<value>180000</value>
<description>Time difference of regionserver from master</description>
</property>
启动方式2:
$ bin/start-hbase.sh
对应的停止服务:
$ bin/stop-hbase.sh
尖叫提示:如果使用的是JDK8以上版本,则应在hbase-evn.sh中移除“HBASE_MASTER_OPTS”和“HBASE_REGIONSERVER_OPTS”配置。
2.1.9、查看HBase页面
启动成功后,可以通过“host:port”的方式来访问HBase管理页面,例如:
http://hadoop0:16010
2.2、简单使用
2.2.1、基本操作
1) 进入HBase客户端命令行
$ bin/hbase shell
2) 查看帮助命令
hbase(main)> help
3) 查看当前数据库中有哪些表
hbase(main)> list
2.2.2、表的操作
1) 创建表
hbase(main)> create 'student','info'
2) 插入数据到表
hbase(main) > put 'student','1001','info:name','Thomas'
hbase(main) > put 'student','1001','info:sex','male'
hbase(main) > put 'student','1001','info:age','18'
hbase(main) > put 'student','1002','info:name','Janna'
hbase(main) > put 'student','1002','info:sex','female'
hbase(main) > put 'student','1002','info:age','20'
3) 扫描查看表数据
hbase(main) > scan 'student'
hbase(main) > scan 'student',{STARTROW => '1001', STOPROW => '1001'}
hbase(main) > scan 'student',{STARTROW => '1001'}
4) 查看表结构
hbase(main):012:0> describe ‘student’
5) 更新指定字段的数据
hbase(main) > put 'student','1001','info:name','Nick'
hbase(main) > put 'student','1001','info:age','100'
6) 查看“指定行”或“指定列族:列”的数据
hbase(main) > get 'student','1001'
hbase(main) > get 'student','1001','info:name'
7) 删除数据
删除某rowkey的全部数据:
hbase(main) > deleteall 'student','1001'
删除某rowkey的某一列数据:
hbase(main) > delete 'student','1002','info:sex'
8) 清空表数据
hbase(main) > truncate 'student'
尖叫提示:清空表的操作顺序为先disable,然后再truncating。
9) 删除表
首先需要先让该表为disable状态:
hbase(main) > disable 'student'
然后才能drop这个表:
hbase(main) > drop 'student'
尖叫提示:如果直接drop表,会报错:Drop the named table. Table must first be disabled
ERROR: Table student is enabled. Disable it first.
10) 统计表数据行数
hbase(main) > count 'student'
11) 变更表信息
将info列族中的数据存放3个版本:
hbase(main) > alter 'student',{NAME=>'info',VERSIONS=>3}
搭建过程中可能出现的问题:
1、配置问题
java.io.IOException: Failed on local exception: com.google.protobuf.InvalidProtocolBufferException: Protocol message end-group tag did not match expected tag.;
hbase-site.xml中属性配置不对,hdfs://hadoop0:9000/hbase对应的是Hadoop集群的hdfs路径端口
<property>
<name>hbase.rootdir</name>
<value>hdfs://hadoop0:9000/hbase</value>
</property>
还没有评论,来说两句吧...