[喵咪大数据]HUE大数据管理工具

时间 2019-11-24

原文原文链接

平常的大数据使用中常常是在服务器命名行中进行操做,可视化功能仅仅依靠着各个组件自带的网页进行,那么有没有一个能够结合你们能在一个网页上的管理工具呢?答案是确定的,今天就和你们一块儿来探索大数据管理工具HUE的庐山真面目.python

附上:mysql

喵了个咪的博客:w-blog.cnc++

1.环境准备

编译依赖web

wget http://repos.fedorapeople.org/repos/dchen/apache-maven/epel-apache-maven.repo -O /etc/yum.repos.d/epel-apache-maven.repo
sudo yum install apache-maven ant asciidoc cyrus-sasl-devel cyrus-sasl-gssapi gcc gcc-c++ krb5-devel libxml2-devel libxslt-devel make mysql mysql-devel openldap-devel python-devel sqlite-devel gmp-devel libffi libffi-devel

ca /app/install
wget http://archive-primary.cloudera.com/cdh5/cdh/5/hue-3.7.0-cdh5.4.2.tar.gz
> chown -R root:root hue-3.7.0-cdh5.4.4
> chmod -R 777 hue-3.7.0-cdh5.4.4
# 启动方式
/app/install/hue-3.7.0-cdh5.4.4/build/env/bin/python2.7 /app/install/hue-3.7.0-cdh5.4.4/build/env/bin/hue runcherrypyserver

2.配置文件修改

修改配置文件

vim /app/install/hue-3.7.0-cdh5.4.4/desktop/conf/hue.ini

http_host = 0.0.0.0 (Hue Web Server所在主机/IP)
http_port = 8000 (Hue Web Server服务端口)
server_user = hadoop (运行Hue Web Server的进程用户)
server_group = hadoop (运行Hue Web Server的进程用户组)
default_user = hadoop (Hue管理员)
default_hdfs_superuser = hadoop (HDFS管理用户)
fs_defaultfs = hdfs://hadoop-1:8020 (对应core-site.xml配置项fs.defaultFS)
webhdfs_url = http://hadoop-1:50070/webhdfs/v1 (webhdfs访问地址)
hadoop_conf_dir = /usr/local/hadoop-2.7.3/etc/hadoop (Hadoop配置文件目录)
resourcemanager_host = hadoop (对应yarn-site.xml配置项yarn.resourcemanager.hostname)
resourcemanager_api_url = http://hadoop-1:8088 (对应于yarn-site.xml配置项yarn.resourcemanager.webapp.address)
proxy_api_url = http://hadoop-1:8088 (对应yarn-site.xml配置项yarn.web-proxy.address)
history_server_api_url = http://hadoo-1:19888 (对应mapred-site.xml配置项mapreduce.jobhistory.webapp.address)
hive_server_host = hadoop-1 (Hive所在节点主机名/IP)
hive_server_port = 10000 (HiveServer2服务端口号)
hive_conf_dir = /usr/local/hive-2.3.0/conf (Hive配置文件目录)

必定要增长一个hue用户sql

useradd hue

发现是webhdfs都是能够apache

curl –i "http://dev-hadoop:50070/webhdfs/v1/user?user.name=hadoop&op=GETFILESTATUS"

须要配置Hadoop访问权限vim

vim /usr/local/hadoop-2.7.3/etc/hadoop/core-site.xml

<property>
    <name>hadoop.proxyuser.hadoop.hosts</name>
    <value>*</value>
</property>

<property>
    <name>hadoop.proxyuser.hadoop.groups</name>
    <value>*</value>
</property>

vim /usr/local/hadoop-2.7.3/etc/hadoop/hdfs-site.xml
<property>
<name>dfs.webhdfs.enabled</name>
<value>true</value>
</property>

重启hadoop若是不行重启服务器api

3.使用HUE

能够在线执行Hive语句(这里注意若是是Hbase关联表是没法在HUE平台使用的解决方法能够导出到Hive中的一个表在进查询)服务器

直接查看hdfs文件系统app

管理 hadoop 做业

管理zookeeper状态

关于hbase 不支持 thrift2 须要使用 hive使用thrift1 的版本才能结合使用启动以后就能够看到以下结果

4 总结

在各类各样的组件下HUE无疑是最好的web工具的选择,HUE还有不少其余的功能包括咱们后面要说到的spark,sqoop等相关的组件均可以经过HUE进行在线管理.

注:笔者能力有限有说的不对的地方但愿你们可以指出,也但愿多多交流!

个人博客即将搬运同步至腾讯云+社区，邀请你们一同入驻：https://cloud.tencent.com/developer/support-plan