• linkedu视频
  • 平面设计
  • 电脑入门
  • 操作系统
  • 办公应用
  • 电脑硬件
  • 动画设计
  • 3D设计
  • 网页设计
  • CAD设计
  • 影音处理
  • 数据库
  • 程序设计
  • 认证考试
  • 信息管理
  • 信息安全
菜单
linkedu.com
导航菜单
  • 网页制作
  • 数据库
  • 程序设计
  • 操作系统
  • CMS教程
  • 游戏攻略
  • 脚本语言
  • 平面设计
  • 软件教程
  • 网络安全
  • 电脑知识
  • 服务器
  • 视频教程
  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx
您的位置:首页 > 服务器 >云计算 > 关于HIVE数据仓库的基本操作,hive数据仓库

关于HIVE数据仓库的基本操作,hive数据仓库

作者:网友 字体:[增加 减小] 来源:互联网

本文主要包含hive数据仓库,数据仓库软件hive,hive数据仓库教程,hive数据倾斜,hive 数据类型等服务器相关知识,网友希望可以进行参考

关于HIVE数据仓库的基本操作,hive数据仓库


[Author]: kwu 

关于HIVE数据仓库的基本操作


1、数据库划分:

default : 默认库,测试库。对应路径 /hdfs/hive/default
stage : 中转库 对应路径 /hdfs/dw/stage
ods :  正式库 对应路径 /hdfs/dw/ods


2、创建表
create EXTERNAL table test_kwu (
dateday string comment "日期:如2015-01-01", 
datetime string comment "时间 : 如 11:30:01:123",
ip string comment "IP:用户本机IP或用户所在网段对外路由IP",
cookieid string comment "用户cookie:统一在用户端生成的唯一标志",
userid string comment "用户和讯注册ID :用户在和讯网的注册ID", 
logserverip string comment "记录日志服务器IP :日志收集服务器IP",
referer string comment "来源 :用户浏览网页的REFER",
requesturl string comment "访问网址 : 当前访问网址",
remark1 string comment "【暂时没用】 :该数据无意义,由于早期加入目前不能去除",
remark2 string comment "【暂时没用】 : 该数据无意义,由于早期加入目前不能去除",
alexaflag string comment "ALEXA标志  :这个字段也是早期加入,当用户安装alexa工具时值为1,否则为0.早期加入,目前来看应该没有任何意义了。",
ua string comment "UA :用户浏览器UA",
wirelessflag string comment "无线频道标志:给无线频道专用的,一个单词,表示该文章对应和讯哪一个频道"
) 
comment "浏览轨迹日志"
partitioned by(day string comment "按天的分区表字段")
ROW FORMAT DELIMITED FIELDS TERMINATED BY ' '
STORED AS TEXTFILE 
location '/hive/default/test_kwu';  --注意:此处的路径对应到数据库的路径(去掉 "/hdfs"),后缀加上table的名称。


3、装载数据
load data local inpath '/home/kwu/data/20150512.dat' overwrite into table test_kwu partition (day='20150512');
insert into table test_kwu PARTITION (day='20150507')  select  dateday, datetime,ip,cookieid,userid, logserverip,referer,
requesturl ,remark1,remark2,alexaflag,ua,wirelessflag  from test_kwu  ;


4、压缩处理
set hive.enforce.bucketing=true;
set hive.exec.compress.output=true;
set mapred.output.compress=true;
set mapred.output.compression.codec=org.apache.hadoop.io.compress.GzipCodec;
set io.compression.codecs=org.apache.hadoop.io.compress.GzipCodec;
insert overwrite table test_kwu PARTITION (day='20150507')  select  dateday, datetime,ip,cookieid,userid, logserverip,referer,
requesturl ,remark1,remark2,alexaflag,ua,wirelessflag  from test_kwu  ;


5、基本查询语句
查询每天的PV
select dateday,count(*) from tracklog group by dateday;


尽量避全表的聚合函数
select count(*) as cnt from tracklog group by cookieid having cnt=1 ;  


可采用子查询代替
select dateday,count(t.cookieid) from (
select count(cookieid) as cnt,cookieid,dateday
from tracklog  
group by cookieid,dateday  having cnt=1 
) t group by dateday;


分享到:QQ空间新浪微博腾讯微博微信百度贴吧QQ好友复制网址打印

您可能想查找下面的文章:

  • 关于HIVE数据仓库的基本操作,hive数据仓库
  • 每日定时导入hive数据仓库的自动化脚本,hive数据仓库脚本

相关文章

  • Understanding Cubert Concepts 之 BLOCK(一),cubertconcepts
  • hadoop1 & hadoop2 fair-schduler 配置和使用,hadoop
  • UcloudClient,icloud
  • Hadoop,HBase集群环境搭建的问题集锦(一),hadoophbase
  • word2vec.c源码分析,word2vec.c源码
  • A Note on Distributed Computing,anoteondialectic
  • spark-OutOfMemory:GC overhead limit exceeded 解决,timelimitexceeded
  • OSTC 2015,ostc2015
  • Hadoop之——HBase笔记(补充),hadoophbase
  • What's Wrong With Hue Oozie Editor?,hueoozie

文章分类

  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx

最近更新的内容

    • [Hive]关于Hive的启动问题,hive启动问题
    • Ambari Metrics介绍,ambarimetrics介绍
    • NOSQL(一)为什么选用NoSQL?,选用nosql
    • OSTC 2015,ostc2015
    • 云服务器之间实时文件同步和文件备份的最简单高效的免费方案,实时文件备份
    • hive 优化的原则,hive优化原则
    • zookeeper——分布式锁,zookeeper
    • 《1》CentOS7.0+OpenStack+kvm云平台部署—基础配置,centos7.0kvm
    • Scala非值类型,Scala值类型
    • Greenplum+Hadoop学习笔记-14-定义数据库对象之创建与管理模式,hadoop-14-

关于我们 - 联系我们 - 免责声明 - 网站地图

©2020-2025 All Rights Reserved. linkedu.com 版权所有