• linkedu视频
  • 平面设计
  • 电脑入门
  • 操作系统
  • 办公应用
  • 电脑硬件
  • 动画设计
  • 3D设计
  • 网页设计
  • CAD设计
  • 影音处理
  • 数据库
  • 程序设计
  • 认证考试
  • 信息管理
  • 信息安全
菜单
linkedu.com
导航菜单
  • 网页制作
  • 数据库
  • 程序设计
  • 操作系统
  • CMS教程
  • 游戏攻略
  • 脚本语言
  • 平面设计
  • 软件教程
  • 网络安全
  • 电脑知识
  • 服务器
  • 视频教程
  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx
您的位置:首页 > 服务器 >云计算 > 每日定时导入hive数据仓库的自动化脚本,hive数据仓库脚本

每日定时导入hive数据仓库的自动化脚本,hive数据仓库脚本

作者:网友 字体:[增加 减小] 来源:互联网

本文主要包含hive数据仓库,数据仓库软件hive,hive数据仓库教程,hive脚本,hive 执行脚本等服务器相关知识,网友希望可以进行参考

每日定时导入hive数据仓库的自动化脚本,hive数据仓库脚本


[Author]: kwu 

每日定时导入hive数据仓库的自动化脚本


创建shell脚本,创建临时表,装载数据,转换到正式的分区表中:

#!/bin/sh
# upload logs to hdfs

yesterday=`date --date='1 days ago' +%Y%m%d`

hive -e "
use stage;
create table tracklog_tmp (
dateday string,
datetime string,
ip string ,
cookieid string,
userid string,
logserverip string,
referer string,
requesturl string,
remark1 string,
remark2 string,
alexaflag string,
ua string,
wirelessflag string
)
ROW FORMAT DELIMITED FIELDS TERMINATED BY ' ';"


hive -e "
use stage;
set hive.enforce.bucketing=true;
set hive.exec.compress.output=true;
set mapred.output.compress=true;
set mapred.output.compression.codec=org.apache.hadoop.io.compress.GzipCodec;
set io.compression.codecs=org.apache.hadoop.io.compress.GzipCodec;
load data local inpath '/diskg/logs/tracklog_192.168.1.1/${yesterday}/${yesterday}????.dat' overwrite into table tracklog_tmp;
insert into table tracklog PARTITION (day='${yesterday}')  select  *  from tracklog_tmp;
load data local inpath '/diskg/logs/tracklog_192.168.1.2/${yesterday}/${yesterday}????.dat' overwrite into table tracklog_tmp;
insert into table tracklog PARTITION (day='${yesterday}')  select  *  from tracklog_tmp;
load data local inpath '/diskg/logs/tracklog_192.168.1.3/${yesterday}/${yesterday}????.dat' overwrite into table tracklog_tmp;
insert into table tracklog PARTITION (day='${yesterday}')  select  *  from tracklog_tmp;
load data local inpath '/diskg/logs/trackloguc_192.168.1.1/${yesterday}/${yesterday}????.dat' overwrite into table tracklog_tmp;
insert into table tracklog PARTITION (day='${yesterday}')  select  *  from tracklog_tmp;
load data local inpath '/diskg/logs/trackloguc_192.168.1.2/${yesterday}/${yesterday}????.dat' overwrite into table tracklog_tmp;
insert into table tracklog PARTITION (day='${yesterday}')  select  *  from tracklog_tmp;
load data local inpath '/diskg/logs/trackloguc_192.168.1.3/${yesterday}/${yesterday}????.dat' overwrite into table tracklog_tmp;
insert into table tracklog PARTITION (day='${yesterday}')  select  *  from tracklog_tmp;
"

hive -e "
use stage;
drop table tracklog_tmp ;"


在crontab中加入定时任务

crontab -e 

加入如下代码

#import tracklog
25  07 * * * /opt/bin/hive_opt/import_tracklog.sh




分享到:QQ空间新浪微博腾讯微博微信百度贴吧QQ好友复制网址打印

您可能想查找下面的文章:

  • 关于HIVE数据仓库的基本操作,hive数据仓库
  • 每日定时导入hive数据仓库的自动化脚本,hive数据仓库脚本

相关文章

  • MapReduce编程之实现多表关联,mapreduce编程关联
  • 机器学习-模型评估与选择
  • 【甘道夫】Spark1.3.0 Submitting Applications 官方文档精华摘要,spark1.3
  • JOIN操作,数据库join操作
  • Spark MLlib Deep Learning Convolution Neural Network (深度学习-卷积神经网络)3.3,mllibconvolution
  • 最小 Docker 镜像 hello-world 剖析,dockerhello-world
  • 我与英语技术书籍,英语技术书籍
  • 《3》CentOS7.0+OpenStack+kvm云平台部署—配置Glance,《3》kvm
  • 博文点评后的一点闲扯,博文点评闲扯
  • MongoDB Query 的几个方法,mongodbquery

文章分类

  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx

最近更新的内容

    • jsp里input中获取当前时间,与WdatePicker配合使用,inputwdatepicker
    • Spark性能优化指南:高级篇
    • Spark开发指南,spark指南
    • HBase入门5(集群),hbase入门5集群
    • 最小 Docker 镜像 hello-world 剖析,dockerhello-world
    • openstack中Nova组件images的所有python API 汇总,openstacknova
    • zookeeper——分布式锁,zookeeper
    • 两款Docker管理UI:DockerUI & Shipyard,dockerdockerui
    • openstack 用nova API 指定 compute node 创建 instance,openstackcompute
    • kafka 效率优化,kafka优化

关于我们 - 联系我们 - 免责声明 - 网站地图

©2020-2025 All Rights Reserved. linkedu.com 版权所有