• linkedu视频
  • 平面设计
  • 电脑入门
  • 操作系统
  • 办公应用
  • 电脑硬件
  • 动画设计
  • 3D设计
  • 网页设计
  • CAD设计
  • 影音处理
  • 数据库
  • 程序设计
  • 认证考试
  • 信息管理
  • 信息安全
菜单
linkedu.com
导航菜单
  • 网页制作
  • 数据库
  • 程序设计
  • 操作系统
  • CMS教程
  • 游戏攻略
  • 脚本语言
  • 平面设计
  • 软件教程
  • 网络安全
  • 电脑知识
  • 服务器
  • 视频教程
  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx
您的位置:首页 > 服务器 >云计算 > 创建GZIP压缩格式的HIVE表,gzip压缩格式hive

创建GZIP压缩格式的HIVE表,gzip压缩格式hive

作者:网友 字体:[增加 减小] 来源:互联网

本文主要包含gzip压缩格式,gzip压缩,linux gzip压缩,网页gzip压缩,gzip压缩命令等服务器相关知识,网友希望可以进行参考

创建GZIP压缩格式的HIVE表,gzip压缩格式hive


[Author]:  kwu


GZIP为Linux系统中最常用的压缩格式,创建GZIP压缩格式的HIVE表具体步骤如下。


1、以 STORED AS TEXTFILE 为存储格式创建HIVE表
CREATE TABLE TRACKLOG (DATEDAY STRING COMMENT "日期",IP STRING COMMENT "IP",COOKIEID STRING COMMENT "用户COOKIE",USERID STRING COMMENT "用户ID", LOGSERVERIP STRING COMMENT "记录日志服务器IP",REFERER STRING COMMENT "来源 :用户浏览网页的REFER",REQUESTURL STRING COMMENT "访问网址 : 当前访问网址") 
PARTITIONED BY(DAY STRING)
ROW FORMAT DELIMITED FIELDS TERMINATED BY ' '
STORED AS TEXTFILE ;


2、TEXTFILE格式可使用普通文本格式数据、也可使用GZIP的压缩格式,HIVE做自动解压GZIP的格式。


3、GZIP的压缩方法:
压缩当前目录下所有的 *.dat 文件
gzip *.dat


4、装载数据到HIVE分区表中
LOAD DATA LOCAL INPATH '/DISKG/BIGDATA/10-0-251-146/TRACKLOG/20150123*.DAT' OVERWRITE INTO TABLE TRACKLOG PARTITION (DAY='20150123'); 


或者通过mapreduce加载数据,需要先设置hive的压缩参数:

set hive.enforce.bucketing=true; 
set hive.exec.compress.output=true;  
set mapred.output.compress=true;  
set mapred.output.compression.codec=org.apache.hadoop.io.compress.GzipCodec;  
set io.compression.codecs=org.apache.hadoop.io.compress.GzipCodec;  

insert overwrite table trackloggzip PARTITION (day='20150124') select dateday, datetime ,ip,cookie  ,userid   ,logserverip ,source ,requesturl ,remark1 ,remark2,alexaflag ,ua ,  wirelessflag from tracklog where day='20150124' ;


5、删除一个分区
ALTER TABLE TRACKLOG DROP PARTITION(DAY='20130823') 


6、GZIP的压缩,有着较好的通用性(LINUX系统中最常用的压缩方式),及良好的压缩比率(经测试文本压缩为23%),同时SPARK-SQL也能完美支持GZIP的格式。


分享到:QQ空间新浪微博腾讯微博微信百度贴吧QQ好友复制网址打印

您可能想查找下面的文章:

  • 创建GZIP压缩格式的HIVE表,gzip压缩格式hive

相关文章

  • 机器学习基础,学习基础
  • redshift的约束策略,redshift约束策略
  • 万法归宗之Hadoop编程无界限,万法归宗hadoop
  • R.net简介(原创翻译),r.net简介原创翻译
  • Spark的Master和Worker集群启动的源码分析,sparkworker
  • MongoDB 安装与启动,MongoDB安装启动
  • MapReduce编程之实现多表关联,mapreduce编程关联
  • Zookeeper实践之:通过Zookeeper实现一个消费者进程分配程序,zookeeper消费者
  • K天熟悉Apache Storm (三),apachestorm
  • Andrew Ng机器学习课程10补充,andrewng

文章分类

  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx

最近更新的内容

    • Map/Reduce原理
    • 联想台式机启天m4350 启用intel vt-x,m4350vt-x
    • MapReduce之RecordReader组件源码解析及实例,mapreduce实例
    • hadoop修改启动主机名称
    • 机器学习算法-Adaboost,学习算法-adaboost
    • Spark下的PageRank实现,SparkPageRank实现
    • Hadoop Installation on Linux,hadoopinstallation
    • 初试 Coding.net 在线IDE——WebIDE,coding.netwebide
    • 【Spark1.3官方翻译】Spark集群模式概览,spark1.3spark
    • 用Bash Script编写Hadoop MapReduce Streaming,hadoopmapreduce

关于我们 - 联系我们 - 免责声明 - 网站地图

©2020-2025 All Rights Reserved. linkedu.com 版权所有