• linkedu视频
  • 平面设计
  • 电脑入门
  • 操作系统
  • 办公应用
  • 电脑硬件
  • 动画设计
  • 3D设计
  • 网页设计
  • CAD设计
  • 影音处理
  • 数据库
  • 程序设计
  • 认证考试
  • 信息管理
  • 信息安全
菜单
linkedu.com
导航菜单
  • 网页制作
  • 数据库
  • 程序设计
  • 操作系统
  • CMS教程
  • 游戏攻略
  • 脚本语言
  • 平面设计
  • 软件教程
  • 网络安全
  • 电脑知识
  • 服务器
  • 视频教程
  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx
您的位置:首页 > 服务器 >云计算 > Hive 合并输入输出文件,

Hive 合并输入输出文件,

作者:网友 字体:[增加 减小] 来源:互联网

本文主要包含hive支持的文件格式,hive 压缩文件,hive文件格式,hive文件,hive 配置文件等服务器相关知识,网友希望可以进行参考

Hive 合并输入输出文件,


如果HIVE的输入文件是大量的小文件,而每个文件启动一个map的话是对yarn资源的浪费,同样的,Hive输出的文件也远远小于HDFS块大小,对后续处理也是不利的


HIVE中支持通过参数调整输入和输出的文件大小


1、合并输入文件

set mapred.max.split.size=256000000;  #每个Map最大输入大小
set mapred.min.split.size.per.node=100000000; #一个节点上split的至少的大小 
set mapred.min.split.size.per.rack=100000000; #一个交换机下split的至少的大小
set hive.input.format=org.apache.hadoop.hive.ql.io.CombineHiveInputFormat;  #执行Map前进行小文件合并


开启org.apache.hadoop.hive.ql.io.CombineHiveInputFormat后,一个data node节点上多个小文件会进行合并,合并文件数由mapred.max.split.size限制的大小决定
mapred.min.split.size.per.node决定了多个data node上的文件是否需要合并
mapred.min.split.size.per.rack决定了多个交换机上的文件是否需要合并

2、合并输出文件

set hive.merge.mapfiles = true #在Map-only的任务结束时合并小文件
set hive.merge.mapredfiles = true #在Map-Reduce的任务结束时合并小文件
set hive.merge.size.per.task = 256*1000*1000 #合并文件的大小
set hive.merge.smallfiles.avgsize=16000000 #当输出文件的平均大小小于该值时,启动一个独立的map-reduce任务进行文件merge

分享到:QQ空间新浪微博腾讯微博微信百度贴吧QQ好友复制网址打印

您可能想查找下面的文章:

  • Hive 合并输入输出文件,

相关文章

  • 机器学习--决策树(ID3)算法案例,id3案例
  • 2015年中国的云计算标准有哪些?,2015年中国标准
  • MapReduce编程之数据去重,mapreduce编程数据
  • Name node is in safe mode.错误处理方式 hadoop,nodehadoop
  • MapReduce中Shuffle过程整理,mapreduceshuffle
  • Storm中Trident流合并的例子demo,stormtrident
  • jsp中用EL读取了数据库里面的时间,怎么设置格式显示的格式,jspel
  • kerberos下HBase访问Zookeeper的ACL问题,hbasezookeeper
  • Hive 和普通关系数据库的异同,hive关系数据库
  • Zookeeper实践之:通过Zookeeper实现一个消费者进程分配程序,zookeeper消费者

文章分类

  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx

最近更新的内容

    • Hive 外部表 分区表,hive外部表分区表
    • UcloudClient,icloud
    • 微软平台开发技术蓝图,微软平台蓝图
    • Greenplum+Hadoop学习笔记-14-定义数据库对象之创建与管理模式,hadoop-14-
    • 【Spark】Spark应用执行机制,spark执行机制
    • 如何选择大数据培训机构,选择数据培训机构
    • Hadoop自测题,hadoop
    • kafka集群搭建,kafka集群
    • What's Wrong With Hue Oozie Editor?,hueoozie
    • <转>Openstack ceilometer 宿主机监控模块扩展,openstackceilometer

关于我们 - 联系我们 - 免责声明 - 网站地图

©2020-2025 All Rights Reserved. linkedu.com 版权所有