• linkedu视频
  • 平面设计
  • 电脑入门
  • 操作系统
  • 办公应用
  • 电脑硬件
  • 动画设计
  • 3D设计
  • 网页设计
  • CAD设计
  • 影音处理
  • 数据库
  • 程序设计
  • 认证考试
  • 信息管理
  • 信息安全
菜单
linkedu.com
导航菜单
  • 网页制作
  • 数据库
  • 程序设计
  • 操作系统
  • CMS教程
  • 游戏攻略
  • 脚本语言
  • 平面设计
  • 软件教程
  • 网络安全
  • 电脑知识
  • 服务器
  • 视频教程
  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx
您的位置:首页 > 服务器 >云计算 > Hadoop对小文件的解决方案,

Hadoop对小文件的解决方案,

作者:网友 字体:[增加 减小] 来源:互联网

本文主要包含hadoop大数据解决方案,hadoop解决方案,hadoop配置文件详解,hadoop配置文件,hadoop 删除文件夹等服务器相关知识,网友希望可以进行参考

Hadoop对小文件的解决方案,


小文件指的是那些size比HDFS的block size(默认64M)小的多的文件。任何一个文件,目录和block,在HDFS中都会被表示为一个object存储在namenode的内存中, 每一个object占用150 bytes的内存空间。所以,如果有10million个文件, 每一个文件对应一个block,那么就将要消耗namenode 3G的内存来保存这些block的信息。如果规模再大一些,那么将会超出现阶段计算机硬件所能满足的极限。
控制小文件的方法有:

1、应用程序自己控制
2、archive
3、Sequence File / Map File
4、CombineFileInputFormat***
5、合并小文件,如HBase部分的compact

1、应用程序自己控制

final Path path = new Path("/combinedfile");
final FSDataOutputStream create = fs.create(path);
final File dir = new File("C:\\Windows\\System32\\drivers\\etc");
for(File fileName : dir.listFiles()) 
{
    System.out.println(fileName.getAbsolutePath());
    final FileInputStream fileInputStream = new
FileInputStream(fileName.getAbsolutePath());
    final List<String> readLines = IOUtils.readLines(fileInputStream);
    for (String line : readLines) 
    {
        create.write(line.getBytes());
    }
    fileInputStream.close();
}
create.close();

2、archive 命令行操作

具体参考如下:
http://blog.csdn.net/scgaliguodong123_/article/details/46341587

3、Sequence File/Map File

Sequence File
通常对于”the small files problem”的回应会是:使用SequenceFile。
这种方法是说,使用filename作为key,并且file contents作为value。实践中这种方式非常管用。
如果有10000个100KB的文件,可以写一个程序来将这些小文件写入到一个单独的 SequenceFile中去,然后就可以在一个streaming fashion(directly or using mapreduce)中来使用这个sequenceFile。不仅如此,SequenceFiles也是splittable的,所以mapreduce 可以break them into chunks,并且分别的被独立的处理。和HAR不同的是,这种方式还支持压缩。 block的压缩在许多情况下都是最好的选择,因为它将多个 records压缩到一起,而不是一个record一个压缩。

在存储结构上, SequenceFile主要由一个Header后跟多条Record组成。
Header主要包含了Key classname, Value classname,存储压缩算法,用户自定义元数据等信息,此外,还包含了一些同步标识,用于快速定位到记录的边界。

每条Record以键值对的方式进行存储,用来表示它的字符数组可依次解析成:记录的长度、 Key的长度、 Key值和Value值,并且Value值的结构取决于该记录是否被压缩。

数据压缩有利于节省磁盘空间和加快网络传输, SeqeunceFile支持两种格式的数据压缩,分别是: record compression和block compression。
record compression是对每条记录的value进行压缩
block compression是将一连串的record组织到一起,统一压缩成一个block。
block信息主要存储了:块所包含的记录数、每条记录Key长度的集合、每条记录Key值的集合、每条记录Value长度的集合和每条记录Value值的集合
注:每个block的大小是可通过io.seqfile.compress.blocksize属性来指定的。

Configuration conf=new Configuration();
FileSystem fs=FileSystem.get(conf);
Path seqFile=new Path("seqFile.seq");
//Reader内部类用于文件的读取操作
SequenceFile.Reader reader=new SequenceFile.Reader(fs,seqFile,conf);
//Writer内部类用于文件的写操作,假设Key和Value都为Text类型
SequenceFile.Writer writer=new SequenceFile.Writer(fs,conf,seqFile,Text.class,Text.class);
//通过writer向文档中写入记录
writer.append(new Text("key"),new Text("value"));
IOUtils.closeStream(writer);//关闭write流
//通过reader从文档中读取记录
Text key=new Text();
Text value=new Text();
while(reader.next(key,value))
{
    System.out.println(key);
    System.out.println(value);
}
IOUtils.closeStream(reader);//关闭read流

具体可参考:
http://blog.csdn.net/scgaliguodong123_/article/details/46391061

MapFile
MapFile是排序后的SequenceFile,通过观察其目录结构可以看到
MapFile由两部分组成,分别是data和index。
index作为文件的数据索引,主要记录了每个Record的key值,以及
该Record在文件中的偏移位置。
在MapFile被访问的时候,索引文件会被加载到内存,通过索引映射关系可迅速定位到指定Record所在文件位置,因此,相对SequenceFile而言, MapFile的检索效率是高效的,缺点是会消耗一部分内存来存储index数据。
需注意的是, MapFile并不会把所有Record都记录到index中去,默认情况下每隔128条记录存储一个索引映射。当然,记录间隔可人为修改,通过MapFIle.Writer的setIndexInterval()方法,或修改io.map.index.interval属性;
另外,与SequenceFile不同的是, MapFile的KeyClass一定要实现
WritableComparable接口 ,即Key值是可比较的。

Configuration conf=new Configuration();
FileSystem fs=FileSystem.get(conf);
Path mapFile=new Path("mapFile.map");
//Writer内部类用于文件的写操作,假设Key和Value都为Text类型
MapFile.Writer writer=new MapFile.Writer(conf,fs,mapFile.toString(),Text.class,Text.class);
//通过writer向文档中写入记录
writer.append(new Text("key"),new Text("value"));
IOUtils.closeStream(writer);//关闭write流
//Reader内部类用于文件的读取操作
MapFile.Reader reader=new MapFile.Reader(fs,mapFile.toString(),conf);
//通过reader从文档中读取记录
Text key=new Text();
Text value=new Text();
while(reader.next(key,value))
{
    System.out.println(key);
    System.out.println(value);
}
IOUtils.closeStream(reader);//关闭read流

5、CombineFileInputFormat

相对于大量的小文件来说,hadoop更合适处理少量的大文件。
CombineFileInputFormat可以缓解这个问题,它是针对小文件而设计的。
**注:**CombineFileInputFormat是一个抽象类,需要编写一个继承类。
使用CombineFileInputFormat作为Map任务的输入规格描述,首先需要实现一个自定义的RecordReader。

Comb

分享到:QQ空间新浪微博腾讯微博微信百度贴吧QQ好友复制网址打印

您可能想查找下面的文章:

  • hadoop一些常见报错的解决方案,hadoop解决方案
  • Hadoop对小文件的解决方案,

相关文章

  • Spark RDD API扩展开发(1),sparkrdd
  • RegionServer功能职责,regionserver职责
  • What&#39;s Wrong With Hue Oozie Editor?,hueoozie
  • 这会不会是顶好的实现万物互联的途径?--设备智能化改造,万物--
  • hadoop的namenode无法启动的解决办法,hadoopnamenode
  • Namespace:Openstack的网络实现,namespaceopenstack
  • Hadoop集群性能优化一,Hadoop集群性能优化
  • 我与英语技术书籍,英语技术书籍
  • Hive编程指南_学习笔记01,hive编程指南
  • [Sqoop]将Hive数据表导出到Mysql,sqoophive

文章分类

  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx

最近更新的内容

    • 两款Docker管理UI:DockerUI &amp; Shipyard,dockerdockerui
    • 如何动态地给vSphere虚拟机模板注入信息,vsphere虚拟机
    • Hadoop对小文件的解决方案,
    • 配置tomcat默认项目,tomcat默认项目
    • Cloud Foundry安装部署指南(下),cloudfoundry
    • logstash 学习小记,logstash小记
    • 有关微软技术方向的最新学习资源【2015-9月】,学习资源2015-9
    • Elasticsearch之Nested Aggregation,elasticsearch
    • Storm简述及集群安装,Storm简述集群安装
    • 索引更新,oracle索引更新

关于我们 - 联系我们 - 免责声明 - 网站地图

©2020-2025 All Rights Reserved. linkedu.com 版权所有