• linkedu视频
  • 平面设计
  • 电脑入门
  • 操作系统
  • 办公应用
  • 电脑硬件
  • 动画设计
  • 3D设计
  • 网页设计
  • CAD设计
  • 影音处理
  • 数据库
  • 程序设计
  • 认证考试
  • 信息管理
  • 信息安全
菜单
linkedu.com
导航菜单
  • 网页制作
  • 数据库
  • 程序设计
  • 操作系统
  • CMS教程
  • 游戏攻略
  • 脚本语言
  • 平面设计
  • 软件教程
  • 网络安全
  • 电脑知识
  • 服务器
  • 视频教程
  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx
您的位置:首页 > 服务器 >云计算 > 大数据学习笔记3--HDFS扩展和mapreduce工作过程,3--hdfsmapreduce

大数据学习笔记3--HDFS扩展和mapreduce工作过程,3--hdfsmapreduce

作者:网友 字体:[增加 减小] 来源:互联网

本文主要包含大数据学习笔记3--HDFS扩展和mapreduce工作过程,3--hdfsmapreduce等服务器相关知识,网友希望可以进行参考

大数据学习笔记3--HDFS扩展和mapreduce工作过程,3--hdfsmapreduce


HDFS配置:

  • 客户端中的配置参数可以覆盖服务端的参数。

  • 例如:副本数,切块大小

HDFS文件存储:

  • 服务端存储block的实际大小,但是不适合存储小文件,小文件会占用namenode的元数据空间。

  • 对于小文件数据的优化,可以在上传之前先合并再上传。

  • 例如:压缩、文本文件合并

HDFS扩展:

  • hdfs支持rest API,与平台无关

  • jetty 容器

  • hdfs支持rest command

分布式任务传统方式:

hadoop对分布式抽象

  • yarn:资源调度器,负责硬件资源调度、任务分配、环境配置、启动任务。

  • mapredce:分布式运算框架,监视任务执行、失败重试、中间结果调度。

  • spark、storm:实时计算

mapreduce

  • mapper:
    一次读取一行数据
    输出一组keyValue
    mapper个数等于block块数
  • shuffle:
    合并数据
  • reduce:
    业务逻辑处理

hadoop序列化机制:

  • hadoop中目前的序列化机制是writable,后续版本中会替换为avro

mapreduce任务提交方式

mapreduce任务执行流程

  • RunJar:客户端
  • ResourceManager:资源管理器,老大
  • NodeManager:执行任务管理器
  • MrAppMaste:任务启动、监控、失败重试
  • yarnchild:mapper和reducer

分享到:QQ空间新浪微博腾讯微博微信百度贴吧QQ好友复制网址打印

您可能想查找下面的文章:

  • 大数据学习笔记3--HDFS扩展和mapreduce工作过程,3--hdfsmapreduce

相关文章

  • Hadoop,HBase集群环境搭建的问题集锦(一),hadoophbase
  • Centos 安装R 集成 Hadoop、RHive 配置安装手册,centoshadoop
  • 用Hello World校验Docker的安装,hellodocker
  • storm的集群安装与配置,storm集群配置
  • 云服务器之间实时文件同步和文件备份的最简单高效的免费方案,实时文件备份
  • 《转》 Openstack Grizzly 指定 compute node 创建 instance,《转》openstack
  • 初识云计算,初识云
  • Cloud Foundry安装部署指南(下),cloudfoundry
  • 实战第一个云程序,实战第一个云
  • Spark性能优化指南:基础篇

文章分类

  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx

最近更新的内容

    • Linux IRQ Affinity,linuxirqaffinity
    • [Hive]HBaseIntegration:通过Hive读写HBase,
    • 分布式数据库MVCC读写设计,数据库mvcc读写
    • Andrew Ng机器学习课程9-补充,andrew9-
    • MapReduce的两表join一般操作,mapreduce表join
    • Greenplum+Hadoop学习笔记-14-定义数据库对象之创建与管理表空间,hadoop-14-
    • <转>云主机配置OpenStack使用spice的方法,openstackspice
    • Hadoop中查看一个文件位置信息,
    • <转>linux上nagios安装完整版,linuxnagios
    • RegionServer功能职责,regionserver职责

关于我们 - 联系我们 - 免责声明 - 网站地图

©2020-2025 All Rights Reserved. linkedu.com 版权所有