• linkedu视频
  • 平面设计
  • 电脑入门
  • 操作系统
  • 办公应用
  • 电脑硬件
  • 动画设计
  • 3D设计
  • 网页设计
  • CAD设计
  • 影音处理
  • 数据库
  • 程序设计
  • 认证考试
  • 信息管理
  • 信息安全
菜单
linkedu.com
导航菜单
  • 网页制作
  • 数据库
  • 程序设计
  • 操作系统
  • CMS教程
  • 游戏攻略
  • 脚本语言
  • 平面设计
  • 软件教程
  • 网络安全
  • 电脑知识
  • 服务器
  • 视频教程
  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx
您的位置:首页 > 服务器 >云计算 > hadoop基础知识

hadoop基础知识

作者:qbs946 字体:[增加 减小] 来源:互联网

本文主要包含hadoop等服务器相关知识,qbs946希望可以进行参考

什么是hadoop?

hadoop = teh hadoop projects

hadoop体系架构生态圈主要包含common,avro,mapreduce,hdfs,pig,hive(数据仓库),hbase,zookeeper,oozie(任务调度),sqoop(数据转移hive ↔ mysql)等组件

hadoop核心: hdfs(分布式文件系统)+ mapreduce (计算)+yarn(运算资源调度系统,管理硬件资源,内存/cpu等)。

 

HDFS架构

hdfs中的一些常见名词

block:一个文件分块,默认64M。当写入一个文件到 HDFS 时,它被切分成数据块,块大小是由配置文件 hdfs-default.xml 中的参数 dfs.blocksize (自 hadoop-2.2 版本后,默认值为 134217728字节即 128M,可以在 hdfs-site.xml 文件中改变覆盖其值。

namenode:保存整个文件系统的目录信息,文件信息以及文件相应的分块信息。(单点,提供服务的namenode只有一个)

datanode:用于存储blocks(文件块)。

hdfs的HA策略:namenode一旦宕机,整个文件系统将无法工作,如果namenode中的数据丢失,整个文件系统也就丢失了,从2.x开始,hdfs支持namenode的active-atandy模式(主从)。

 

 

在hdfs上的文件存储 

dbossdat1001.txt   600G

 

同一个文件快在不同节点中有多个副本,当某个节点的数据失效时,可以从另外的节点获取到文件的内容,当数据失效时,副本有效个数会减少,hadoop可以自动侦测到这一点,从有效的副本复制,自动恢复到正常的副本个数。

 

 

hdfs中的namenode和datanode

 

如上图所示,在hdfs中,分为两个部分:namenode和datanode,其中那么node只有一个节点,datanode则有多个节点。但从hadoop2.0版本之后开始,namenode有主从两个节点防止节点挂掉。

 

 


hdfs总的架构图

 

mapreduce


mapreduce编程模型

总图中可以看到,mapreduce是将大任务分割成若干的小任务,然后在汇总得出结果。

分享到:QQ空间新浪微博腾讯微博微信百度贴吧QQ好友复制网址打印

您可能想查找下面的文章:

相关文章

  • Hadoop Installation on Linux,hadoopinstallation
  • HDFS小文件的合并优化
  • Hadoop常见重要命令行操作及命令作用,hadoop命令行命令
  • 超人学院Hadoop大数据资源分享,超人学院hadoop分享
  • 从Zoho CRM推出本地行业解决方案看洋品牌的落地,zohocrm
  • Hadoop新版和旧版中InputSplit大小的区别,hadoopinputsplit
  • spark core源码分析10 Task的运行,sparkcore
  • 【Spark】Spark的Standalone模式安装部署,sparkstandalone
  • Docker网络详解及pipework源码解读与实践,dockerpipework
  • Spark编程指南V1.4.0(翻译),编程指南v1.4.0

文章分类

  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx

最近更新的内容

    • Apache Pig的前世今生,apachepig前世今生
    • jsp里input中获取当前时间,与WdatePicker配合使用,inputwdatepicker
    • 一步一步跟我学hadoop(1)----hadoop概述和安装配置,hadoop----hadoop
    • 搭建私有 Docker 仓库服务器,docker仓库
    • 如何解决Greenplum master node与seg node元数据不一致,greenplumseg
    • hadoop-common源码分析之-WritableUtils,hadoopcommon源码
    • 使用export/import导出和导入docker容器,exportdocker
    • Spark RDD API扩展开发(1),sparkrdd
    • hive 日志存放位置修改,hive日志存放位置
    • MapReduce编程之实现多表关联,mapreduce编程关联

关于我们 - 联系我们 - 免责声明 - 网站地图

©2020-2025 All Rights Reserved. linkedu.com 版权所有