- Docker安装MySQL8.0的实现方法这篇文章主要介绍了Docker安装MySQL8.0的实现方法,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧
- docker compose自定义网络实现固定容器ip地址这篇文章主要介绍了dockercompose自定义网络实现固定容器ip地址,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧
- mysql数据导入hbase下载sqoop-1.4.6.bin__hadoop-2.0.4-alpha.tar.gz解压//配置环境变量exportSQOOP_HOME=/home/hadoop/software/sqoop-1.4.6.bin__hadoop-2.0.4-alphaexportSQOOP_SERVER_EXTRA_LIB=$SQOOP_HOME/libexportPATH=$SQO
- Spark On Yarn 详细配置流程1、系统与软件准备系统:centos7软件:?hadoop-2.7.2.tar.gz,请勿选择src版本,否则需要自行编译?jdk-7u79-linux-x64.tar.gz?scala-2.10.3.tgz?spark-1.6.1-bin-hadoop2.6.tgz,选择hadooppre-built版本,否则需要安装后编译??zookeeper-3.3.
- Spark性能优化指南:基础篇前言在大数据计算领域,Spark已经成为了越来越流行、越来越受欢迎的计算平台之一。Spark的功能涵盖了大数据领域的离线批处理、SQL类处理、流式/实时计算、机器学习、图计算等各种不同类型的计算操作,应用范围与前景非常广泛。在美团?大众点评,已经有很多同学在各种项目中尝试使用Spark。大多数同学(包括笔者在内),最初开始尝试使用Spark的原因很简单,主要就是为了让大数据计算作业的执
- Spark性能优化指南:高级篇前言继基础篇讲解了每个Spark开发人员都必须熟知的开发调优与资源调优之后,本文作为《Spark性能优化指南》的高级篇,将深入分析数据倾斜调优与shuffle调优,以解决更加棘手的性能问题。数据倾斜调优调优概述有的时候,我们可能会遇到大数据计算中一个最棘手的问题——数据倾斜,此时Spark作业的性能会比期望差很多。数据倾斜调优,就是使用各种技术方案解决不同类型的数据
- Azkaban的AJAX的RestFul接口调用事例转自:http://blog.csdn.net/qq_20641565/article/details/72379506azkaban是一个开源的调度工具,可能需要自己修改源码或者自己调用azkaban后台提供的restFul接口进行定制化的开发,在azkaban的官方文档上有接口的详细文档,具体参考:http://azkaban.github.io/azkaban/docs/latest
- HBase安装配置HBase安装配置1:在某一台上解压hbase的压缩文件,如在192.168.2.100tar–zxvfhbase-1.2.6-bin.tar.gz?配置添加环境变量:#hbaseexportHBASE_HOME=/usr/tmp/hbase-1.2.6exportPATH=$PATH:$HBASE_HOME/bin?使环境变量生效source
- Flume 配置文件概述Flume常用配置总结
- 机器学习-模型评估与选择模型评估与选择错误率:E=a/mE=a/m训练误差|经验误差:学习器在训练集上的误差泛化误差:学习器在新样本上的误差评估方法留出法:将两个数据集DD划分成互斥的集合,其中一个作为训练集SS,另一个作为测试集TT。交叉验证法:将数据集DD划分成k个大小相似的互斥的数据集,每次用k-1个作为训练集,余下的作为测试集;这样获得k组结果,最终返回k组的测试结果的均值。(特别:数据集DD有m个样
- hadoop修改启动主机名称修改hadoop的主机名cd/usr/mysoft/hadoop-2.4.0/etc/hadoop/vimslaves修改为:xxxxxxx
- hadoop基础知识什么是hadoop?hadoop=tehhadoopprojectshadoop体系架构生态圈主要包含common,avro,mapreduce,hdfs,pig,hive(数据库),hbasezookeeper,oozie(任务调度),sqoop(数据转移hivemysql)组件hadoop核心:hdfs(分布式文件系统)+mapreduce
- 上传到dfs和hadoop统计计算启动和停止hadoop常用命令stop-all.shstart-all.shstart-dfs.shdatanode没有启动成功,删除格式化日志解决:1)删除“/usr/hadoop/tmp”里面的内容rm-rf/usr/hadoop/tmp/*2)删除“/tmp
- 大数据分析与应用的8个场景1、基于客户行为分析的产品推荐??产品推荐的一个重要方面是基于客户交易行为分析的交叉销售。根据客户信息、客户交易历史、客户购买过程的行为轨迹等客户行为数据,以及同一商品其他访问或成交客户的客户行为数据,进行客户行为的相似性分析,为客户推荐产品,包括浏览这一产品的客户还浏览了哪些产品、购买这一产品的客户还购买了哪些产品、预测客户还喜欢哪些产品等。产品推荐是Amazon的发明,它为Amazon
- ElasticSearch的分布式安装介绍:ElasticSearch是一个基于Lucene的搜索服务器。它提供了一个分布式多用户能力的全文搜索引擎,基于RESTfulweb接口。Elasticsearch是用Java开发的,并作为Apache许可条款下的开放源码发布,是当前流行的企业级搜索引擎。设计用于云计算中,能够达到实时搜索,稳定,可靠,快速,安装使用方便。安装过程:先去官网上下载最新的版本version:5.6.1,如图
- spark_RDD数据操作RDD数据操作RDD基础RDD是Spark对数据的核心抽象—弹性分布式数据集(ResilientDistributedDataSet)。RDD表示分布在多个计算节点上不可变的、可以并行操作的元素集合。Spark中对RDD的操作包括创建RDD,转化已有的RDD(transformation)以及调用RDD操作(action)进行求值。
- Spark如何读写hivehive数据表建立可以在hive上建立,或者使用hiveContext.sql(“createtable....)1)写入hive表caseclassPerson(name:String,col1:Int,col2:String)valsc=neworg.apache.spark.SparkContextvalhiveContext=neworg.a
- Spark中广播变量知识点为什么要使用广播变量,广播变量的好处及用法
- window操作系统搭建Spark开发调试环境1搭建环境前写个demo代码;2安装配置jdk1.8;3安装配置scala2.11.18;4导入pom.xml中依赖jar;5下载Hadoop的bin包,设定环境变量HADOOP_HOME,值为解压后的目录(http://hadoop.apache.org/releases.html下载);6下载winutils.exe将其放到$HADOOP_HOME/bin/目录
- Map/Reduce原理Hadoop简介Hadoop就是一个实现了Google云计算系统的开源系统,包括并行计算模型Map/Reduce,分布式文件系统HDFS,以及分布式数据库Hbase,同时Hadoop的相关项目也很丰富,包括ZooKeeper,Pig,Chukwa,Hive,Hbase,Mahout,flume等.这里详细分解这里面的概念让大家通过这篇文章了解到底是什么hadoop:
- Spark性能优化:数据倾斜调优转载地址:http://blog.csdn.net/u012102306/article/details/51556450前言??继《Spark性能优化:开发调优篇》和《Spark性能优化:资源调优篇》讲解了每个Spark开发人员都必须熟知的开发调优与资源调优之后,本文作为《Spark性能优化指南》的高级篇,将深入分析数据倾斜调优与shuffle调优,以解决更加棘手的性能
- Hadoop 和 Spark 的异同谈到大数据,相信大家对Hadoop和ApacheSpark这两个名字并不陌生。但我们往往对它们的理解只是提留在字面上,并没有对它们进行深入的思考,下面不妨跟我一块看下它们究竟有什么异同。一、解决问题的层面不一样??首先,Hadoop和ApacheSpark两者都是大数据框架,但是各自存在的目的不尽相同。Hadoop实质上更多是一个分布式数据基础设施:它将巨大的数据集分派到
- Spark性能优化:shuffle调优目录(?)[+]shuffle调优调优概述???大多数Spark作业的性能主要就是消耗在了shuffle环节,因为该环节包含了大量的磁盘IO、序列化、网络数据传输等操作。因此,如果要让作业的性能更上一层楼,就有必要对shuffle过程进行调优。但是也必须提醒大家的是,影响一个Spark作业性能的因素,主要还是代码开发、资源参数以及数据倾
- Spark源码分析之worker节点启动driver和executor一、启动driver1.首先在Master.scala类中执行schedule()方法,该方法主要有两个方法lanuchDriver()和launchExecutor()分别用来启动driver和executor。在master上面一旦可用资源发生变动或者有新的application提交进来之后就会调用该schedule()方法。2.先去调度所有的driver,针对这些applic
- flume 组件概述与列表Source列表:ComponentInterface(组件接口)TypeAlias(类型别名)ImplementationClass(实现类)org.apache.flume.Sourceavroorg.apache.flume.source.AvroSourceorg.apache.flume.Sourcenetcat