• linkedu视频
  • 平面设计
  • 电脑入门
  • 操作系统
  • 办公应用
  • 电脑硬件
  • 动画设计
  • 3D设计
  • 网页设计
  • CAD设计
  • 影音处理
  • 数据库
  • 程序设计
  • 认证考试
  • 信息管理
  • 信息安全
菜单
linkedu.com
导航菜单
  • 网页制作
  • 数据库
  • 程序设计
  • 操作系统
  • CMS教程
  • 游戏攻略
  • 脚本语言
  • 平面设计
  • 软件教程
  • 网络安全
  • 电脑知识
  • 服务器
  • 视频教程
  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx
您的位置:首页 > 服务器 >云计算 > Spark编程指南V1.4.0(翻译),编程指南v1.4.0

Spark编程指南V1.4.0(翻译),编程指南v1.4.0

作者:网友 字体:[增加 减小] 来源:互联网

本文主要包含银行大厅v1.4.0,语音v1.4.0,v1.4.0 安卓版,vcp v1.4.0 setup,vcp v1.4.0等服务器相关知识,网友希望可以进行参考

Spark编程指南V1.4.0(翻译),编程指南v1.4.0


Spark编程指南V1.4.0

·        简介

·        接入Spark

·        Spark初始化

        ·        使用Shell

        ·        在集群上部署代码

·        弹性分布式数据集

        ·        并行集合(Parallelized Collections)

        ·        其他数据集

        ·        RDD的操作

                 ·        基础操作

                 ·        向Spark传递函数

                 ·        处理键值对

                 ·        转换

                 ·        动作

        ·        RDD的持久化

                 ·        存储级别的选择

                 ·        移除数据

·        共享变量

        ·        广播变量

        ·        累加器

·        部署到一个集群上

·        单元测试

·        从1.0之前版本的Spark迁移

·        下一步该怎么做

 

简介

总的来说,每一个Spark的应用,都是由一个驱动程序(driver program)构成,它运行用户的main函数,在一个集群上执行各种各样的并行操作。Spark提出的最主要抽象概念是弹性分布式数据集 (resilientdistributed dataset,RDD),它是一个元素集合,划分到集群的各个节点上,可以被并行操作。RDDs的创建可以从HDFS(或者任意其他支持Hadoop文件系统)上的一个文件开始,或者通过转换驱动程序(driver program)中已存在的Scala集合而来。用户也可以让Spark保留一个RDD在内存中,使其能在并行操作中被有效的重复使用。最后,RDD能自动从节点故障中恢复。

Spark的第二个抽象概念是共享变量(shared variables),可以在并行操作中使用。在默认情况下,Spark通过不同节点上的一系列任务来运行一个函数,它将每一个函数中用到的变量的拷贝传递到每一个任务中。有时候,一个变量需要在任务之间,或任务与驱动程序之间被共享。Spark支持两种类型的共享变量:广播变量,可以在内存的所有的结点上缓存变量;累加器:只能用于做加法的变量,例如计数或求和。

本指南将用每一种Spark支持的语言来展示这些特性。这都是很容易来跟着做的如果你启动了Spark的交互式Shell或者Scala的bin/spark-shell或者Python的bin/pyspark。

 

接入Spark

Scala

Spark1.2.1需要和Scala2.10一起使用。如果你要用Scala来编写应用,你需要用一个相应版本的Scala(例如2.10.X)。

要写一个Spark应用程序,你需要在添加Spark的Maven依赖,Spark可以通过Maven中心库来获得:

groupId = org.apache.spark
artifactId = spark-core_2.10
version = 1.2.1

除此之外,如果你想访问一个HDFS集群,你需要根据你的HDFS版本,添加一个hadoop-client的依赖。一些通用的HDFS版本标签在第三方发行版页面列出。

groupId = org.apache.hadoop
artifactId = hadoop-client
version = <your-hdfs-version>

最后,你需要将一些Spark的类和隐式转换导入到你的程序中。通过如下语句:

import org.apache.spark.SparkContext
import org.apache.spark.SparkContext._
import org.apache.spark.SparkConf

 

Java

Spark1.2.1需要运行在Java6及更高版本上。如果你正在使用Java8,Spark支持使用Lambda表达式简洁地编写函数,或者你可以使用在org.apache.spark.api.java.function包中的类。

要使用Java编写Spark应用程序,你需要添加一个Spark的依赖。Spark可以通过Maven中心库获得:

groupId = org.apache.spark
artifactId = spark-core_2.10
version = 1.2.1

此外,如果你想访问一个HDFS集群

分享到:QQ空间新浪微博腾讯微博微信百度贴吧QQ好友复制网址打印

您可能想查找下面的文章:

  • Spark编程指南V1.4.0(翻译),编程指南v1.4.0
  • Spark编程指南V1.4.0(翻译),编程指南v1.4.0

相关文章

  • Elasticsearch之Nested Aggregation,elasticsearch
  • 机器学习数学基础- gradient descent算法(上),gradientdescent
  • pagerank算法的MapReduce实现,pagerankmapreduce
  • Openstack中为虚拟机使用CDROM光驱设备,openstackcdrom
  • Kafka集群安装,kafka集群
  • Hadoop 1.x的Shuffle源码分析之2,hadoopshuffle
  • Elasticsearch 之 Facet,elasticsearchfacet
  • Hive 合并输入输出文件,
  • 【解决】 CentOS6.6安装CM5.4的问题,centos6.6cm5.4
  • spark-OutOfMemory:GC overhead limit exceeded 解决,timelimitexceeded

文章分类

  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx

最近更新的内容

    • HDFS小文件的合并优化
    • Nova client源码分析---nova list命令,nova---nova
    • Linux索引节点(Inode:no space for device)用满导致的一次故障,linuxinode
    • Install Docker on Mac OS X,installdocker
    • 如何在coding.net上部署项目 (Flask),coding.netflask
    • 《5》CentOS7.0+OpenStack+kvm云平台部署—配置Horizon,《5》kvm
    • (Kilo)Devstack Kilo版本localrc推荐,devstacklocalrc
    • 一步一步跟我学习hadoop(4)----hadoop Map/Reduce教程(1),hadoop----hadoop
    • Greenplum数据库升级实务(上),greenplum实务
    • R语言数据分析系列之一,数据分析系列之一

关于我们 - 联系我们 - 免责声明 - 网站地图

©2020-2025 All Rights Reserved. linkedu.com 版权所有