• linkedu视频
  • 平面设计
  • 电脑入门
  • 操作系统
  • 办公应用
  • 电脑硬件
  • 动画设计
  • 3D设计
  • 网页设计
  • CAD设计
  • 影音处理
  • 数据库
  • 程序设计
  • 认证考试
  • 信息管理
  • 信息安全
菜单
linkedu.com
导航菜单
  • 网页制作
  • 数据库
  • 程序设计
  • 操作系统
  • CMS教程
  • 游戏攻略
  • 脚本语言
  • 平面设计
  • 软件教程
  • 网络安全
  • 电脑知识
  • 服务器
  • 视频教程
  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx
您的位置:首页 > 服务器 >云计算 > Spark编程指南V1.4.0(翻译),编程指南v1.4.0

Spark编程指南V1.4.0(翻译),编程指南v1.4.0

作者:网友 字体:[增加 减小] 来源:互联网

本文主要包含银行大厅v1.4.0,语音v1.4.0,v1.4.0 安卓版,vcp v1.4.0 setup,vcp v1.4.0等服务器相关知识,网友希望可以进行参考

Spark编程指南V1.4.0(翻译),编程指南v1.4.0


Spark编程指南V1.4.0

·        简介

·        接入Spark

·        Spark初始化

        ·        使用Shell

        ·        在集群上部署代码

·        弹性分布式数据集

        ·        并行集合(Parallelized Collections)

        ·        其他数据集

        ·        RDD的操作

                 ·        基础操作

                 ·        向Spark传递函数

                 ·        处理键值对

                 ·        转换

                 ·        动作

        ·        RDD的持久化

                 ·        存储级别的选择

                 ·        移除数据

·        共享变量

        ·        广播变量

        ·        累加器

·        部署到一个集群上

·        单元测试

·        从1.0之前版本的Spark迁移

·        下一步该怎么做

 

简介

总的来说,每一个Spark的应用,都是由一个驱动程序(driver program)构成,它运行用户的main函数,在一个集群上执行各种各样的并行操作。Spark提出的最主要抽象概念是弹性分布式数据集 (resilientdistributed dataset,RDD),它是一个元素集合,划分到集群的各个节点上,可以被并行操作。RDDs的创建可以从HDFS(或者任意其他支持Hadoop文件系统)上的一个文件开始,或者通过转换驱动程序(driver program)中已存在的Scala集合而来。用户也可以让Spark保留一个RDD在内存中,使其能在并行操作中被有效的重复使用。最后,RDD能自动从节点故障中恢复。

Spark的第二个抽象概念是共享变量(shared variables),可以在并行操作中使用。在默认情况下,Spark通过不同节点上的一系列任务来运行一个函数,它将每一个函数中用到的变量的拷贝传递到每一个任务中。有时候,一个变量需要在任务之间,或任务与驱动程序之间被共享。Spark支持两种类型的共享变量:广播变量,可以在内存的所有的结点上缓存变量;累加器:只能用于做加法的变量,例如计数或求和。

本指南将用每一种Spark支持的语言来展示这些特性。这都是很容易来跟着做的如果你启动了Spark的交互式Shell或者Scala的bin/spark-shell或者Python的bin/pyspark。

 

接入Spark

Scala

Spark1.2.1需要和Scala2.10一起使用。如果你要用Scala来编写应用,你需要用一个相应版本的Scala(例如2.10.X)。

要写一个Spark应用程序,你需要在添加Spark的Maven依赖,Spark可以通过Maven中心库来获得:

[html] view plaincopy
  1. groupId = org.apache.spark  
  2. artifactId = spark-core_2.10  
  3. version = 1.2.1  

除此之外,如果你想访问一个HDFS集群,你需要根据你的HDFS版本,添加一个hadoop-client的依赖。一些通用的HDFS版本标签在第三方发行版页面列出。

[html] view plaincopy
  1. groupId = org.apache.hadoop  
  2. artifactId = hadoop-client  
  3. version = <your-hdfs-version
分享到:QQ空间新浪微博腾讯微博微信百度贴吧QQ好友复制网址打印

您可能想查找下面的文章:

  • Spark编程指南V1.4.0(翻译),编程指南v1.4.0
  • Spark编程指南V1.4.0(翻译),编程指南v1.4.0

相关文章

  • 配置tomcat默认项目,tomcat默认项目
  • Hbase集群扩展,hbase集群
  • Hadoop之——自定义分组比较器实现分组功能,hadoop分组
  • hadoop-2.6.0安装(new),hadoop-2.6.0new
  • HDFS小文件的合并优化
  • hive优化-----控制hive任务的reduce数,hivereduce
  • myeclipse2013 建的web项目没有web.xml,myeclipse中web.xml
  • 如何解决Greenplum master node与seg node元数据不一致,greenplumseg
  • Spark学习笔记之浅释,spark学习笔记
  • spark on yarn的cpu使用,sparkonyarncpu

文章分类

  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx

最近更新的内容

    • 关于云服务器的瞎想,云服务器瞎想
    • -bash:jps:command not found,-bashjps
    • Java 调用Hive 自定义UDF,java调用hiveudf
    • 有关微软技术方向的最新学习资源【2015-9月】,学习资源2015-9
    • spark streaming kafka1.4.1中的低阶api createDirectStream使用总结,directstream
    • MapReduce实现倒排索引,mapreduce实现索引
    • pig里面没有if:不能判断一个条件后决定一个执行步骤,pigif
    • Spark On Yarn 详细配置流程
    • Java MapReduce详解--(3),mapreduce详解
    • OpenStack Magnum 项目简介,openstackmagnum

关于我们 - 联系我们 - 免责声明 - 网站地图

©2020-2025 All Rights Reserved. linkedu.com 版权所有