• linkedu视频
  • 平面设计
  • 电脑入门
  • 操作系统
  • 办公应用
  • 电脑硬件
  • 动画设计
  • 3D设计
  • 网页设计
  • CAD设计
  • 影音处理
  • 数据库
  • 程序设计
  • 认证考试
  • 信息管理
  • 信息安全
菜单
linkedu.com
导航菜单
  • 网页制作
  • 数据库
  • 程序设计
  • 操作系统
  • CMS教程
  • 游戏攻略
  • 脚本语言
  • 平面设计
  • 软件教程
  • 网络安全
  • 电脑知识
  • 服务器
  • 视频教程
  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx
您的位置:首页 > 服务器 >云计算 > 在spark上运行独立程序(Self-Contained Applications),selfcontained

在spark上运行独立程序(Self-Contained Applications),selfcontained

作者:网友 字体:[增加 减小] 来源:互联网

本文主要包含在spark上运行独立程序(Self-Contained Applications),selfcontained等服务器相关知识,网友希望可以进行参考

在spark上运行独立程序(Self-Contained Applications),selfcontained


在hadoop集群上搭好spark环境及体验spark shell之后可以重新做做官方的快速上手。

运行独立程序(SimpleApp.py):
首先编写程序(这里用Pytho的API):

from pyspark import SparkContext

logFile = "README.md" #注意这里的文件是在hdfs中的
sc = SparkContext("local","Simple App")
logData = sc.textFile(logFile).cache()

numAs = logData.filter(lambda s:'a' in s).count()
numBs = logData.filter(lambda s:'b' in s).count()

print "lines with a: %i,lines with b: %i" %(numAs,numBs)

然后进入spark安装目录运行:

hadoop@Mhadoop:/usr/local/spark/spark-1.3.1-bin-hadoop2.4$ vi /home/hadoop/Public/SimpleApp.py
hadoop@Mhadoop:/usr/local/spark/spark-1.3.1-bin-hadoop2.4$
./bin/spark-submit --master local
/home/hadoop/Public/SimpleApp.py

core spark concepts:

每一个spark应用都包含一个在集群上运行着多个并行操作的主驱动程序(driver program)。它包括你应用的main函数和在集群上定义的分布式数据集以及对他们的操作。比如在《spark-shell初体验》中的Driver Program就是Spark shell。

Driver Program连接集群是通过SparkContext对象,在shell中这个对象已经被创建,即 sc。一旦有了这个对象,你就可以用它创建分布式数据集RDDS。比如上面程序中的logData

为了运行这些操作,Driver Programs 管理着许多工作节点即executors。比如我们执行count()操作,不同的机器可能计算文件的不同部分。


版权声明:本文为博主原创文章,未经博主允许不得转载。

分享到:QQ空间新浪微博腾讯微博微信百度贴吧QQ好友复制网址打印

您可能想查找下面的文章:

  • 在spark上运行独立程序(Self-Contained Applications),selfcontained

相关文章

  • 胡振亮:原来这就是很多网站百度权重做不上去的原因,胡振亮重做
  • 我的hadoop2.4安装过程,hadoop2.4安装过程
  • 谈谈自己对随机森林(Random Forest)的一点理解以及代码注释~,randomforest
  • Elasticsearch之Nested Aggregation,elasticsearch
  • spark 查看 job history 日志,sparkjob
  • <转>Openstack Ceilometer监控项扩展,openstackceilometer
  • NOSQL(五)版本戳,nosql版本戳
  • MongoDB 安装与启动,MongoDB安装启动
  • mahout简介及安装配置
  • JOIN操作,数据库join操作

文章分类

  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx

最近更新的内容

    • hadoop集群搭建之NFS服务,hadoop集群nfs
    • 关于云服务器的瞎想,云服务器瞎想
    • Flume 配置文件概述
    • @RequestMapping的params参数 @RequestMapping(params = "method=save"),requestmapping
    • Hadoop源代码分析(三七),hadoop源代码
    • libvirt 部分API 介绍,libvirtapi
    • 《转》Ubuntu14.04 openstack juno配置之 ceilometer遥测模块安装配置,《转》ubuntu14.04
    • hadoop 运行jar文件,
    • MapReduce排序及实例,MapReduce排序实例
    • NOSQL(二)聚合数据模型,nosql聚合数据模型

关于我们 - 联系我们 - 免责声明 - 网站地图

©2020-2025 All Rights Reserved. linkedu.com 版权所有