• linkedu视频
  • 平面设计
  • 电脑入门
  • 操作系统
  • 办公应用
  • 电脑硬件
  • 动画设计
  • 3D设计
  • 网页设计
  • CAD设计
  • 影音处理
  • 数据库
  • 程序设计
  • 认证考试
  • 信息管理
  • 信息安全
菜单
linkedu.com
导航菜单
  • 网页制作
  • 数据库
  • 程序设计
  • 操作系统
  • CMS教程
  • 游戏攻略
  • 脚本语言
  • 平面设计
  • 软件教程
  • 网络安全
  • 电脑知识
  • 服务器
  • 视频教程
  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx
您的位置:首页 > 服务器 >虚拟化 > 使用docker快速搭建Spark集群的方法教程

使用docker快速搭建Spark集群的方法教程

作者:RavenZZ 字体:[增加 减小] 来源:互联网

本文主要包含docker,搭建spark集群,docker,spark,集群,docker搭建spark等服务器相关知识,RavenZZ 希望可以进行参考

前言

Spark 是 Berkeley 开发的分布式计算的框架,相对于 Hadoop 来说,Spark 可以缓存中间结果到内存而提高某些需要迭代的计算场景的效率,目前收到广泛关注。下面来一起看看使用docker快速搭建Spark集群的方法教程。

适用人群

  • 正在使用spark的开发者
  • 正在学习docker或者spark的开发者

准备工作

  • 安装docker
  • (可选)下载java和spark with hadoop

Spark集群

Spark运行时架构图


如上图: Spark集群由以下两个部分组成

  • 集群管理器(Mesos, Yarn或者standalone Mode)
  • 工作节点(worker)

如何docker化(本例使用Standalone模式)

1、将spark集群拆分

      base(基础镜像)

      master(主节点镜像)

      worker(工作镜像)

2、编写base Dockerfile

注: 为方便切换版本基础镜像选择的是centos, 所以要下载java和spark, 方便调试, 可以下载好安装文件后本地搭建一个静态文件服务器, 使用Node.js 的http-server可以快速搞定

命令如下

 npm install http-server -g
 http-server -p 54321 ~/Downloads

正式开始写Dockerfile

FROM centos:7
MAINTAINER RavenZZ <raven.zhu@outlook.com>

# 安装系统工具
RUN yum update -y
RUN yum upgrade -y
RUN yum install -y byobu curl htop man unzip nano wget
RUN yum clean all

# 安装 Java
ENV JDK_VERSION 8u11
ENV JDK_BUILD_VERSION b12
# 如果网速快,可以直接从源站下载
#RUN curl -LO "http://download.oracle.com/otn-pub/java/jdk/$JDK_VERSION-$JDK_BUILD_VERSION/jdk-$JDK_VERSION-linux-x64.rpm" -H 'Cookie: oraclelicense=accept-securebackup-cookie' && rpm -i jdk-$JDK_VERSION-linux-x64.rpm; rm -f jdk-$JDK_VERSION-linux-x64.rpm;
RUN curl -LO "http://192.168.199.102:54321/jdk-8u11-linux-x64.rpm" && rpm -i jdk-$JDK_VERSION-linux-x64.rpm; rm -f jdk-$JDK_VERSION-linux-x64.rpm;
ENV JAVA_HOME /usr/java/default
RUN yum remove curl; yum clean all
WORKDIR spark

RUN \
 curl -LO 'http://192.168.199.102:54321/spark-2.1.0-bin-hadoop2.7.tgz' && \
 tar zxf spark-2.1.0-bin-hadoop2.7.tgz

RUN rm -rf spark-2.1.0-bin-hadoop2.7.tgz
RUN mv spark-2.1.0-bin-hadoop2.7/* ./

ENV SPARK_HOME /spark
ENV PATH /spark/bin:$PATH
ENV PATH /spark/sbin:$PATH

3、编写master Dockerfile

FROM ravenzz/spark-hadoop

MAINTAINER RavenZZ <raven.zhu@outlook.com>

COPY master.sh /

ENV SPARK_MASTER_PORT 7077
ENV SPARK_MASTER_WEBUI_PORT 8080
ENV SPARK_MASTER_LOG /spark/logs

EXPOSE 8080 7077 6066

CMD ["/bin/bash","/master.sh"]

4、编写worker Dockerfile

 FROM ravenzz/spark-hadoop

 MAINTAINER RavenZZ <raven.zhu@outlook.com> 
 COPY worker.sh /

 ENV SPARK_WORKER_WEBUI_PORT 8081
 ENV SPARK_WORKER_LOG /spark/logs
 ENV SPARK_MASTER "spark://spark-master:32769"

 EXPOSE 8081

 CMD ["/bin/bash","/worker.sh"]

5、docker-compose

 version: '3'

services:
 spark-master:
 build:
 context: ./master
 dockerfile: Dockerfile
 ports:
 - "50001:6066"
 - "50002:7077" # SPARK_MASTER_PORT
 - "50003:8080" # SPARK_MASTER_WEBUI_PORT
 expose:
 - 7077

 spark-worker1:
 build:
 context: ./worker
 dockerfile: Dockerfile
 ports:
 - "50004:8081"
 links:
 - spark-master
 environment:
 - SPARK_MASTER=spark://spark-master:7077

 spark-worker2:
 build:
 context: ./worker
 dockerfile: Dockerfile
 ports:
 - "50005:8081"
 links:
 - spark-master
 environment:
 - SPARK_MASTER=spark://spark-master:7077

6、测试集群

docker-compose up

访问http://localhost:50003/ 结果如图


参考链接

本例源代码

本地下载:点击这里

总结

以上就是这篇文章的全部内容了,希望本文的内容对大家的学习或者工作能带来一定的帮助,如果有疑问大家可以留言交流,谢谢大家对的支持。

您可能感兴趣的文章:

  • Docker构建ELK Docker集群日志收集系统
  • 详解从 0 开始使用 Docker 快速搭建 Hadoop 集群环境
  • 详解使用docker搭建hadoop分布式集群
  • 详解docker搭建redis集群的环境搭建
  • docker搭建rabbitmq集群环境的方法
  • 详解使用docker 1.12 搭建多主机docker swarm集群
  • 在Ubuntu 16.04上用Docker Swarm和DigitalOcean创建一个Docker容器集群的方法
  • Docker使用Swarm组建集群的方法
  • docker 搭建hadoop以及hbase集群详解
  • docker swarm 集群故障与异常详解
  • ubuntu docker搭建Hadoop集群环境的方法
  • Docker集群的创建与管理实例详解
分享到:QQ空间新浪微博腾讯微博微信百度贴吧QQ好友复制网址打印

您可能想查找下面的文章:

  • Docker实践8:Compose,docker实践compose
  • Docker buildx构建多平台镜像并推送到私有仓库的方法
  • Docker三个基本概念镜像(Image)容器(Container)仓库(Repository)
  • 什么是Docker?为什么要使用Docker
  • docker 开源的应用容器引擎
  • 如何给docker设置http代理
  • docker官方mysql镜像自定义配置详解
  • 详解Docker数据管理(数据卷&数据卷容器)
  • 如何利用Docker容器实现代理转发与数据备份详解
  • 详解Docker Swarm 在持续集成测试中的应用

相关文章

  • ubuntu kylin虚拟机中安装KVM
  • 使用Docker run的选项以覆盖Dockerfile中的设置详解
  • 解决执行docker daemon命令时出错的问题
  • Docker端口映射的实现
  • Docker三个基本概念镜像(Image)容器(Container)仓库(Repository)
  • VMware10.0.7安装centos6.3,连接xshell
  • docker实现导出、导入和数据搬迁
  • Docker探索namespace详解
  • VMware虚拟机三种网络模式区别
  • 不使用sudo 执行Docker命令的方法

文章分类

  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx

最近更新的内容

    • 详解通过Docker搭建Mysql容器+Tomcat容器连接环境
    • Virtualbox安装配置方法图文教程
    • docker daemon远程连接设置详解
    • docker 动态映射运行的container端口实例详解
    • CloudStack 安装及使用过程中常见问题汇总
    • Docker镜像上传到阿里云的步骤详解
    • 开源技术促服务器虚拟化市场持续升温
    • Docker中的镜像详细介绍
    • 详解如何完整卸载Docker Toolbox
    • 详解Docker数据管理(数据卷&数据卷容器)

关于我们 - 联系我们 - 免责声明 - 网站地图

©2020-2025 All Rights Reserved. linkedu.com 版权所有