• linkedu视频
  • 平面设计
  • 电脑入门
  • 操作系统
  • 办公应用
  • 电脑硬件
  • 动画设计
  • 3D设计
  • 网页设计
  • CAD设计
  • 影音处理
  • 数据库
  • 程序设计
  • 认证考试
  • 信息管理
  • 信息安全
菜单
linkedu.com
导航菜单
  • 网页制作
  • 数据库
  • 程序设计
  • 操作系统
  • CMS教程
  • 游戏攻略
  • 脚本语言
  • 平面设计
  • 软件教程
  • 网络安全
  • 电脑知识
  • 服务器
  • 视频教程
  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx
您的位置:首页 > 服务器 >服务器运维 > hiveserver2或sparksql和HApoxy远程服务的高可用和负载均衡

hiveserver2或sparksql和HApoxy远程服务的高可用和负载均衡

作者:jianchow 字体:[增加 减小] 来源:互联网

本文主要包含大数据,spark,hive等服务器相关知识,jianchow希望可以进行参考

pache Spark 现在是大数据中非常流行的处理引擎,简单的API、内存计算、很好的性能、一站式的解决方案、良好的生态,Spark是大数据中最火的明星AngelaBaby。在Spark内部的多个组件中,SQL组件也是很多公司用的最多的一个内部组件。由于Spark SQL并不适用于大并发的场景,所以在实际的生产过程中发现,由于SparkSQL并不能限制用户数,经常会有过多的用户以及过多的任务,导致Spark SQL 的Thrift Server服务非常不稳定。

 

这个问题在生产过程中非常实际,我们一般建议使用开源软件 HAProxy来解决,下面主要叙述一下具体的解决步骤;顺带一句HAproxy不仅可以解决Spark SQL的连接数,也可以用来用于部署Spark的HA。

 

安装

yum -y install gcc automake autoconf libtool make

 

至HAProxy的官网网站http://www.haproxy.org/下载最新版本的安装包haproxy-1.7.5.tar.gz。

 

[root@zdh223 ~]#tar zxvf haproxy-1.7.5.tar.gz

 

[root@zdh223 ~]#cd haproxy-1.7.5

 

[root@zdh223 ~]#make TARGET=zdh221

 

[root@zdh223 ~]#make install

 

安装结束。

 

在任意目录下执行 haproxy –vv 如果能正确显示haproxy的版本号,即表示安装正确。

 

配置

 

在haproxy-1.7.5目录下创建文件sparksql.cfg,文件名可以任意。内容如下:

 

global  
        daemon  
        nbproc 1  
        pidfile /opt/haproxy-1.4.24/haproxy.pid  
        ulimit-n 65535  
  
defaults  
        mode tcp                        #mode { tcp|http|health },tcp 表示4层,http表示7层,health仅作为健康检查使用  
        retries 2                       #尝试2次失败则从集群摘除  
        option redispatch               #如果失效则强制转换其他服务器  
        option abortonclose             #连接数过大自动关闭  
        maxconn 1024                    #最大连接数  
        timeout connect 1d              #连接超时时间,重要,hive查询数据能返回结果的保证  
        timeout client 1d               #同上  
       timeout server 1d               #同上  
        timeout check 2000              #健康检查时间  
        log 127.0.0.1 local0 err    #[err warning info debug]  
  
listen  admin_stats                     #定义管理界面  
        bind 0.0.0.0:8040               #管理界面访问IP和端口  
        mode http                       #管理界面所使用的协议  
        maxconn 10                  #最大连接数  
        stats refresh 30s               #30秒自动刷新  
        stats uri /                     #访问url  
        stats realm Hive\ Haproxy       #验证窗口提示  
        stats auth dc:dc         #401验证用户名密码  
  
listen hive             #hive后端定义  
        bind 0.0.0.0:10000              #ha作为proxy所绑定的IP和端口  
        mode tcp                        #以4层方式代理,重要  
        balance leastconn               #调度算法 'leastconn' 最少连接数分配,或者 'roundrobin',轮询分配  
        maxconn 1024                    #最大连接数  
        server hive_1 dc-dev004.dx.momo.com:10002 check inter 180000 rise 1 fall 2  
        server hive_2 dc-dev005.dx.momo.com:10002 check inter 180000 rise 1 fall 2  
        #释义:server 主机代名(你自己能看懂就行),IP:端口 每180000毫秒检查一次。也就是三分钟。  
        #hive每有10000端口的请求就会创建一个log,设置短了,/tmp下面会有无数个log文件,删不完。 

#释义:server 主机代名,IP:端口 每180000毫秒检查一次。也就是三分钟。

蓝色部分配置需要重点关注,视实际情况配置。

 

 

<
分享到:QQ空间新浪微博腾讯微博微信百度贴吧QQ好友复制网址打印

您可能想查找下面的文章:

  • 数据中心黄金法则:不要折腾你的电源(1)
  • 加拿大数据中心机柜、机架安装标准(1)
  • 大数据下的数据分析-Hadoop架构解析(1)
  • 数据中心是否是越冷越好?
  • “大数据”与“海量数据”有哪些区别?(1)
  • 盘点:数据中心的八大节能策略
  • 数据中心发展日记第二天:审批过程
  • 大数据错误是导致苹果地图失败的原因
  • 在Hadoop中保护大数据安全的9个技巧
  • 云计算可解决数据中心碳排放问题?

相关文章

  • HP打印服务器故障解决二
  • LCD KVM简化管理 推动数据中心管理模式改变
  • HP服务器故障排除实战
  • 浅析电子政务工程建设项目的建章立制
  • 不可不知的16个Linux服务器监控命令(1)
  • 经验之谈:浅析PowerVM在企业中的应用
  • 管理虚拟桌面与物理桌面存在很多差异
  • 十大特性 助企业升级到Server 2008 R2
  • 从淘宝“双11”看火车票订票网站的希望
  • 什么样的服务器让云发挥效率(1)

文章分类

  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx

最近更新的内容

    • 你了解机房该监控些什么吗?(1)
    • 绝对重口味 机房管理员“死亡笔记”(漫画)(1)
    • 走进IBM专家集成系统之PureFlex
    • 机房秘籍——数据中心“从一至十”(1)
    • 经验汇总:如何挑选1U机架式服务器机箱
    • 一开始就错了 虚拟化的初衷是安全可靠
    • 降低成本 十招让大型机物有所值(1)
    • 邮件服务器问题之邮件积压、传递延迟解决
    • 高手解答 如何远程重启服务器
    • 浅析UPS和EPS的主要区别

关于我们 - 联系我们 - 免责声明 - 网站地图

©2020-2025 All Rights Reserved. linkedu.com 版权所有