• linkedu视频
  • 平面设计
  • 电脑入门
  • 操作系统
  • 办公应用
  • 电脑硬件
  • 动画设计
  • 3D设计
  • 网页设计
  • CAD设计
  • 影音处理
  • 数据库
  • 程序设计
  • 认证考试
  • 信息管理
  • 信息安全
菜单
linkedu.com
导航菜单
  • 网页制作
  • 数据库
  • 程序设计
  • 操作系统
  • CMS教程
  • 游戏攻略
  • 脚本语言
  • 平面设计
  • 软件教程
  • 网络安全
  • 电脑知识
  • 服务器
  • 视频教程
  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx
您的位置:首页 > 服务器 >云计算 > LinkedIn Cubert安装指南,linkedincubert

LinkedIn Cubert安装指南,linkedincubert

作者:网友 字体:[增加 减小] 来源:互联网

本文主要包含cubert,cubert uhd185,cubert gmbh,德国cubert,启闭机安装指南等服务器相关知识,网友希望可以进行参考

LinkedIn Cubert安装指南,linkedincubert


最近工作需要,调研了一下LinkedIn开源的用于复杂大数据分析的高性能计算引擎Cubert。自己测了下,感觉比较适合做报表统计中的Cube计算和Join计算,效率往往比Hive高很多倍,节省资源和时间。

下面看下这个框架的介绍:

Cubert完全用Java开发,并提供一种脚本语言。它是针对报表领域里经常出现的复杂连接和聚合而设计的。Cubert使用MeshJoin算法处理大时间窗口下的大数据集,CPU和内存利用率显著提升。CUBE是Cubert定义的一个新操作符,可以计算累加和非累加分析维度。非累加维度是计算密集型的,如计算一个时间窗口内不同的用户数,但CUBE能加快这些运算,而且还可以计算准确的百分等级,如中位数统计,动态上卷内部维度以及在单个任务中计算多个度量值。

Cubert最适合于重复的报表工作流程,它利用部分结果缓存和增量处理技术来提高速度。最后,一种新的稀疏矩阵乘法算法可以用于大型图的分析计算。

项目地址在:https://github.com/linkedin/Cubert

一、Git Clone

首先Fork到我的github上。然后,
克隆项目

git clone git@github.com:OopsOutOfMemory/Cubert.git ./cubert

配置环境变量:

注意CUBERT_HOME是在cubert/release后bin目录也在release下。

export HADOOP_HOME=/Users/shengli/cloudera/${CDH}/hadoop
export CUBERT_HOME=/Users/shengli/git_repos/cubert/release

二、编译打包:

指定Hadoop的版本号:

vim ./gradle.properties
修改 hadoopVersion=2.5.0

编译打包

Cubert是基于Gradle进行构建的,所以要执行./gradlew来进行编译导报

shengli-mac$ ./gradlew 
:genParser
:compileJava
warning: Supported source version 'RELEASE_6' from annotation processor 'org.antlr.v4.runtime.misc.NullUsageProcessor' less than -source '1.8'
Note: Some input files use or override a deprecated API.
Note: Recompile with -Xlint:deprecation for details.
Note: Some input files use unchecked or unsafe operations.
Note: Recompile with -Xlint:unchecked for details.
1 warning
:processResources UP-TO-DATE
:classes
:jar
:dist

BUILD SUCCESSFUL

cubert包

shengli-mac$ ll release/lib/
total 12488
-rw-r--r--  1 shengli  staff  6392989 Jun 11 14:15 cubert-0.2.21.jar

配置环境变量

将$CUBERT_HOME/bin配置到PATH内,然后:

shengli-mac$ cubert -h
Using HADOOP_CLASSPATH=:/Users/shengli/git_repos/cubert/release/lib/*
usage: ScriptExecutor <cubert script file> [options]
 -c,--compile                 stop after compilation
 -d,--debug                   print debuging information
 -D <property=value>          use value for given property
 -describe                    describe the schemas of output datasets
 -f,--param_file <file>       use given parameter file
 -h,--help                    shows this message
 -j,--json                    show the plan in JSON
 -p,--parse                   stop after parsing
 -P,--cache_path <lib path>   classpath to be uploaded to distributed
                              cache
 -parallel                    run independent jobs in parallel
 -perf                        enable performance profiling
 -s,--preprocess              show the script after preprocessing
 -x <job id/name>             execute this job only

三、Cubert Example

预处理:

 shengli-mac$ cat release/examples/word
wordcount.cmr  words.txt      
shengli-mac$ cat release/examples/wordcount.cmr 
PROGRAM "Word Count";

JOB "count words"
    REDUCERS 5;
    MAP {
        data = LOAD "$CUBERT_HOME/examples/words.txt" USING TEXT("schema": "STRING word");
        with_count = FROM data GENERATE word, 1L AS count;
    }
    SHUFFLE with_count PARTITIONED ON word AGGREGATES COUNT(word) AS count;
    REDUCE {
        counted = GROUP with_count BY word AGGREGATES SUM(count) AS count;
    }
    STORE counted INTO "output" USING TEXT();
END
分享到:QQ空间新浪微博腾讯微博微信百度贴吧QQ好友复制网址打印

您可能想查找下面的文章:

  • Understanding Cubert Concepts(二)Co-Partitioned Blocks,partitioned
  • LinkedIn Cubert 实践指南,linkedincubert
  • Understanding Cubert Concepts 之 BLOCK(一),cubertconcepts
  • LinkedIn Cubert安装指南,linkedincubert

相关文章

  • Hadoop之——正常启动而无法正常关闭,hadoop无法正常关闭
  • 2015 OpenCloud峰会总结,2015opencloud峰会
  • 云服务器之间实时文件同步和文件备份的最简单高效的免费方案,实时文件备份
  • Spark性能优化指南:基础篇
  • 大数据学习笔记3--HDFS扩展和mapreduce工作过程,3--hdfsmapreduce
  • CentOS 下面解决libvirt版本过低、升级冲突问题,centoslibvirt
  • 云计算: ERP未来必然趋势,erp未来
  • spark on yarn的cpu使用,sparkonyarncpu
  • Storm简述及集群安装,Storm简述集群安装
  • Redis源码学习:字符串,redis源码字符串

文章分类

  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx

最近更新的内容

    • openstack 用nova API 指定 compute node 创建 instance,openstackcompute
    • HDP 2.2.4 Hue Oozie Editor生成workflow.xml的几点问题,oozieworkflow.xml
    • hadoop2.7配置HA,使用zk和journal,hadoop2.7zk
    • 联想台式机启天m4350 启用intel vt-x,m4350vt-x
    • Scala非值类型,Scala值类型
    • Hive 合并输入输出文件,
    • 一步一步跟我学习hadoop(3)----hadoop命令手册,hadoop----hadoop
    • -bash:jps:command not found,-bashjps
    • python 操作 azure 虚拟机,pythonazure
    • Oxygen xml editor 16.0 x86 crack,oxygen16.0

关于我们 - 联系我们 - 免责声明 - 网站地图

©2020-2025 All Rights Reserved. linkedu.com 版权所有