• linkedu视频
  • 平面设计
  • 电脑入门
  • 操作系统
  • 办公应用
  • 电脑硬件
  • 动画设计
  • 3D设计
  • 网页设计
  • CAD设计
  • 影音处理
  • 数据库
  • 程序设计
  • 认证考试
  • 信息管理
  • 信息安全
菜单
linkedu.com
导航菜单
  • 网页制作
  • 数据库
  • 程序设计
  • 操作系统
  • CMS教程
  • 游戏攻略
  • 脚本语言
  • 平面设计
  • 软件教程
  • 网络安全
  • 电脑知识
  • 服务器
  • 视频教程
  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx
您的位置:首页 > 服务器 >服务器运维 > Apache CarbonData快速入门指南

Apache CarbonData快速入门指南

作者:Coders的博客 字体:[增加 减小] 来源:互联网

本文主要包含存储,apache,carbondata等服务器相关知识,Coders的博客希望可以进行参考
CarbonData是由华为开发、开源并支持Apache Hadoop的列式存储文件格式,支持索引、压缩以及解编码等,
其目的是为了实现同一份数据达到多种需求,而且能够实现更快的交互查询。

 Follow the steps in CarbonData-Quick Start.

  • Put the *.csv file into HDFS, like:
cd carbondata
$ Create a sample.csv file using the following commands
$ put into hdfs, like: 'hdfs://presto00:9000/carbon/sample.csv'
  • Start spark, like:
$ ./sbin/start-master.sh
$ ./bin/spark-class org.apache.spark.deploy.worker.Worker spark://presto00:7077
  • Start spark-shell, like:
$ ./bin/spark-shell --jars ../carbondata-1.2.0/carbondata_2.11-1.2.0-SNAPSHOT-shade-hadoop2.7.3.jar --executor-memory 6G

Note: --executor-memory 6G setted for the java eap space, if the load data is not big, you can ignore it.

  • execute by scala, like:
$ import org.apache.spark.sql.SparkSession
$ import org.apache.spark.sql.CarbonSession._
$ val carbon = SparkSession.builder().config(sc.getConf).config(sc.getConf).getOrCreateCarbonSession("hdfs://presto00:9000//carbon/db")
$ carbon.sql("CREATE TABLE IF NOT EXISTS test(id string, name string, city string, age Int) STORED BY 'carbondata'")
$ carbon.sql("LOAD DATA INPATH 'hdfs://presto00:9000/carbon/sample.csv' INTO TABLE test options('DELIMITER'=',', 'FILEHEADER'='id,name,city,age')")

Note:
1. /carbon/db is the hdfs store path that tables stored.
2. CREATE TABLE defines the column and the type
3. 'DELIMITER'=',' or 'DELIMITER'='\t', to explain the separator of the data in the *.csv
4. LOAD DATA options rely on the header of the csv, like:

id,name,city,age
1,david,shenzhen,31
2,eason,shenzhen,27
3,jarry,wuhan,35

run:

$ carbon.sql("LOAD DATA INPATH 'hdfs://presto00:9000/carbon/sample.csv' INTO TABLE test")

1,david,shenzhen,31
2,eason,shenzhen,27
3,jarry,wuhan,35

run:

$ carbon.sql("LOAD DATA INPATH 'hdfs://presto00:9000/carbon/sample.csv' INTO TABLE test options('FILEHEADER'='id,name,city,age')")

More Usage

  • file like split by '\t':

    1 david shenzhen 31
    2 eason shenzhen 27
    3 jarry wuhan 35

  • must run:

$ carbon.sql("CREATE TABLE IF NOT EXISTS test(id string, name string, age Int) STORED BY 'carbondata'")
$ carbon.sql("LOAD DATA INPATH 'hdfs://presto00:9000/carbon/sample.csv' INTO TABLE test options('DELIMITER'='\t','FILEHEADER'='id,name,city,age')")

Note: CREATE TABLE do not need to contain all the column, but when LOAD DATA you must give all the header info, more to see in Programming Guide.

For any question, you can make comments followed.
分享到:QQ空间新浪微博腾讯微博微信百度贴吧QQ好友复制网址打印

您可能想查找下面的文章:

  • 简单易懂 服务器托管优势明显
  • 数据中心制冷选择 风冷液冷谁更佳?(1)
  • 如何在虚拟化环境下进行数据存储管理(1)
  • 五层安全措施保障iSCSI存储连接
  • 瘦身有道 主存储器数据缩减六大方法(1)
  • 使用媒体服务器和NAS简化文件共享(1)
  • 巧妙解决服务器虚拟化与存储管理问题
  • NAS与文件服务器有什么联系?(1)
  • 在SAN环境下部署虚拟服务器
  • 服务器数据丢失的紧急处理方法

相关文章

  • 实战:如何部署RemoteApp服务器(多图)(1)
  • 如何对服务器进行指定角色单独备份(1)
  • 理论实践完美结合 制作4位计算机图解(1)
  • 南北互通不用愁 双线解析DNS巧搭建
  • 邮件服务器管理员的痛楚
  • 最新服务器测试方法详细解析
  • 七个维护数据中心服务器安全的技巧
  • 服务器升级故障及其解决方法
  • Dell服务器故障排除两例
  • 如何在虚拟化环境下进行数据存储管理(1)

文章分类

  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx

最近更新的内容

    • 单台服务器并发百万级配置
    • 修复注册表,重连服务器
    • PC服务器的管理软件介绍
    • 工作必备:微软免费服务器工具下载大全(上)(1)
    • 容易混淆的“并发”概念
    • CPU制造过程大揭秘[图](1)
    • 跟我学 如何实现DNS集中解析
    • 钱不能乱花 中高端服务器采购六问(1)
    • 如何解决开源Web设备中的安全故障
    • 新外观新体验 戴尔T5600工作站评测(1)

关于我们 - 联系我们 - 免责声明 - 网站地图

©2020-2025 All Rights Reserved. linkedu.com 版权所有