• linkedu视频
  • 平面设计
  • 电脑入门
  • 操作系统
  • 办公应用
  • 电脑硬件
  • 动画设计
  • 3D设计
  • 网页设计
  • CAD设计
  • 影音处理
  • 数据库
  • 程序设计
  • 认证考试
  • 信息管理
  • 信息安全
菜单
linkedu.com
导航菜单
  • 网页制作
  • 数据库
  • 程序设计
  • 操作系统
  • CMS教程
  • 游戏攻略
  • 脚本语言
  • 平面设计
  • 软件教程
  • 网络安全
  • 电脑知识
  • 服务器
  • 视频教程
  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx
您的位置:首页 > 服务器 >云计算 > [Sqoop]将Mysql数据表导入到Hive,sqoophive

[Sqoop]将Mysql数据表导入到Hive,sqoophive

作者:网友 字体:[增加 减小] 来源:互联网

本文主要包含sqoop mysql hive,sqoop mysql导入hive,sqoop hive,sqoop增量导入hive,sqoop导入hive等服务器相关知识,网友希望可以进行参考

[Sqoop]将Mysql数据表导入到Hive,sqoophive


业务背景

mysql数据表YHD_CATEG_PRIOR结构如下:

-- Table "YHD_CATEG_PRIOR" DDL

CREATE TABLE `YHD_CATEG_PRIOR` (
  `category_id`                     int(11) NOT NULL COMMENT '类目ID',
  `category_name`                   varchar(250) DEFAULT NULL COMMENT '类目名称',
  `category_level`                  int(11) DEFAULT '0' COMMENT '类目级别',
  `default_import_categ_prior`      int(11) DEFAULT '0' COMMENT '默认引入优先级',
  `user_import_categ_prior`         int(11) DEFAULT NULL COMMENT '用户引入优先级',
  `default_eliminate_categ_prior`   int(11) DEFAULT NULL COMMENT '默认淘汰优先级',
  `user_eliminate_categ_prior`      int(11) DEFAULT NULL COMMENT '用户淘汰优先级',
  `UPDATE_TIME`                     timestamp NOT NULL DEFAULT CURRENT_TIMESTAMP ON UPDATE CURRENT_TIMESTAMP COMMENT '数据刷新时间',
  PRIMARY KEY (`category_id`)
) ENGINE=InnoDB AUTO_INCREMENT=61125 DEFAULT CHARSET=utf8;

现在需要将数据表YHD_CATEG_PRIOR导入到Hive中。

业务实现

脚本如下:

# 创建Hive数据表pms.yhd_categ_prior_user
hive -e "
set mapred.job.queue.name=pms;
set mapred.job.name=[CIS]yhd_categ_prior_user;

-- Hive DDL
DROP TABLE IF EXISTS pms.yhd_categ_prior_user;
CREATE TABLE pms.yhd_categ_prior_user
(
    category_id                     bigint,
    category_name                   string,
    category_level                  int,
    default_import_categ_prior      int,
    user_import_categ_prior         int,
    default_eliminate_categ_prior   int,
    user_eliminate_categ_prior      int,
    update_time                     string
)
ROW FORMAT DELIMITED FIELDS TERMINATED BY '\t' 
LINES TERMINATED BY '\n' 
STORED AS TEXTFILE;"

# 同步mysql的market.YHD_CATEG_PRIOR到hive中
hadoop fs -rmr /user/pms/YHD_CATEG_PRIOR 

sqoop import \
-Dmapred.job.queue.name=pms \
--connect jdbc:mysql://127.0.0.1:3306/market \
--username admin \
--password 123456 \
--table YHD_CATEG_PRIOR \
--hive-table pms.yhd_categ_prior_user \
--fields-terminated-by '\t' \
--lines-terminated-by '\n' \
--hive-overwrite \
--hive-drop-import-delims \
--hive-import 

上述的脚本工作流程:

  • 创建hive表pms.yhd_categ_prior_user
  • 利用sqoop将mysql表YHD_CATEG_PRIOR同步到hive表pms.yhd_categ_prior_user,导入后,hive表的字段以\t分隔,行以\n分隔,

实验结果

col_name    data_type   comment
# col_name              data_type               comment             

category_id             bigint                  None                
category_name           string                  None                
category_level          int                     None                
default_import_categ_prior  int                     None                
user_import_categ_prior int                     None                
default_eliminate_categ_prior   int                     None                
user_eliminate_categ_prior  int                     None                
update_time             string                  None                

# Detailed Table Information         
Database:               pms                      
Owner:                  pms                      
CreateTime:             Fri Jun 05 18:48:01 CST 2015     
LastAccessTime:         UNKNOWN                  
Protect Mode:           None                     
Retention:              0                        
Location:               hdfs://yhd-jqhadoop2.int.yihaodian.com:8020/user/hive/pms/yhd_categ_prior_user   
Table Type:             MANAGED_TABLE            
Table Parameters:        
    numFiles                5                   
    numPartitions           0                   
    numRows                 0                   
    rawDataSize             0                   
    totalSize               447779              
    transient_lastDdlTime   1433501435          

# Storage Information        
SerDe Library:          org.apache.hadoop.hive.serde2.lazy.LazySimpleSerDe   
InputFormat:            org.apache.hadoop.mapred.TextInputFormat     
OutputFormat:           org.apache.hadoop.hive.ql.io.HiveIgnoreKeyTextOutputFormat   
Compressed:             No                       
Num Buckets:            -1                       
Bucket Columns:         []                       
Sort Columns:           []                       
Storage Desc Params:      
  


 
分享到:QQ空间新浪微博腾讯微博微信百度贴吧QQ好友复制网址打印

您可能想查找下面的文章:

  • Linux、hive、sqoop常用脚本,hivesqoop
  • [Sqoop]利用sqoop对mysql执行DML操作,sqoopdml
  • [Sqoop]将Hive数据表导出到Mysql,sqoophive
  • [Sqoop]将Mysql数据表导入到Hive,sqoophive
  • 基于Hive及Sqoop的每日PV、UV、IP定时分析,hivesqoop

相关文章

  • hadoop1 & hadoop2 fair-schduler 配置和使用,hadoop
  • CDH5 hadoop-hive-habse单机版配置,hadoophivehbase
  • Elasticsearch之Nested Sorting,elasticsearch
  • 玩转OpenStack网络Neutron(1)--热身,openstackneutron
  • UcloudClient,icloud
  • hadoop2.7配置HA,使用zk和journal,hadoop2.7zk
  • Hadoop新版和旧版中InputSplit大小的区别,hadoopinputsplit
  • <转>云主机配置OpenStack使用spice的方法,openstackspice
  • 一步一步跟我学hadoop(1)----hadoop概述和安装配置,hadoop----hadoop
  • Ryu拓扑发现原理分析,Ryu拓扑原理分析

文章分类

  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx

最近更新的内容

    • Zookeeper常见问题整理,zookeeper常见问题
    • hive SymlinkTextInputFormat介绍及用法,textinputformat
    • Zookeeper 在Hadoop中的应用,zookeeperhadoop
    • hive UDF自动增长列函数,hiveudf列函数
    • openstack中glance组件images的所有python API 汇总,openstackglance
    • 一篇博文简单了解weka,博文简单weka
    • CDH集群集成kafka,cdh集群kafka
    • Hadoop之——伪分布安装,hadoop伪分布
    • Hadoop学习总结,hadoop总结
    • 开源微内核seL4 microkernel,sel4microkernel

关于我们 - 联系我们 - 免责声明 - 网站地图

©2020-2025 All Rights Reserved. linkedu.com 版权所有