• linkedu视频
  • 平面设计
  • 电脑入门
  • 操作系统
  • 办公应用
  • 电脑硬件
  • 动画设计
  • 3D设计
  • 网页设计
  • CAD设计
  • 影音处理
  • 数据库
  • 程序设计
  • 认证考试
  • 信息管理
  • 信息安全
菜单
linkedu.com
导航菜单
  • 网页制作
  • 数据库
  • 程序设计
  • 操作系统
  • CMS教程
  • 游戏攻略
  • 脚本语言
  • 平面设计
  • 软件教程
  • 网络安全
  • 电脑知识
  • 服务器
  • 视频教程
  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx
您的位置:首页 > 服务器 >云计算 > hive grouping sets 和 cube 用法,hivegrouping

hive grouping sets 和 cube 用法,hivegrouping

作者:网友 字体:[增加 减小] 来源:互联网

本文主要包含hive grouping sets,grouping sets,oracle grouping sets,grouping,grouping函数等服务器相关知识,网友希望可以进行参考

hive grouping sets 和 cube 用法,hivegrouping


  • grouping sets 和cube基本知识。

    基础知识可参考 http://blog.csdn.net/mashroomxl/article/details/22578471

    grouping sets 适用于多维度统计,可以代替之前lateral view explode 方式

    cube 相当于grouping sets 所有条件组合。

    平时跑临时需求看数据,也可以用cube。比如看某款游戏android,ios,_NONE的数量,很方便可以用一个sql写。

  • grouping sets 与lateral view explode方式比较

    结论:map和reducer数一样,在运算速度上差距也不大,但写法会比较简单。

  • cube 使用碰到的情况

    当>=5个维度且聚合中用了distinct,会报如下错误

    An additional MR job is introduced since the cardinality of grouping sets is more than hive.new.job.grouping.set.cardinality.
    This functionality is not supported with distincts.
    Either set hive.new.job.grouping.set.cardinality to a high number (higher than the number of rows per input row due to grouping sets in the query),
    or rewrite the query to not use distincts. The number of rows per input row due to grouping sets is 32 (state=42000,code=10226)

    解决方法:如错误日志描述给出的解决方法,可以通过修改 hive.new.job.grouping.set.cardinality 配置,或者在聚合中不用distinct来解决。

    目前我们采用后者这个方式,可以通过在子查询中用group by去重,避免在聚合中用到distinct。

版权声明:本文为博主原创文章,未经博主允许不得转载。

分享到:QQ空间新浪微博腾讯微博微信百度贴吧QQ好友复制网址打印

您可能想查找下面的文章:

  • hive grouping sets 和 cube 用法,hivegrouping

相关文章

  • hadoop2.x HDFS快照介绍,hadoop2.xhdfs快照
  • 系统监控软件Ganglia的安装,监控软件ganglia
  • MapReduce之RecordReader组件源码解析及实例,mapreduce实例
  • 一步一步跟我学习hadoop(4)----hadoop Map/Reduce教程(1),hadoop----hadoop
  • Andrew Ng机器学习课程9-补充,andrew9-
  • hive 优化的原则,hive优化原则
  • 2015.6.5,2015.6.5世界环境日
  • getRequestDispatcher()与sendRedirect()的区别,request.sendredirect
  • 超人学院Hadoop大数据资源分享,超人学院hadoop分享
  • 【Spark1.3官方翻译】Spark快速入门,spark1.3spark

文章分类

  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx

最近更新的内容

    • CDH集群中YARN的参数配置,cdh集群yarn参数
    • CentOS6.5系统下Hadoop2.6.0完全分布式环境安装与配置信息介绍,centos6.5hadoop2.6
    • solr实战-(一),solr实战
    • spark一些入门资料,spark入门资料
    • <转>Openstack ceilometer 宿主机监控模块扩展,openstackceilometer
    • Hadoop之——正常启动而无法正常关闭,hadoop无法正常关闭
    • 分布式系列,分布式系统
    • 《2》CentOS7.0+OpenStack+kvm云平台部署—配置Keystone,centos7.0kvm
    • 深入理解Scala 标识符,命名和域,深入理解scala
    • Spark如何读写hive

关于我们 - 联系我们 - 免责声明 - 网站地图

©2020-2025 All Rights Reserved. linkedu.com 版权所有