• linkedu视频
  • 平面设计
  • 电脑入门
  • 操作系统
  • 办公应用
  • 电脑硬件
  • 动画设计
  • 3D设计
  • 网页设计
  • CAD设计
  • 影音处理
  • 数据库
  • 程序设计
  • 认证考试
  • 信息管理
  • 信息安全
菜单
linkedu.com
导航菜单
  • 网页制作
  • 数据库
  • 程序设计
  • 操作系统
  • CMS教程
  • 游戏攻略
  • 脚本语言
  • 平面设计
  • 软件教程
  • 网络安全
  • 电脑知识
  • 服务器
  • 视频教程
  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx
您的位置:首页 > 服务器 >云计算 > 孙其功陪你学之——Spark 正则化和SparkSQL,孙其功sparksql

孙其功陪你学之——Spark 正则化和SparkSQL,孙其功sparksql

作者:网友 字体:[增加 减小] 来源:互联网

本文主要包含孙其功,spark,spark是什么意思,spark星火英语官网,spark教程等服务器相关知识,网友希望可以进行参考

孙其功陪你学之——Spark 正则化和SparkSQL,孙其功sparksql


本博文程序是读取hadoop的hdfs中的文件,使用正则化解析出规定格式的数据,然后加载到sparkSQL数据库中。

正则化如果不太了解,请看正则表达式30分钟入门教程

文件内容大致为:

CREATE TABLE IF NOT EXISTS `rs_user` (
  `id` mediumint(8) unsigned NOT NULL AUTO_INCREMENT,
  `uid` mediumint(8) unsigned DEFAULT NULL,
  `url` varchar(255) DEFAULT NULL,
  `title` varchar(1024) DEFAULT NULL,
  PRIMARY KEY (`id`)
) ENGINE=InnoDB  DEFAULT CHARSET=gbk AUTO_INCREMENT=59573 ;

INSERT INTO `rs_user` (`id`, `uid`, `url`, `title`) VALUES
(1, 269781, 'http://rs.xidian.edu.cn/forum.php?mod=viewthread&tid=721360', '[体育][其他][2002年亚运会羽毛球男单决赛 陶菲克vs李炫一][rmvb][国语]'),
(2, 256188, 'http://rs.xidian.edu.cn/forum.php?mod=viewthread&tid=721360', '[体育][其他][2002年亚运会羽毛球男单决赛 陶菲克vs李炫一][rmvb][国语]'),

package com.spark.firstApp

import org.apache.spark.SparkContext
import org.apache.spark._
import org.apache.log4j.{Level, Logger}

object HelloSpark {
  case class Person(id:Int,uid:String,url:String,title:String)
  def main(args:Array[String]): Unit = {
    Logger.getLogger("org.apache.spark").setLevel(Level.WARN)
    Logger.getLogger("org.eclipse.jetty.server").setLevel(Level.OFF)//去除log日志
    val conf = new SparkConf().setAppName("HelloSpark")
    val sc = new SparkContext(conf)
    val sqlContext = new org.apache.spark.sql.SQLContext(sc)
    import sqlContext.implicits._
    val r = """\d*, \d*, 'http://[a-z/.?&=0-9]*', '[^']+'""".r
    val data=sc.textFile("/user/root/home/rs_user.sql").map(s=>s.mkString).
    map(z=>r.findAllIn(z).toList).filter(_.length>0).map(_.head.split(", ").toList)
    val people=data.map(p=>Person(p(0).toInt,p(1),p(2),p(3))).toDF()
    people.registerTempTable("people")
    val teen=sqlContext.sql("SELECT title from people where uid='199988'")
    teen.map(t => "title: " + t).collect().foreach(println)
    sc.stop()
  }

}

提交任务:

root@Master:/# spark-submit --master spark://192.168.0.10:7077 --class com.spark.firstApp.HelloSpark --executor-memory 100m /root/IdeaProjects/FirstSparkApp/out/artifacts/FirstSparkAppJar/FirstSparkAppJar.jar 

输出结果:

Spark assembly has been built with Hive, including Datanucleus jars on classpath
15/04/15 21:53:56 INFO slf4j.Slf4jLogger: Slf4jLogger started
15/04/15 21:53:56 INFO Remoting: Starting remoting
15/04/15 21:53:57 INFO Remoting: Remoting started; listening on addresses :[akka.tcp://sparkDriver@Master:52584]
15/04/15 21:53:57 INFO server.Server: jetty-8.y.z-SNAPSHOT
15/04/15 21:53:57 INFO server.AbstractConnector: Started SocketConnector@0.0.0.0:54183
15/04/15 21:54:03 INFO server.Server: jetty-8.y.z-SNAPSHOT
15/04/15 21:54:03 INFO server.AbstractConnector: Started SelectChannelConnector@0.0.0.0:4040
15/04/15 21:54:12 WARN util.SizeEstimator: Failed to check whether UseCompressedOops is set; assuming yes
15/04/15 21:54:21 WARN util.NativeCodeLoader: Unable to load native-hadoop library for your platform... using builtin-java classes where applicable
15/04/15 21:54:21 WARN snappy.LoadSnappy: Snappy native library not loaded
15/04/15 21:54:21 INFO mapred.FileInputFormat: Total input paths to process : 1
title: ['[其他][视频][LOL][微笑卷毛1月13号双排三场合集][微笑卷毛解说][mp4]']    
title: ['[其他][视频][LOL][SMZ24解说:S5盲僧李青的全场gank之旅_高清][SMZ24解说][mp4]']


分享到:QQ空间新浪微博腾讯微博微信百度贴吧QQ好友复制网址打印

您可能想查找下面的文章:

  • 孙其功陪你学之——Spark 正则化和SparkSQL,孙其功sparksql

相关文章

  • Storm中Trident流合并的例子demo,stormtrident
  • 机器学习基础,学习基础
  • MapReduce处理二次排序(分区-排序-分组),mapreduce二次
  • 两款Docker管理UI:DockerUI & Shipyard,dockerdockerui
  • 浅谈大数据,浅谈数据
  • python模块,python
  • spark core源码分析16 Shuffle详解-读流程,sparkshuffle
  • 每日定时导入hive数据仓库的自动化脚本,hive数据仓库脚本
  • openstack--计算节点安装(Node),openstack--node
  • Spark开发指南,spark指南

文章分类

  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx

最近更新的内容

    • 【甘道夫】Spark1.3.0 Submitting Applications 官方文档精华摘要,spark1.3
    • hadoop集群扩展,hadoop集群
    • Andrew Ng Machine Learning,andrewlearning
    • 微软平台开发技术蓝图,微软平台蓝图
    • libvirt网络过滤规则:禁止客户机(bridge方式)连接外网,libvirtbridge
    • HDFS小文件的合并优化
    • Strom实时计算--简述,strom实时--
    • HDFS命令行接口详解,hdfs命令行详解
    • hadoop权威指南(第四版)要点翻译(1)——Foreword and Preface,hadoopforeword
    • 豆瓣Redis解决方案Codis源码剖析:Dashboard,rediscodis

关于我们 - 联系我们 - 免责声明 - 网站地图

©2020-2025 All Rights Reserved. linkedu.com 版权所有